Actor-Critic Policy Benchmark for Robot Manipulation是一个面向机器人操作的演员-评论家策略基准测试。该基准包含多种操作任务,提供了标准化的演员-评论家策略训练和评估协议。基准测试了PPO、SAC、TD3、DDPG、A2C等演员-评论家算法在任务成功率、数据效率、训练稳定性方面的表现,评估指标包括任务成功率、数据效率、训练稳定性、超参数敏感性、样本复杂度。来源机构包括Google Robotics、UC Berkeley、OpenAI等。