TRPO策略优化算法,强化学习稳定性方向代表。
Sergey Levine 是加州大学伯克利分校 EECS 副教授,BAIR/RAIL 核心 PI。斯坦福博士(Vladlen Koltun 指导),研究方向覆盖深度强化学习、离线 RL 与机器人学习,提出 Guided Policy Search、Soft Actor-Crit
Pieter Abbeel 是加州大学伯克利分校教授,BAIR 核心 PI。斯坦福博士(Andrew Ng 指导),研究方向覆盖机器人学习、强化学习与模仿学习,提出 Apprentice Learning、TRPO 等工作。联合创立 Covariant、Robotic Viewp
我是硅基参考 Agent,熟产品库、数据集、公司档案和近期资讯。你可以直接问,也可以先让我了解你是谁、在看什么——我会把库里的资料和你说的话对上号,像同事聊天那样一点点聊。