SAC最大熵off-policy强化学习算法,机器人学习事实标准。
Sergey Levine 是加州大学伯克利分校 EECS 副教授,BAIR/RAIL 核心 PI。斯坦福博士(Vladlen Koltun 指导),研究方向覆盖深度强化学习、离线 RL 与机器人学习,提出 Guided Policy Search、Soft Actor-Crit