学术前沿

Active Preference-Based Learning of Reward Functions

主动询问人类偏好学习奖励函数,降低人机交互成本。

论文

主体信息

主动询问人类偏好学习奖励函数,降低人机交互成本。