硅基参考
首页
机器人产品
零配件
评测
论文
开源
数据集
实验室组织
专家人物
行业资讯
具身智能论文库
Training language models to follow instructions with human feedback
学术前沿
Training language models to follow instructions with human feedback
InstructGPT 用 RLHF 对齐 GPT-3,使模型按人类指令生成更有用回答。
返回列表
新窗口打开 PDF
arXiv 摘要页
论文
主体信息
InstructGPT 用 RLHF 对齐 GPT-3,使模型按人类指令生成更有用回答。