学术前沿

Training language models to follow instructions with human feedback

InstructGPT 用 RLHF 对齐 GPT-3,使模型按人类指令生成更有用回答。

论文

主体信息

InstructGPT 用 RLHF 对齐 GPT-3,使模型按人类指令生成更有用回答。