跳到正文
原文
OpenAI News·· 2020-09-04AI 评分48

OpenAI 用人类反馈强化学习训练摘要模型

Learning to summarize with human feedback

AI 导读

OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其摘要能力得到提升。

来源:OpenAI News · openai.com