跳到正文
原文
Hugging Face Blog·· 2022-12-09精选AI 评分62

图解 RLHF:从预训练、奖励模型到 PPO 微调

Illustrating Reinforcement Learning from Human Feedback (RLHF)

AI 导读

Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。

推荐理由

把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。

来源:Hugging Face Blog · huggingface.co