Hugging Face Blog·· 2022-12-09精选AI 评分62
图解 RLHF:从预训练、奖励模型到 PPO 微调
Illustrating Reinforcement Learning from Human Feedback (RLHF)
AI 导读
Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。
推荐理由
把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。
来源:Hugging Face Blog · huggingface.co