Hugging Face Blog·· 2023-04-05精选AI 评分62
StackLLaMA:用 RLHF 训练 LLaMA 的实操指南
StackLLaMA: A hands-on guide to train LLaMA with RLHF
AI 导读
Hugging Face 发布 StackLLaMA 模型并公开完整 RLHF 训练流程,涵盖监督微调、奖励建模和基于 PPO 的强化学习三个阶段,全部代码集成在 TRL 库中。
推荐理由
完整走通 SFT、奖励模型与 PPO 三段 RLHF 流程,并给出 8bit 加 LoRA 在单卡上复现的配置与踩坑记录。
来源:Hugging Face Blog · huggingface.co