跳到正文
原文
Hugging Face Blog·· 2023-04-05精选AI 评分62

StackLLaMA:用 RLHF 训练 LLaMA 的实操指南

StackLLaMA: A hands-on guide to train LLaMA with RLHF

AI 导读

Hugging Face 发布 StackLLaMA 模型并公开完整 RLHF 训练流程,涵盖监督微调、奖励建模和基于 PPO 的强化学习三个阶段,全部代码集成在 TRL 库中。

推荐理由

完整走通 SFT、奖励模型与 PPO 三段 RLHF 流程,并给出 8bit 加 LoRA 在单卡上复现的配置与踩坑记录。

来源:Hugging Face Blog · huggingface.co