Hugging Face Blog·· 2023-08-08精选AI 评分62
用 DPO 微调 Llama 2:TRL 库实践教程
Fine-tune Llama 2 with DPO
AI 导读
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并给出用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B 的完整流程。
推荐理由
Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自己的偏好数据上复现对齐训练。
来源:Hugging Face Blog · huggingface.co