跳到正文
原文
Hugging Face Blog·· 2023-08-08精选AI 评分62

用 DPO 微调 Llama 2:TRL 库实践教程

Fine-tune Llama 2 with DPO

AI 导读

Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并给出用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B 的完整流程。

推荐理由

Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自己的偏好数据上复现对齐训练。

来源:Hugging Face Blog · huggingface.co