跳到正文
原文
Hugging Face Blog·· 2024-07-10AI 评分34

Hugging Face TRL 库新增 VLM 的 DPO 偏好优化支持

Preference Optimization for Vision Language Models

AI 导读

Hugging Face 的 TRL 库现已支持对视觉语言模型(VLM)进行直接偏好优化(DPO),并给出基于 Idefics2-8b 的完整训练教程。示例使用包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset,DPO 实现同时支持 Llava 1.5 和 PaliGemma。文章还测算了 8B 模型全参数训练约需 160GB 显存,需借助量化等技术才能跑通。

来源:Hugging Face Blog · huggingface.co