Hugging Face Blog·· 2025-08-07精选AI 评分60
TRL 为视觉语言模型加入 MPO、GRPO、GSPO 等对齐方法
Vision Language Model Alignment in TRL ⚡️
AI 导读
Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。
推荐理由
TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。
来源:Hugging Face Blog · huggingface.co