跳到正文
原文
Hugging Face Blog·· 2025-08-07精选AI 评分60

TRL 为视觉语言模型加入 MPO、GRPO、GSPO 等对齐方法

Vision Language Model Alignment in TRL ⚡️

AI 导读

Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。

推荐理由

TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。

来源:Hugging Face Blog · huggingface.co