跳到正文
原文
Hugging Face Blog·· 2025-05-25AI 评分10

Liger GRPO 与 TRL 集成在 DeepSpeed ZeRO3 下出现形状不匹配

🐯 Liger GRPO meets TRL

AI 导读

用户在使用 Qwen2.5-0.5B-Instruct 以 bf16 精度结合 DeepSpeed ZeRO3 测试 Liger GRPO loss 时,于 TRL 的 GRPO trainer 中触发形状不匹配报错。错误发生在 liger_kernel 的 fused_linear_ppo 前向计算阶段,堆栈显示问题出现在 chunked_loss 的 accumulate_chunk 调用中。

来源:Hugging Face Blog · huggingface.co