Hugging Face Blog·· 2026-01-27AI 评分38
解锁 GPT-OSS 的智能体 RL 训练:一次实践复盘
Unlocking Agentic RL Training for GPT-OSS: A Practical Retrospective
AI 导读
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。
来源:Hugging Face Blog · huggingface.co