Hugging Face Blog·· 2026-05-07AI 评分34
vLLM V0 到 V1 迁移:RL 训练中先对齐正确性再改目标
vLLM V0 to V1: Correctness Before Corrections in RL
AI 导读
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:processed_logprobs 语义、V1 专属运行时默认值、inflight 权重更新路径,以及最终投影所用的 fp32 lm_head。
来源:Hugging Face Blog · huggingface.co