跳到正文
原文
Hugging Face Blog·· 2025-04-26AI 评分57

ServiceNow 开源 PipelineRL:用 inflight 权重更新提升 LLM 强化学习吞吐

PipelineRL

AI 导读

ServiceNow 开源实验性 RL 实现 PipelineRL,通过训练中 inflight 权重更新,在不停推理的前提下持续保持最优 batch size,缓解高吞吐推理与 on-policy 数据采集之间的取舍。

来源:Hugging Face Blog · huggingface.co