跳到正文
原文
Hugging Face Blog·· 2024-06-12AI 评分48

Hugging Face TRL 推出 RLOO Trainer,把强化学习重新带回 RLHF

Putting RL back in RLHF

AI 导读

Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 之外的在线 RLHF 训练算法。

来源:Hugging Face Blog · huggingface.co