Hugging Face Blog·· 2025-01-31精选AI 评分62
Mini-R1:用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment
Mini-R1: Reproduce Deepseek R1 „aha moment“ a RL tutorial
AI 导读
Hugging Face 博客发布 Mini-R1 教程,用 GRPO 和 Countdown Game 在 Qwen2.5-3B-Instruct 上复现 DeepSeek R1 的 aha moment。
推荐理由
完整复现流程与训练观察记录,可看到小模型在 GRPO 下从文字推理转向程序化求解的过程。
来源:Hugging Face Blog · huggingface.co