跳到正文
原文
Hugging Face Blog·· 2026-04-29精选AI 评分62

Granite 4.1 LLM 是如何构建的:IBM 公开五阶段预训练与多阶段 RL 细节

Granite 4.1 LLMs: How They’re Built

AI 导读

IBM Granite 团队公开了 Granite 4.1 系列稠密 LLM(3B、8B、30B)的完整训练流程,模型在约 15T token 上从零训练,采用五阶段预训练管线,上下文窗口最终扩展至 512K token。

推荐理由

Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。

来源:Hugging Face Blog · huggingface.co