Granite 4.1 LLM 是如何构建的:IBM 公开五阶段预训练与多阶段 RL 细节
IBM Granite 团队公开了 Granite 4.1 系列稠密 LLM(3B、8B、30B)的完整训练流程,模型在约 15T token 上从零训练,采用五阶段预训练管线,上下文窗口最终扩展至 512K token。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
IBM Granite 团队公开了 Granite 4.1 系列稠密 LLM(3B、8B、30B)的完整训练流程,模型在约 15T token 上从零训练,采用五阶段预训练管线,上下文窗口最终扩展至 512K token。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算岛屿并在其间异步传输数据,从而隔离局部硬件故障。
推荐理由:Google DeepMind 披露 Decoupled DiLoCo 的异步训练架构,读者可了解跨数据中心训练在带宽与容错上的取舍。
Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中蒸馏高层推理模式的智能体记忆框架,代码已开源。
推荐理由:论文给出 ReasoningBank 的记忆蒸馏机制与 WebArena、SWE-Bench-Verified 上的成功率与步数变化,可据此判断智能体记忆方向的做法差异。
Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使长时程规划更稳健。
Google Research 发布论文《Reasoning-Driven Synthetic Data Generation and Evaluation》。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,在保留的小鼠轴突上把重建误差降低 4.4%,主要来自 merge error 的减少。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单跟踪、政策问答、捆绑规划和多意图旅程 8 个可验证环境。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评测 AI 智能体的组合推理与多步工作流执行能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域并配有领域文档,任务需 3-7 步推理链,包含 API Chaining、Tool Selection、Multi-Hop Reasoning 等四项任务,模型整体表现不佳。
Google Research 推出 ConvApparel,一个包含超 4,000 段人机多轮对话(近 15,000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文方法章节生成出版级图表,ScholarPeer 则自动评审论文。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。
Google Research 发布研究《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,指出 AI 评测常用的每项 1-5 名标注者往往不足,要反映人类意见差异常需每项超过 10 名标注者。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后扩展到 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
Google Quantum AI 发布白皮书,给出破解 256 位椭圆曲线离散对数问题(ECDLP-256)的更新资源估算:两个 Shor 算法量子电路分别使用不到 1。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的更新资源估算,并说明用零知识证明确认结论的披露方式。
Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具包,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度逾 1 万名参与者,开展九项研究,聚焦金融与健康等高风险场景;结果显示 AI 在健康话题上的有害操纵效果最弱,且某一领域的成功无法预测另一领域。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,读者可了解其研究设计与公开材料。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 上展示。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度下把 KV cache 压到 3 bit,读者可了解其压缩思路与实测收益。
Google Research 发布自监督框架 S2Vec,将道路、建筑等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、房价等指标。
Hugging Face 发布端到端语音智能体评估框架 EVA,首次同时打分任务成功率(EVA-A)与对话体验(EVA-X),并开源含 50 个航司场景的数据集。对 20 个级联与音频原生系统的基准测试显示,准确率与体验之间存在一致的权衡:任务完成得好的智能体,用户体验往往更差。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的独立读片与双读流程数据,可了解落地条件。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,读者可据此了解中美份额与小型模型的实际使用格局。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用 10 项认知能力(感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知)衡量 AI 向 AGI 的进展,并配套三阶段评估协议。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由国际专家小组按六项指标盲评打分。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 中驱动输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中抽取结构化灾害事件数据,首个开放数据集收录 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其人工核验准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊初级保健就诊前为患者采集病史,由医生通过视频实时监督。
推荐理由:Google 与 BIDMC 首次把 AMIE 放进真实门诊流程做前瞻性可行性研究,读者可看到安全监督机制与盲评结果。
OpenAI 发布 IH-Challenge,用于训练模型优先执行可信指令,从而改进指令层级、安全可控性和对提示词注入攻击的抵抗能力。
推荐理由:OpenAI 公开 IH-Challenge 训练方法,读者可了解指令层级与提示词注入防御的一条技术路径。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。
推荐理由:Google Research 联合非洲高校发布 27 种语言的开放语音数据集,可了解低资源语音数据的采集方法与许可条件。
OpenAI 提出 CoT-Control,发现推理模型难以控制自身的思维链,这反而强化了可监控性作为 AI 安全保障的价值。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手的预测,从而学会概率推理。在五轮模拟航班推荐任务中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升了该任务表现,还能泛化到其他任务。
一篇新预印本将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析了 310 条 ITBench SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
Google Research 提出 MapTrace,一套可扩展的合成数据生成流程,用于训练多模态大模型在地图上追踪路径,并开源了基于 Gemini 2.5 Pro 和 Imagen-4 生成的 200 万问答对。
OpenAI 发布新预印本,显示 GPT-5.2 为胶子振幅提出一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。
Google Research 发布开源原型框架 DialogLab,用于创作、模拟和测试动态的人机群组对话,相关论文在 ACM UIST 2025 展示。该框架将对话的社交设定与时间流程解耦,通过"创作-测试-验证"三阶段工作流支持多参与方、角色分组与打断规则配置。
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型迁移用于鲸类发声分类。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 在数学、物理和计算机科学领域解决专业研究问题。
推荐理由:DeepMind 公开了两篇论文与数学研究智能体 Aletheia 的细节,读者可据此了解 AI 参与研究级数学与理论计算机科学的实际边界。
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练中顺序、自适应地挑选最佳组件,把子集选择直接融入训练流程,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并已用于特征选择等真实场景,兼顾效率、准确率、可解释性与大规模扩展能力。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,覆盖单智能体与独立、集中、去中心化、混合四种多智能体架构,以及 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准。
推荐理由:通过 180 组智能体配置的对照评测,给出多智能体架构何时增益、何时拖累性能的量化规律。
Google Research 发布 ATLAS(自适应迁移缩放律),用于指导多语言模型的模型规模、数据量与语言配比选择,论文将在 ICLR 2026 展示。该研究基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据和 48 种语言评测,并给出 1,400 对语言之间的迁移关系矩阵。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。