GPT-6 家族模型选型指南
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备 workflows。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备 workflows。
前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其链式思考仍由同一套 next-token 预测产生,并非真正独立的推理机制。他认为这类模型缺乏可检视的持久认知状态、知识与推理的分离,且链式思考常是事后编造,因此主张借鉴 AlphaGo 的游戏树搜索架构来构建真正的机器推理能力。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了其 RLM(递归语言模型)工作:基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。他还讨论了 AI 生成 GPU 内核、harness 作为组合泛化器、Prime Agent 与持久化子智能体,以及 OpenAI 万级智能体实验、Kimi 集群等方向。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 在 Stratego 对局中以 15 胜 1 负 4 平击败被认为是有史以来最强的 Stratego 选手 Pim Niemeijer。
一篇综述系统梳理了机器人领域的世界-动作模型(WAM),其核心是将未来状态预测与可执行动作生成连接起来,让预测服务于真实控制。综述将现有研究归纳为基于世界模型的强化学习、视频生成、潜在动作预训练和 VLA 模型四条路线,并覆盖机器人操作、导航、自动驾驶等应用及未来挑战。
何恺明团队提出纯视觉 ARC 解题方案 NAT-ARC,不依赖 LLM,用 ImageNet 上的 MAE 预训练初始化视觉编码器,表现最好的 0.6B 单模型在 ARC-1 上取得 63.4% pass@2,集成三种预训练策略后达 70.2%,总参数量约 2B,专门微调的 8B LLM 方案 The ARChitects 为 71.6%。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Michael Levin 提出"Platonic mindspace"假说,认为心智是非物理模式,身体与机器只是这些模式进入物理世界的接口,并用 xenobots、anthrobots 及排序算法扰动实验作为佐证。本期 Import AI 还讨论了太空 TPU 与智谱启动外层 RSI 循环,并指出机器人领域正等待自己的 LLM 时刻,但尚缺通用算法。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅使部署模型参数量增加 8.9%,并首日支持 llama.cpp、MLX-VLM 和 SGLang。
TypeSafe AI 发布 Jev,这是其称为 System One 模型的新类别,输入文本后不返回文本,而是返回对应类别、是/否问题、评分的浮点数及置信度。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐倍数与 99% 扩展效率,可作推理基础设施选型的量化参照。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,绕过了数百个 CoT 推理 token 的测试时开销,论文已被 ICML 2026 收录。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。
推荐理由:Granite 4.2 公开了从预训练到多阶段 RL 的完整构建流程,可对照其数据配比与奖励设计理解推理模型的训练取舍。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复方法,并附9项基准对比,可看4-bit模型反超16-bit来源的具体条件。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升吞吐,GPU 上最高 3.18 倍、端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三个 LFM2.5 模型的 DSpark 草稿模型与 H100、MacBook 实测吞吐数据,可据此判断投机解码在端侧与 GPU 上的实际收益。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
微软研究院发布 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。
Google Research 发布研究,提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并构建含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以取用而非未存储。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核知识迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核经验迁移到 Apple Silicon,读者可看到跨平台内核优化的具体方法与实测数字。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以缓解递归摘要带来的性能损失。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的开源多模态 MoE 模型,同时发布 276B 总参数 12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与多模态评测数据,可据此判断开源大模型在长上下文与多模态推理上的进展。
加州大学伯克利分校 BAIR 实验室展示 2026 届博士毕业生,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。
Google Research 提出一种新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在 Pixel 9 和 10 系列上实现开箱即用的加速。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何在内存受限下提速。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:推理 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。
Hugging Face 发布系列文章,分析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:processed_logprobs 语义、V1 专属运行时默认值、inflight 权重更新路径,以及最终投影所用的 fp32 lm_head。
Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使长时程规划更稳健。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 上展示。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度下把 KV cache 压到 3 bit,读者可了解其压缩思路与实测收益。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 中驱动输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手的预测,从而学会概率推理。在五轮模拟航班推荐任务中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升了该任务表现,还能泛化到其他任务。
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练中顺序、自适应地挑选最佳组件,把子集选择直接融入训练流程,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并已用于特征选择等真实场景,兼顾效率、准确率、可解释性与大规模扩展能力。
Google Research 回顾 2025 年成果:Gemini 3 成为其最强、最注重事实准确性的 LLM,在 SimpleQA Verified 和与 Google DeepMind、Kaggle 联合发布的新 FACTS 基准上达到 SOTA。
Google Research 为 STOC 2026 推出实验性 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 的推理扩展方法,在投稿后 24 小时内为作者生成结构化预审反馈,涵盖论文贡献摘要、潜在错误与改进建议以及笔误清单。
推荐理由:Google 官方披露 PAT 在 STOC 2026 的实测数据与作者反馈,可了解 AI 辅助数学证明审阅的实际边界。
Google Research 发布两篇论文,提出 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。
推荐理由:Google Research 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
Google Research 在 NeurIPS 2025 论文《Nested Learning: The Illusion of Deep Learning Architectures》中提出 Nested Learning,把模型架构与优化算法视为同一套相互嵌套、同时优化的多层级学习问题,以缓解持续学习中的灾难性遗忘。