Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅使部署模型参数量增加 8.9%,并首日支持 llama.cpp、MLX-VLM 和 SGLang。
TypeSafe AI 发布 Jev,这是其称为 System One 模型的新类别,输入文本后不返回文本,而是返回对应类别、是/否问题、评分的浮点数及置信度。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。
推荐理由:Granite 4.2 公开了从预训练到多阶段 RL 的完整构建流程,可对照其数据配比与奖励设计理解推理模型的训练取舍。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升吞吐,GPU 上最高 3.18 倍、端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三个 LFM2.5 模型的 DSpark 草稿模型与 H100、MacBook 实测吞吐数据,可据此判断投机解码在端侧与 GPU 上的实际收益。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的开源多模态 MoE 模型,同时发布 276B 总参数 12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与多模态评测数据,可据此判断开源大模型在长上下文与多模态推理上的进展。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数 6B 激活参数的模型,在形式化验证上大幅升级,miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 达 87%、FATE-X 达 34%。
推荐理由:官方给出 Leanstral 1.5 在形式化验证基准上的成绩与开源入口,读者可据此判断其在 Lean 4 证明工程中的可用性。
Google Research 提出一种新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在 Pixel 9 和 10 系列上实现开箱即用的加速。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何在内存受限下提速。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的开放权重与硬件门槛,读者可据此判断本地低并发推理的适用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于端侧 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
IBM Granite 团队公开了 Granite 4.1 系列稠密 LLM(3B、8B、30B)的完整训练流程,模型在约 15T token 上从零训练,采用五阶段预训练管线,上下文窗口最终扩展至 512K token。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 把长上下文成本压到 V3.2 的零头,读者可据此判断智能体长任务部署的可行性。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合并进单一开源模型,并给出与 GPT-OSS 120B 的输出长度对比,便于判断效率取舍。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:原文给出价格、速度与基准数据,读者可据此判断高并发场景下的成本与延迟取舍。
OpenAI 公开了其 AI 模型针对 First Proof 数学挑战的证明尝试,用于测试模型在专家级问题上的研究级推理能力。该挑战聚焦研究级数学推理,OpenAI 未披露具体模型名称与成绩。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的更强核心推理模型,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 得分与多端上线范围,可据此判断新模型在复杂推理任务上的位置。
OpenAI 发布新预印本,显示 GPT-5.2 为胶子振幅提出一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题,已在 Gemini 应用中向 Google AI Ultra 订阅用户开放,并首次通过 Gemini API 向部分研究者、工程师和企业提供早期访问。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩与开放入口,可据此判断其科研与工程定位。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 提到 256K 并新增轨迹与 OCR 能力,可据此判断物理 AI 视觉推理的可用边界。
TII 发布 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三个参数版本,采用在每个 block 内并行运行 Mamba 状态空间模型与 Transformer 注意力的 Falcon-H1 混合架构。
推荐理由:原文给出三个参数规模的架构、上下文窗口与基准对比,可据此判断阿拉伯语模型的部署选型。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟和成本结合,定价为每 100 万输入 token 0.50 美元、每 100 万输出 token 3 美元。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断它在速度与成本上的取舍。
Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,首发 Gemini 3 Pro 预览版,并同步上线 Gemini 应用、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新的智能体开发平台 Google Antigravity。
推荐理由:官方一次性给出 Gemini 3 Pro 与 Deep Think 的基准成绩、产品落地范围和开放入口,可据此判断能力代际变化。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Numina 与 Kimi 团队发布定理证明模型 Kimina-Prover-72B,基于 Qwen2.5-72B 和 Kimi k1.5 的 RL 流程训练,在 miniF2F 基准上取得 92.2% 的 SOTA 通过率。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,在 11T tokens 上训练,支持 think / no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:官方完整公开了 3B 模型的预训练、中训练与后训练配方,读者可据此复现或迁移到自研小模型。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开 AIME2024 成绩与多语言推理定位,可据此判断其与现有推理模型的差异。
Falcon-LLM 团队发布 Falcon-H1 系列开源模型,共六款,参数规模从 0.5B 到 34B,每款均含 base 与 instruct 版本,采用 Apache 2.0 许可。
推荐理由:Falcon-H1 用混合注意力与 SSM 架构在长上下文吞吐上取得明显优势,读者可据此判断小参数模型的部署取舍。
IBM 联合普林斯顿、CMU 和 UIUC 发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。在 vLLM 中,该模型相比标准 Transformer 实现 2.5 倍吞吐提升和 2 倍延迟加速,并已支持 transformers、vLLM、TRL 和 llama.cpp。
阿布扎比技术创新研究院(TII)发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型,全部在 100 亿参数以下。
推荐理由:Falcon3 家族覆盖 1B 到 10B 五款模型,给出了训练数据规模与基准对比,可据此判断小尺寸开源模型的选型空间。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款面向端侧与本地推理的模型 Ministral 3B 和 Ministral 8B,官方称其在 10B 以下级别刷新了知识、常识、推理、函数调用和效率的表现。
推荐理由:官方给出两款端侧小模型的能力定位、上下文长度与 API 定价,可据此判断本地推理的选型与成本。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,这是首个通用大规模纯 Mamba 模型,采用 TII Falcon Mamba 7B License 1.0 开放获取,已在 Hugging Face 生态上线。
推荐理由:TII 发布首个纯 Mamba 架构的 7B 开源模型,并给出与同规模 Transformer 的基准对比和长序列内存数据。
Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。
推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。
Mistral AI 发布基于 Mistral 7B 的数学推理模型 Mathstral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%,在同规模模型中达到 SOTA。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2。
推荐理由:Meta 发布 Llama 3 并同步落地 Hugging Face 生态,读者可据此了解新分词器与 8K 上下文带来的变化。
Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅激活 39B,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准表现,可据此判断其成本与能力定位。
Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,Azure 是其首个分发合作伙伴。
推荐理由:Mistral 官方给出旗舰模型 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其能力定位与接入方式。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数 46.7B,每个 token 仅激活 12.9B 参数,推理速度比 Llama 2 70B 快 6 倍,在多数基准上匹配或超过 Llama 2 70B 与 GPT3.5,支持 32k token 上下文和英法意德西五种语言。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比边界。
Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。
Mistral AI 发布 7.3B 参数语言模型 Mistral 7B,采用 Apache 2.0 许可,可无限制使用,并提供了参考实现、vLLM 推理服务器、Skypilot 及 HuggingFace 等使用方式。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并给出 Apache 2.0 许可与本地、云端部署路径。