自适应并行推理:高效推理扩展的下一个范式
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:processed_logprobs 语义、V1 专属运行时默认值、inflight 权重更新路径,以及最终投影所用的 fp32 lm_head。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计并发现更高效的缓存替换策略。
推荐理由:汇总 AlphaEvolve 一年来在基因组、电网、量子物理与 TPU 设计等领域的落地数据,可看到编码智能体跨领域应用的具体边界。
Hugging Face 联合 Appen Inc. 与 DataoceanAI 为 Open ASR Leaderboard 引入一批私有高质量英语 ASR 数据集,覆盖多口音的朗读与对话语音,以防止 benchmaxxing 和测试集污染。
Google Research 称其开源工具与开放数据集已赋能全球超 25 万名研究者和开发者,涵盖基因组学、神经科学、地球建模等领域。其中 DeepVariant 等工具已支持处理 250 万人的全基因组与外显子组数据,Open Buildings 包含 18 亿栋建筑检测结果,HAI-DEF 下载量超 480 万次。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 在医生监督下作为护理团队成员与患者交互。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于两款医生常用 AI;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。
推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的实际用法,可据此判断 AI 辅助科研的落地边界。
IBM Granite 团队公开了 Granite 4.1 系列稠密 LLM(3B、8B、30B)的完整训练流程,模型在约 15T token 上从零训练,采用五阶段预训练管线,上下文窗口最终扩展至 512K token。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
DeepInfra 正式接入 Hugging Face Hub 的 Inference Providers,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开源权重模型。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。
推荐理由:原文给出架构、训练配方与多榜成绩,可据此判断开源全模态模型在文档、音视频与智能体场景的可用性。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。
推荐理由:Mistral 把企业 AI 编排层做成 Studio 内的一体化产品,读者可据此判断生产级智能体落地的工程门槛。
Google DeepMind 与韩国科学技术信息通信部(MSIT)达成合作,将在首尔办公室设立 AI Campus,向韩国学界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
OpenAI 本周在 Hugging Face Hub 发布开源 PII 检测模型 Privacy Filter,可在单次 128k 上下文前向传播中标注八类个人信息,采用 Apache 2.0 许可,1.5B 参数、50M 激活参数,在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章给出三个基于 Privacy Filter 的可运行应用与 gradio.Server 前后端分工写法,可迁移到自己的 PII 脱敏工具。
DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 把长上下文成本压到 V3.2 的零头,读者可据此判断智能体长任务部署的可行性。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参照。
Google Research 宣布新方法已作为 Google Photos 的 Auto frame 功能上线,可自动调整拍摄视角。该方法先用 3D 点图估计模型重建场景与相机参数,再用生成式潜在扩散模型补全新视角下露出的空白区域,并自动检测人脸位置与广角畸变来选定理想机位。用户可在 Auto frame 候选中选择第二版重构图,一键改善含人物的照片。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算岛屿并在其间异步传输数据,从而隔离局部硬件故障。
推荐理由:Google DeepMind 披露 Decoupled DiLoCo 的异步训练架构,读者可了解跨数据中心训练在带宽与容错上的取舍。
Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中蒸馏高层推理模式的智能体记忆框架,代码已开源。
推荐理由:论文给出 ReasoningBank 的记忆蒸馏机制与 WebArena、SWE-Bench-Verified 上的成功率与步数变化,可据此判断智能体记忆方向的做法差异。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,推动前沿 AI 在企业的大规模落地。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权限,并围绕金融、制造、零售、媒体娱乐等行业共建行业专属 AI 方案。目前仅 25% 的组织成功将 AI 规模化投入生产。
Hugging Face 发布 QIMMA(阿拉伯语"顶峰"),一个先验证基准质量再评测模型的开源阿拉伯语 LLM 排行榜。QIMMA 整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌与编程 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与系统自主性的组合,而非单一模型。文章认为开源生态在检测、验证、协调、补丁传播四个阶段更具结构性优势,并主张用可私有部署的半自主 AI 智能体做防御。
Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使长时程规划更稳健。
Google Research 发布论文《Reasoning-Driven Synthetic Data Generation and Evaluation》。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,在保留的小鼠轴突上把重建误差降低 4.4%,主要来自 merge error 的减少。
Sentence Transformers 现已支持训练和微调多模态嵌入与重排序模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量达其 4 倍的模型。
Hugging Face 发布了一个 Skill 和配套测试工具,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试工具,读者可了解其流程与对评审者的减负方式。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单跟踪、政策问答、捆绑规划和多意图旅程 8 个可验证环境。
OpenAI 推出 Trusted Access for Cyber 计划,领先安全公司与大型企业已加入,使用 GPT-5.4-Cyber 并配套 1000 万美元 API 资助强化全球网络防御。
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。
推荐理由:官方给出音频标签控制方式、Elo 分数与多语言覆盖,可据此判断语音生成的可控性变化。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评测 AI 智能体的组合推理与多步工作流执行能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域并配有领域文档,任务需 3-7 步推理链,包含 API Chaining、Tool Selection、Multi-Hop Reasoning 等四项任务,模型整体表现不佳。
OpenAI 更新 Agents SDK,新增原生沙箱执行和模型原生 harness,帮助开发者在文件与工具之间构建安全、长时间运行的智能体。
推荐理由:官方给出 Agents SDK 的两项能力变化,读者可据此判断长时运行智能体的构建方式是否改变。
HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样浏览网页并自动完成跨网站任务,无需任何配置或技术背景。用户只需描述需求,智能体便在浏览器内导航界面、填写字段并做出决策,底层由视觉模型、动作规划和界面理解驱动。
推荐理由:官方给出浏览器智能体的录制复用机制与免费入口,可据此判断零门槛自动化任务的落地方式。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
Google 发布研究实验 Vantage,通过生成式 AI 构建模拟环境中的多轮对话,评估高中与大学生面向未来的技能,现已在 Google Labs 开放英文注册。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人高层推理的进展。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体,兼顾速度与安全。
OpenAI 发布指南,介绍如何用 ChatGPT 探索数据集、生成洞察、创建可视化,并将发现转化为可执行的决策。
OpenAI 发布面向初学者的 AI 基础指南,解释 AI 是什么、如何运作,以及 ChatGPT 这类工具如何使用大语言模型。内容为入门级科普,未涉及具体模型版本、参数或性能数据。
OpenAI 发布面向运营团队的 ChatGPT 指南,介绍运营团队如何用 ChatGPT 简化工作流、改善协作、标准化流程并加快执行速度。
OpenAI 发布面向财务团队的 ChatGPT 工作流学习内容,覆盖财务分析、报告、规划与决策沟通等实用场景。内容聚焦如何将 ChatGPT 应用于财务日常工作流程。