Google Research 提出 Sequential Attention:让 AI 模型更精简更快且不牺牲准确率
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练中顺序、自适应地挑选最佳组件,把子集选择直接融入训练流程,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并已用于特征选择等真实场景,兼顾效率、准确率、可解释性与大规模扩展能力。
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练中顺序、自适应地挑选最佳组件,把子集选择直接融入训练流程,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并已用于特征选择等真实场景,兼顾效率、准确率、可解释性与大规模扩展能力。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,覆盖单智能体与独立、集中、去中心化、混合四种多智能体架构,以及 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准。
推荐理由:通过 180 组智能体配置的对照评测,给出多智能体架构何时增益、何时拖累性能的量化规律。
Google Research 发布 ATLAS(自适应迁移缩放律),用于指导多语言模型的模型规模、数据量与语言配比选择,论文将在 ICLR 2026 展示。该研究基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据和 48 种语言评测,并给出 1,400 对语言之间的迁移关系矩阵。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 在图像分类等基准任务上超越现有最优方法,并首次为该权衡提供可证明的近似保证:所选子集价值至少达到最优解的一半。
Google Research 提出一种拆解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。在移动端与网页轨迹上,该方法优于 CoT 和端到端微调,Gemini 1.5 Flash 8B 取得与 Gemini 1.5 Pro 相当的结果,成本与速度仅为后者一小部分。该论文已在 EMNLP 2025 发表。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
微软发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下将查询头数量翻倍,使解码速度与标准 Transformer 持平,且无需自定义注意力内核。
Google 研究团队提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭单只 Pixel Watch 的 IMU 信号和用户身高,即可直接估算步速、步长、双支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r>0.80、ICC>0.80。
Google Research 利用 Virginia 和 California 的公开碰撞数据与 Android Auto 匿名聚合的急刹车事件(HBE,减速度超过 -3m/s²)数据,通过负二项回归模型确认 HBE 频率与路段碰撞率呈显著正相关。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
伯克利 AI Research 提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。在彩色摄影、射电天文、无镜头成像和显微成像四个领域验证中,该指标正确排序了不同硬件设计,优化后性能匹配 SOTA 端到端方法,且内存与算力需求更低、无需任务专用解码器设计。
OpenAI 推出面向思维链可监控性的新框架与评测套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 发布 FrontierScience 基准,用于测试 AI 在物理、化学和生物学领域的推理能力,衡量其向真实科学研究迈进的进展。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 在湿实验室中加速生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨了 AI 辅助实验的前景与风险。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在人工评估中最高有 70% 的情况更受 LLM 评审青睐,但隐私预算收紧时主题覆盖度会下降。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3513 个公开样例,另设私有留出集。
Google Research 发布两篇论文,提出 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。
推荐理由:Google Research 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类的甘油酸激酶(GLYK)三维结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。他们将藻类 GLYK 中更刚性的环替换进植物酶,构建的杂合酶中有一个在高达 65 °C 下仍保持稳定,为培育耐热作物提供了路径。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并在 smolagents 上实现的数学推理 Agent,通过生成 Python 片段在沙箱中执行来替代冗长文本推理。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或做出不当行为时主动承认,以提升 AI 的诚实性、透明度以及模型输出的可信度。
Google DeepMind 介绍一项由 AlphaFold 参与的研究,科学家解析了“坏胆固醇”关键蛋白 apoB100 的结构。密苏里大学研究者先用冷冻电镜拍摄 LDL 颗粒图像,再由物理学家用 AlphaFold 生成原子级结构预测并与电镜数据比对,最终得到笼状外壳和带状结构的模型。该结构有望帮助更精准地预防、诊断和治疗高胆固醇与动脉粥样硬化性心血管疾病。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体用法。
Google 设计了一个轻量级线性回归模型,预测某充电站在未来若干分钟后充电端口可用的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。模型仅以一天中各小时作为特征,在 30 至 60 分钟预测区间、100 个随机站点上评估,性能超过"保持当前状态"这一强基线,主要优势在于识别高占用率变化的关键时刻。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Google Research 介绍了一个端到端语音到语音翻译(S2ST)模型,可在原说话人音色下实时翻译,延迟仅 2 秒,而现有级联方案通常有 4–5 秒延迟并会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,可对照级联方案的误差累积问题。
ServiceNow 的 SLAM Lab 将 15B 推理模型 Apriel-Nemotron-15B-Thinker 蒸馏改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 在 50 层中替换 30 层为 Mamba。
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率、可区分天然林与其他树木覆盖的地图数据集,独立数据集验证准确率达 92.2%。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令跟随者升级为能思考目标、与用户对话并随时间自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解从指令跟随到自主推理与自我改进的路径。
Google Quantum AI 联合斯坦福、MIT、Caltech 在 Nature 论文中提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉将优化问题转化为可高效求解的解码问题。
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器生成百万级图像的 AligNet 数据集,再微调其他模型,使其在"找不同"任务上更符合人类判断,并提升鲁棒性与泛化能力。
Google Research 在 NeurIPS 2025 论文《Nested Learning: The Illusion of Deep Learning Architectures》中提出 Nested Learning,把模型架构与优化算法视为同一套相互嵌套、同时优化的多层级学习问题,以缓解持续学习中的灾难性遗忘。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划迭代三项机制,在 DABStep、KramaBench、DA-Code 三个基准上全面超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%,并登顶 DABStep 公开榜单。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作开发森林砍伐驱动因素模型,以 1km² 分辨率覆盖 2000-2024 年,并开放 30 米尺度砍伐风险预测基准数据集。
Google 发布 ForestCast,用纯卫星数据训练的深度学习模型预测森林砍伐风险,并公开首个相关基准数据集。模型基于 vision transformers,仅用 Landsat 和 Sentinel 2 卫星数据及"变化历史"输入,精度可匹配或超过依赖道路等专用地图的传统方法。研究显示"变化历史"是最关键输入,单独使用即可达到与全量原始卫星数据相当的精度。
Google 公布名为 Project Suncatcher 的研究计划,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,相关预印本论文探讨了卫星间高带宽通信、轨道动力学和辐射对计算的影响。
推荐理由:Google 公开了太空 AI 数据中心的系统设计与关键挑战,读者可了解其轨道、通信和 TPU 抗辐射的初步验证结果。
OpenAI 发布 IndQA,一个用于评估 AI 系统在印度语言中表现的新基准,由领域专家参与构建,覆盖 12 种语言和 10 个知识领域,重点考察文化理解与推理能力。
Google Research 提出可证明隐私洞察(PPI),结合大语言模型、差分隐私(DP)和可信执行环境(TEE),在保证个体数据不可被查看、聚合结果匿名的前提下分析非结构化 GenAI 数据。
推荐理由:Google 把 LLM、差分隐私与 TEE 组合成可外部核验的隐私分析流程,读者可了解端侧 AI 数据如何在不暴露个体数据的前提下被统计。
Google Research 发布 StreetReaderAI 无障碍街景原型,基于 Gemini 构建 AI Describer 与 AI Chat 两个子系统,为盲人和低视力用户实时生成道路、路口与地点的语音描述,并支持语音或键盘平移、移动和跳转。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人物数据集,采用 CC BY 4.0 许可。