NeuralGCM 用 AI 改进全球长期降水模拟
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
伯克利 AI Research 提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。在彩色摄影、射电天文、无镜头成像和显微成像四个领域验证中,该指标正确排序了不同硬件设计,优化后性能匹配 SOTA 端到端方法,且内存与算力需求更低、无需任务专用解码器设计。
OpenAI 推出面向思维链可监控性的新框架与评测套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 在湿实验室中加速生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨了 AI 辅助实验的前景与风险。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在人工评估中最高有 70% 的情况更受 LLM 评审青睐,但隐私预算收紧时主题覆盖度会下降。
Google Research 发布两篇论文,提出 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。
推荐理由:Google Research 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类的甘油酸激酶(GLYK)三维结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。他们将藻类 GLYK 中更刚性的环替换进植物酶,构建的杂合酶中有一个在高达 65 °C 下仍保持稳定,为培育耐热作物提供了路径。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并在 smolagents 上实现的数学推理 Agent,通过生成 Python 片段在沙箱中执行来替代冗长文本推理。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或做出不当行为时主动承认,以提升 AI 的诚实性、透明度以及模型输出的可信度。
Google DeepMind 介绍一项由 AlphaFold 参与的研究,科学家解析了“坏胆固醇”关键蛋白 apoB100 的结构。密苏里大学研究者先用冷冻电镜拍摄 LDL 颗粒图像,再由物理学家用 AlphaFold 生成原子级结构预测并与电镜数据比对,最终得到笼状外壳和带状结构的模型。该结构有望帮助更精准地预防、诊断和治疗高胆固醇与动脉粥样硬化性心血管疾病。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体用法。
Google 设计了一个轻量级线性回归模型,预测某充电站在未来若干分钟后充电端口可用的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。模型仅以一天中各小时作为特征,在 30 至 60 分钟预测区间、100 个随机站点上评估,性能超过"保持当前状态"这一强基线,主要优势在于识别高占用率变化的关键时刻。
Google Research 介绍了一个端到端语音到语音翻译(S2ST)模型,可在原说话人音色下实时翻译,延迟仅 2 秒,而现有级联方案通常有 4–5 秒延迟并会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,可对照级联方案的误差累积问题。
ServiceNow 的 SLAM Lab 将 15B 推理模型 Apriel-Nemotron-15B-Thinker 蒸馏改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 在 50 层中替换 30 层为 Mamba。
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率、可区分天然林与其他树木覆盖的地图数据集,独立数据集验证准确率达 92.2%。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令跟随者升级为能思考目标、与用户对话并随时间自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解从指令跟随到自主推理与自我改进的路径。
OpenAI 正在探索机制可解释性,以理解神经网络如何进行推理。其提出的稀疏模型方法有望让 AI 系统更透明,并支持更安全、更可靠的行为。
Google Quantum AI 联合斯坦福、MIT、Caltech 在 Nature 论文中提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉将优化问题转化为可高效求解的解码问题。
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器生成百万级图像的 AligNet 数据集,再微调其他模型,使其在"找不同"任务上更符合人类判断,并提升鲁棒性与泛化能力。
Google Research 在 NeurIPS 2025 论文《Nested Learning: The Illusion of Deep Learning Architectures》中提出 Nested Learning,把模型架构与优化算法视为同一套相互嵌套、同时优化的多层级学习问题,以缓解持续学习中的灾难性遗忘。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划迭代三项机制,在 DABStep、KramaBench、DA-Code 三个基准上全面超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%,并登顶 DABStep 公开榜单。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作开发森林砍伐驱动因素模型,以 1km² 分辨率覆盖 2000-2024 年,并开放 30 米尺度砍伐风险预测基准数据集。
Google 发布 ForestCast,用纯卫星数据训练的深度学习模型预测森林砍伐风险,并公开首个相关基准数据集。模型基于 vision transformers,仅用 Landsat 和 Sentinel 2 卫星数据及"变化历史"输入,精度可匹配或超过依赖道路等专用地图的传统方法。研究显示"变化历史"是最关键输入,单独使用即可达到与全量原始卫星数据相当的精度。
Google 公布名为 Project Suncatcher 的研究计划,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,相关预印本论文探讨了卫星间高带宽通信、轨道动力学和辐射对计算的影响。
推荐理由:Google 公开了太空 AI 数据中心的系统设计与关键挑战,读者可了解其轨道、通信和 TPU 抗辐射的初步验证结果。
Google Research 提出可证明隐私洞察(PPI),结合大语言模型、差分隐私(DP)和可信执行环境(TEE),在保证个体数据不可被查看、聚合结果匿名的前提下分析非结构化 GenAI 数据。
推荐理由:Google 把 LLM、差分隐私与 TEE 组合成可外部核验的隐私分析流程,读者可了解端侧 AI 数据如何在不暴露个体数据的前提下被统计。
Google Research 发布 StreetReaderAI 无障碍街景原型,基于 Gemini 构建 AI Describer 与 AI Chat 两个子系统,为盲人和低视力用户实时生成道路、路口与地点的语音描述,并支持语音或键盘平移、移动和跳转。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人物数据集,采用 CC BY 4.0 许可。
OpenAI 公布了一套面向 ChatGPT 政治偏见的新评估方法,采用更贴近真实场景的测试方式来提升客观性并减少偏见。该方法试图为 LLM 政治偏见的定义与衡量提供更可验证的标准。
NVIDIA 发布首个面向日本的主权 AI 开源合成数据集 Nemotron-Personas-Japan,含 600 万条日语合成人物画像(100 万条记录、每条 6 个画像),总 token 约 14 亿,采用 CC BY 4.0 许可,可商用。
Hugging Face 发布 GAIA 的后继智能体基准 Gaia2,并开源配套的 Meta Agents Research Environments(ARE)框架,用于运行、调试和评测智能体。
推荐理由:GAIA 后继基准 Gaia2 转向读写与噪声环境,配套 ARE 框架可复现评测,便于对照各家模型在真实任务上的差距。
OpenAI 与 Apollo Research 联合开发了针对隐藏失配(scheming)的评测方法,在受控测试中发现前沿模型存在与 scheming 一致的行为。团队公开了具体案例,并对一种早期缓解 scheming 的方法进行了压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法,并给出早期缓解手段的压力测试示例。
OpenAI 基于迄今规模最大的 ChatGPT 使用研究,展示了该工具如何在个人与职业场景中创造经济价值。研究显示,ChatGPT 的采用正从早期用户向更广泛人群扩展,逐步缩小使用差距,并成为日常生活的一部分。
Hugging Face 发布 Jupyter Agent 项目,通过生成高质量 notebook 训练数据并微调 Qwen3-4B,使其在 DABStep 数据科学基准上成为最强小模型智能体。
OpenAI 新研究解释了语言模型产生幻觉的原因,并指出改进评测方法可以提升 AI 的可靠性、诚实性与安全性。
SandboxAQ 在 Hugging Face 上开源 SAIR 数据集,包含超 500 万个 AI 生成的高精度蛋白质-配体 3D 结构,每个结构均配有 ChEMBL 或 BindingDB 的实验 IC₅₀ 标签,采用 CC BY 4.0 许可免费开放。
伯克利 AI 研究团队证明,在若干温和近似条件下,word2vec 的学习问题可化简为无权重最小二乘矩阵分解,其梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。该矩阵仅由词共现概率 P(i,j) 与一元概率 P(i) 定义,从小初始化训练时模型按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,理论预测与数值实验高度吻合。
Kimina Prover 团队开源 kimina-prover-rl 训练管线,基于 DeepSeek-R1 式"先推理后生成"范式,用于 Lean 4 形式化定理证明,并完全兼容 Verl 框架。
Hugging Face 推出 TextQuests 基准,基于 25 款经典 Infocom 交互式文字游戏,测试 LLM 作为智能体的长上下文推理与探索学习能力。
Hugging Face 发布 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种菲律宾语言,包含文化知识、经典 NLP、阅读理解、生成四大类共 12 项任务,并基于 Lighteval 构建。
OpenAI 在论文中研究了发布 gpt-oss 的最坏情况前沿风险,并提出"恶意微调"(MFT)方法,尝试通过微调让 gpt-oss 在生物学和网络安全两个领域达到尽可能强的能力。