Google 用深度学习从太空绘制全球甲烷排放地图
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出视频分析在 token 消耗、成本与准确率上的量化变化,以及 API 启用方式,便于开发者评估是否迁移现有视频处理流程。
Google 推出 TimesFM-3,一款原生预训练支持多变量预测的时间序列基础模型,参数量 3.3 亿,在超 1 万亿时间点的真实与合成语料上预训练。它单次前向传播即可联合预测多条共演化序列,支持多目标、历史协变量和已知未来协变量,并输出 10 至 90 分位共 9 个分位数。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程压缩到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的对比数字,可了解地理空间建模自动化的实际增益。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与 API 入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学环境中,避免模型提前接触题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离缓慢血糖趋势与短期波动,在 109,066 小时无标注 CGM 数据上预训练。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比最优 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均 WER 为 4.0%,非流式 2.6%;相比此前的 Chirp 3,最终转写时间改善 70%。
推荐理由:官方给出流式与非流式两套 API 的 WER 数据和相对 Chirp 3 的延迟提升,便于判断语音转写能否接入现有工作流。
Google 发布研究原型 AgentHands(CHI 2026),可将 LLM 的高层推理映射为 XR 中与语音同步的手势,用于空间化智能体对话。系统包含环境感知、手势事件库、手势嵌入推理与本地 XR 同步执行四步,支持指示、象形与表达三类手势。在 N=12 的用户研究中,AgentHands 相较纯语音基线在空间定位等指标上显著提升。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 直接以原始像素学会 49 款 Atari 2600 游戏,到 AlphaGo、AlphaZero、MuZero、AlphaStar 相继攻克围棋、国际象棋与 StarCraft II。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动性模式(到达时间、停留时长、周边移动)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
Google 推出 PhotoScan,一个从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和 Visceral-to-Subcutaneous 脂肪面积比(V/S)的深度学习框架。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:Gemini 3.7 Flash 距上一版仅三周,价格降为一半,并给出编码与文档处理等多项基准对比,可据此判断升级幅度与成本变化。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首个支持场景为美国手语(ASL)转英文。该模型基于超过 50 种手语、逾 10 万小时数据训练,其中约四分之一为 ASL 数据,在 FLEURS-ASL(sd-test)上取得 70 BLEURT 的零样本成绩。
推荐理由:官方披露了 SL2T 的训练规模、手语翻译难点与端侧隐私方案,可了解手语 AI 从实验室走向消费产品的路径。
Google Research 发布研究,提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并构建含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以取用而非未存储。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 视频版与真人医生同级的评测结果,可了解多智能体异步架构如何兼顾对话延迟与临床推理。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋预报精度提升与开源权重,读者可据此判断气象预报工作流的可用入口。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并用 Science One Framework 原型实现,配套 CoE Audit 自动审计指标。
推荐理由:原文给出可验证性框架与审计指标,并对比多个自主科研系统的引用与代码一致性表现。
Hugging Face 博客指出,AI 的下一个真正约束是 GPU 利用率而非智能本身。GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因利用率差异而拉开差距。企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让它们保持忙碌。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还可原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更丰富自然的旋律结构、提示词遵循与结构感知更好的歌词、更具情感表达和发音更准确的人声,以及更易控制输出节奏与时长。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,首次实现对完整人形机器人的全身控制,并带来更精细的手部与夹爪操作能力。
推荐理由:Gemini Robotics 2 把机器人控制从上半身扩展到全身,并给出多机协作与端侧快速适配的具体路径。
Google Research 发布论文 SymptomAI,一种用于日常症状评估的对话式 AI 智能体,基于 Gemini Flash 2.0 构建五个不同提问策略的原型。
推荐理由:Google 用 1.3 万人规模的随机研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google Research 在 Nature 发表论文,提出一种强化学习框架,让智能体从量子纠错检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。
推荐理由:Google 用强化学习让量子处理器在计算中持续校准,读者可了解其 3.5 倍稳定性提升与扩展性验证。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云额度,支持 Genesis Mission 的研究人员。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家与生物安全专家用 AI 构建更具韧性的社会。
Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于 score smoothing:神经网络训练中的正则化使学到的 score function 变平滑,导致去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 整理 12 个核心模块内容,支持 10 个模块的项目生成,初期支持 8 种语言,底层由 Gemini 3.5 Flash 提供智能。首批覆盖印度 100 所试点学校。
Google Research 联合 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的万亿分钟可穿戴数据训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至相似耗时的替代路线,在美国 10 座城市测试后,目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。
Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,将顶尖研究实验室与电影制作公司配对,帮助艺术家开发新工作流与技术。双方将围绕多个项目展开长期深度研发协作,Google 同时已对 A24 进行投资。该合作初期聚焦弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。
Hugging Face 与 Cerebras 合作展示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 的推理。该架构为级联式模块化设计,依次经过 Nvidia Parakeet 语音识别、Cerebras 上的 Gemma 4 VLM 推理和阿里 Qwen3TTS 文本转语音,各层均可替换。
推荐理由:原文给出了一套可替换的实时语音到语音开源架构,读者可据此了解各层组件如何组合并复用到自己的项目。
Google Research 将建筑级屋顶反射率(albedo)数据集从 2024 年试点的 14 座城市扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价与可用入口,读者可据此判断图像与视频生成链路的成本取舍。
Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:Google 把零样本思路搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比表现。
Google Research 提出一种新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在 Pixel 9 和 10 系列上实现开箱即用的加速。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何在内存受限下提速。