Google 发布 MedGemma 1.5 4B 与医疗语音识别模型 MedASR
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 更新 Veo 3.1 的 Ingredients to Video 能力,让基于参考图生成的视频在简单提示词下也有更丰富的对白与叙事,并提升角色、背景和物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得切换。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。
Google 回顾 2025 年在 8 个领域的研究突破,模型方面 3 月发布 Gemini 2.5、11 月推出 Gemini 3、12 月推出 Gemini 3 Flash,其中 Gemini 3 Pro 登顶 LMArena 并在 MathArena Apex 取得 23.4% 的 SOTA。
Google Research 回顾 2025 年成果:Gemini 3 成为其最强、最注重事实准确性的 LLM,在 SimpleQA Verified 和与 Google DeepMind、Kaggle 联合发布的新 FACTS 基准上达到 SOTA。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟和成本结合,定价为每 100 万输入 token 0.50 美元、每 100 万输出 token 3 美元。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断它在速度与成本上的取舍。
Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAE)与 transcoder 查看模型内部计算。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并提供 SAE 与 transcoder,读者可据此了解模型可解释性工具的开源进展。
Google Research 为 STOC 2026 推出实验性 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 的推理扩展方法,在投稿后 24 小时内为作者生成结构化预审反馈,涵盖论文贡献摘要、潜在错误与改进建议以及笔误清单。
推荐理由:Google 官方披露 PAT 在 STOC 2026 的实测数据与作者反馈,可了解 AI 辅助数学证明审阅的实际边界。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,改进函数调用、指令遵循与多轮对话能力。
推荐理由:官方给出函数调用、指令遵循与多轮对话三项改进的具体分数,可据此判断语音智能体的可用性提升。
Google 联合 SisonkeBiotik、Ro'ya 和 DS-I Africa 举办非洲健康数据科学 Ideathon,从 30 多份提交中选出六支决赛团队,使用 MedGemma、TxGemma 和 MedSigLIP 等开放健康 AI 模型开发解决方案。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全与安全研究。双方将共享专有模型、数据与思路,并联合发布报告,重点研究 CoT 监控、社会情感错位影响以及 AI 对经济系统的冲击。Google DeepMind 称 Gemini 3 是其迄今最智能、最安全的模型。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在人工评估中最高有 70% 的情况更受 LLM 评审青睐,但隐私预算收紧时主题覆盖度会下降。
Google DeepMind 宣布深化与英国政府合作,向英国科学家优先开放 AlphaEvolve、AlphaGenome、AI co-scientist 和 WeatherNext 等"AI for Science"模型,并将于 2026 年在英国建立其首个自动化材料科学实验室。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3513 个公开样例,另设私有留出集。
Google Research 发布两篇论文,提出 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。
推荐理由:Google Research 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类的甘油酸激酶(GLYK)三维结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。他们将藻类 GLYK 中更刚性的环替换进植物酶,构建的杂合酶中有一个在高达 65 °C 下仍保持稳定,为培育耐热作物提供了路径。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。
Google DeepMind 介绍一项由 AlphaFold 参与的研究,科学家解析了“坏胆固醇”关键蛋白 apoB100 的结构。密苏里大学研究者先用冷冻电镜拍摄 LDL 颗粒图像,再由物理学家用 AlphaFold 生成原子级结构预测并与电镜数据比对,最终得到笼状外壳和带状结构的模型。该结构有望帮助更精准地预防、诊断和治疗高胆固醇与动脉粥样硬化性心血管疾病。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体用法。
Google DeepMind 宣布支持美国白宫 Genesis 计划,与美国能源部合作,为全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问通道,即日起从 Google Cloud 上的 AI co-scientist 开始。
推荐理由:Google DeepMind 与 DOE 合作开放前沿科研模型给 17 个国家实验室,可了解 AI for Science 的落地路径。
Google 设计了一个轻量级线性回归模型,预测某充电站在未来若干分钟后充电端口可用的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。模型仅以一天中各小时作为特征,在 30 至 60 分钟预测区间、100 个随机站点上评估,性能超过"保持当前状态"这一强基线,主要优势在于识别高占用率变化的关键时刻。
Google DeepMind 宣布在 Gemini 应用中上线图像验证功能,用户上传图片并提问是否由 Google AI 生成或编辑,Gemini 会检测 SynthID 水印并结合自身推理给出判断。
推荐理由:Google 把 SynthID 水印检测直接放进 Gemini 应用,读者可了解 AI 图像溯源在消费端产品的落地方式。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,面向开发者提供影棚级图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,以及 Adobe、Figma 等接入情况,便于判断其与上一代的取舍。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更准确的图像内文字渲染、多语言生成与更强的世界知识。
推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,可据此判断图像生成与编辑的可用范围。
Google Research 介绍了一个端到端语音到语音翻译(S2ST)模型,可在原说话人音色下实时翻译,延迟仅 2 秒,而现有级联方案通常有 4–5 秒延迟并会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,可对照级联方案的误差累积问题。
Google DeepMind 发布 Gemini 3 Pro,称其在主要 AI 基准上超过此前版本,编码与智能体任务表现优于 2.5 Pro。模型已在 Google AI Studio 和 Vertex AI 以预览形式开放,200k token 以内输入 $2/百万 token、输出 $12/百万 token,并在 Google AI Studio 免费提供但有限速。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与 Antigravity 平台入口,可据此判断其编码与智能体能力落点。
Google DeepMind 在新加坡开设新研究实验室,聚焦推进 Gemini 核心能力与亚太语言文化包容性研究,其亚太团队过去一年已扩大一倍以上。新实验室将与当地政府、企业和学术机构合作,此前已与 AI Singapore 基于 Gemma 3 多模态能力推出 SEA-LION v4,并与 A*STAR 用 AlphaFold 推进帕金森病研究。
Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,首发 Gemini 3 Pro 预览版,并同步上线 Gemini 应用、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新的智能体开发平台 Google Antigravity。
推荐理由:官方一次性给出 Gemini 3 Pro 与 Deep Think 的基准成绩、产品落地范围和开放入口,可据此判断能力代际变化。
Google 发布智能体开发平台 Antigravity,已开放免费公开预览,支持 macOS、Linux 和 Windows。该平台在传统 AI IDE 的 Editor 视图之外新增面向智能体的 Manager 视图,可并行编排多个工作区中的智能体,并通过任务列表、实现计划、截图和浏览器录制等 Artifacts 呈现工作过程。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。
Google 推出生成式 UI 实现,由模型按提示词自动生成网页、游戏、工具等交互界面,而非渲染静态预设界面。该能力以 dynamic view 和 visual layout 两个实验在 Gemini app 上线,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 与工具调用、系统指令、后处理三部分实现。
推荐理由:Google 把生成式 UI 落到 Gemini 与搜索 AI Mode,读者可了解其实现路径与人工评测偏好结果。
Google DeepMind 与 Google Research 发布 WeatherNext 2,称其生成预报速度比前代快 8 倍,分辨率最高可达 1 小时。
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率、可区分天然林与其他树木覆盖的地图数据集,独立数据集验证准确率达 92.2%。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令跟随者升级为能思考目标、与用户对话并随时间自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解从指令跟随到自主推理与自我改进的路径。
Google Quantum AI 联合斯坦福、MIT、Caltech 在 Nature 论文中提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉将优化问题转化为可高效求解的解码问题。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自有 AI。
Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于训练和审计差分隐私(DP)模型的工具库,重新设计以提升模块化,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法。
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器生成百万级图像的 AligNet 数据集,再微调其他模型,使其在"找不同"任务上更符合人类判断,并提升鲁棒性与泛化能力。
北爱尔兰 C2k 与 Google for Education 合作的六个月试点中,100 名教师将 Gemini 和 Google Workspace 工具引入课堂,每位参与教师平均每周节省 10 小时,并沉淀出 600 多个 Gemini 使用案例。
Google Research 在 NeurIPS 2025 论文《Nested Learning: The Illusion of Deep Learning Architectures》中提出 Nested Learning,把模型架构与优化算法视为同一套相互嵌套、同时优化的多层级学习问题,以缓解持续学习中的灾难性遗忘。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划迭代三项机制,在 DABStep、KramaBench、DA-Code 三个基准上全面超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%,并登顶 DABStep 公开榜单。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作开发森林砍伐驱动因素模型,以 1km² 分辨率覆盖 2000-2024 年,并开放 30 米尺度砍伐风险预测基准数据集。