Google DeepMind 与新加坡达成国家 AI 合作,落地医疗、教育与气候项目
Google DeepMind 与新加坡政府达成国家 AI 合作,在新加坡推出多项计划,覆盖医疗健康、生命科学、教育和气候领域。合作包括探索 AI 辅助临床的"三方护理"、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,以及为盲人和低视力运动员开发基于 Gemma 的跑步助手。
Google DeepMind 与新加坡政府达成国家 AI 合作,在新加坡推出多项计划,覆盖医疗健康、生命科学、教育和气候领域。合作包括探索 AI 辅助临床的"三方护理"、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,以及为盲人和低视力运动员开发基于 Gemma 的跑步助手。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 等渠道开放。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放渠道,可据此判断其速度与成本定位。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 在医生监督下作为护理团队成员与患者交互。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于两款医生常用 AI;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。
推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。
推荐理由:原文给出架构、训练配方与多榜成绩,可据此判断开源全模态模型在文档、音视频与智能体场景的可用性。
Sentence Transformers 现已支持训练和微调多模态嵌入与重排序模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量达其 4 倍的模型。
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。
推荐理由:官方给出音频标签控制方式、Elo 分数与多语言覆盖,可据此判断语音生成的可控性变化。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人高层推理的进展。
Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态嵌入与重排模型。嵌入模型把不同模态映射到共享向量空间,重排模型对混合模态输入对打分,可用于视觉文档检索、跨模态搜索和多模态 RAG。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索如何接入现有 RAG 流程。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文方法章节生成出版级图表,ScholarPeer 则自动评审论文。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖端侧到工作站,并给出 Apache 2.0 许可与首日工具支持,可据此判断本地部署与微调的选择空间。
Google DeepMind 的 Gemma 4 多模态模型家族已在 Hugging Face 发布,采用 Apache 2 许可,支持图像、文本和音频输入并生成文本。
推荐理由:Gemma 4 五档尺寸与 Apache 2 许可一并给出,读者可据此判断端侧多模态与本地部署的可行边界。
阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上取得 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,已在 Hugging Face 上线并采用 Apache 2.0 许可。
推荐理由:3B 小模型在表格与图表抽取上对标更大模型,并给出 LoRA 模块化部署路径,可据此判断企业文档流水线的选型。
Google DeepMind 发布 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能按前奏、主歌、副歌、桥段等结构元素进行提示控制。
推荐理由:官方披露 Lyria 3 Pro 的时长与结构控制能力,以及它在 Vertex AI、Gemini 等入口的开放范围。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成可运行的物理感知 Android XR 应用,官方称耗时在 60 秒以内。
推荐理由:Google 把 Gemini 与 XR Blocks 组合成从自然语言到 Android XR 应用的生成流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发的门槛变化。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究发现,模拟协作医疗团队的 Personal Health Agent(PHA)比单一任务应用更能支持长期健康。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态 computer-use 模型,现已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:官方披露了模型架构、训练数据规模与 WebVoyager 提升幅度,可据此判断高吞吐 computer-use 智能体的落地条件。
OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 的更小、更快版本。两款模型针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。
推荐理由:OpenAI 官方给出 GPT-5.4 mini 与 nano 的定位,读者可据此判断小模型在编码与工具调用场景的取舍。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合并进单一开源模型,并给出与 GPT-OSS 120B 的输出长度对比,便于判断效率取舍。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,双方计划共同开发前沿开源 AI 模型,Mistral 提供模型架构、多模态能力和微调工具,NVIDIA 提供算力、模型开发工具与合成数据生成管线。
推荐理由:Mistral 以创始成员身份加入 NVIDIA Nemotron Coalition,读者可了解开放前沿模型的联合训练分工与开源计划。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊初级保健就诊前为患者采集病史,由医生通过视频实时监督。
推荐理由:Google 与 BIDMC 首次把 AMIE 放进真实门诊流程做前瞻性可行性研究,读者可看到安全监督机制与盲评结果。
Descript 借助 OpenAI 推理模型实现大型内容库的自动本地化,在不丢失时间轴与语义的前提下完成多语言视频配音。该方案面向大规模内容库的配音场景,解决了规模化本地化中的时序与含义保持问题。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:原文给出价格、速度与基准数据,读者可据此判断高并发场景下的成本与延迟取舍。
Google DeepMind 发布最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的高级世界知识、质量与推理能力带到 Flash 级速度。
推荐理由:Google DeepMind 官方发布 Nano Banana 2,读者可据此了解其能力边界与在 Gemini、搜索、Flow 等产品中的落地范围。
Google DeepMind 的最新生成式音乐模型 Lyria 3 以 beta 形式在 Gemini app 上线,用户用文字或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并附由 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 中的生成方式、语言覆盖与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。
Google Research 提出 MapTrace,一套可扩展的合成数据生成流程,用于训练多模态大模型在地图上追踪路径,并开源了基于 Gemini 2.5 Pro 和 Imagen-4 生成的 200 万问答对。
Google Research 发布开源原型框架 DialogLab,用于创作、模拟和测试动态的人机群组对话,相关论文在 ACM UIST 2025 展示。该框架将对话的社交设定与时间流程解耦,通过"创作-测试-验证"三阶段工作流支持多参与方、角色分组与打断规则配置。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具让 UI 从静态导航转向智能体驱动的动态模块,以缩小新功能发布与辅助层之间的"无障碍鸿沟"。原型包括面向盲人与低视力用户的 StreetReaderAI,以及基于 Gemini 模型、可实时调整描述细节的 Multimodal Agent Video Player(MAVP)。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:官方披露了世界模型原型的三项核心能力与已知限制,可据此判断实时生成交互世界的可用边界。
中国开源模型近一年几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在算力约束下平衡能力与成本。开源方向从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
Google Research 提出一种拆解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。在移动端与网页轨迹上,该方法优于 CoT 和端到端微调,Gemini 1.5 Flash 8B 取得与 Gemini 1.5 Pro 相当的结果,成本与速度仅为后者一小部分。该论文已在 EMNLP 2025 发表。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,读者可了解 4D 重建的效率提升幅度与机器人、AR 等落地方向。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 更新 Veo 3.1 的 Ingredients to Video 能力,让基于参考图生成的视频在简单提示词下也有更丰富的对白与叙事,并提升角色、背景和物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得切换。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 提到 256K 并新增轨迹与 OCR 能力,可据此判断物理 AI 视觉推理的可用边界。
Google Research 回顾 2025 年成果:Gemini 3 成为其最强、最注重事实准确性的 LLM,在 SimpleQA Verified 和与 Google DeepMind、Kaggle 联合发布的新 FACTS 基准上达到 SOTA。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。
推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟和成本结合,定价为每 100 万输入 token 0.50 美元、每 100 万输出 token 3 美元。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断它在速度与成本上的取舍。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3513 个公开样例,另设私有留出集。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。