Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,整个筛选到候选验证过程仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性的评测基准与量化结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话。
推荐理由:官方给出 Live Avatar 的实时音视频对话能力、97 种语言切换与企业定制入口,可据此判断多模态智能体的落地形态。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅使部署模型参数量增加 8.9%,并首日支持 llama.cpp、MLX-VLM 和 SGLang。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 落地进展,新加坡 HTX 将研究使用 Nemotron 3 Super 与 Nemotron 3 Nano Omni 模型推进公共安全 AI。
Hugging Face 推出 NeoMME 系列多语言多模态编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出视频分析在 token 消耗、成本与准确率上的量化变化,以及 API 启用方式,便于开发者评估是否迁移现有视频处理流程。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与 API 入口,可据此判断生成视频工作流的可控性变化。
Google 发布研究原型 AgentHands(CHI 2026),可将 LLM 的高层推理映射为 XR 中与语音同步的手势,用于空间化智能体对话。系统包含环境感知、手势事件库、手势嵌入推理与本地 XR 同步执行四步,支持指示、象形与表达三类手势。在 N=12 的用户研究中,AgentHands 相较纯语音基线在空间定位等指标上显著提升。
Google 推出 PhotoScan,一个从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和 Visceral-to-Subcutaneous 脂肪面积比(V/S)的深度学习框架。
微软研究院发布 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首个支持场景为美国手语(ASL)转英文。该模型基于超过 50 种手语、逾 10 万小时数据训练,其中约四分之一为 ASL 数据,在 FLEURS-ASL(sd-test)上取得 70 BLEURT 的零样本成绩。
推荐理由:官方披露了 SL2T 的训练规模、手语翻译难点与端侧隐私方案,可了解手语 AI 从实验室走向消费产品的路径。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 视频版与真人医生同级的评测结果,可了解多智能体异步架构如何兼顾对话延迟与临床推理。
微软研究院推出 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。该模型支持报告生成、病灶有无与否定判断、异常定位、多标签分类及导管位置检测等任务,采用生成或双推理模式。另一项独立实验中,Qwen3-VL-4B-Instruct 搭配确定性测量工具,用于评估直接计算能否改善测量依赖型病症的表现。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,采用 Apache 2.0 许可,面向本地智能体场景,可用于编码、文档分析和个人助手等隐私敏感应用。
推荐理由:Meta 开源 30B 多模态模型并给出本地智能体场景的基准对比,可据此判断本地部署的可行性。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类模型,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。
推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,可对照其与 7 倍体量模型的基准表现。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还可原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,首次实现对完整人形机器人的全身控制,并带来更精细的手部与夹爪操作能力。
推荐理由:Gemini Robotics 2 把机器人控制从上半身扩展到全身,并给出多机协作与端侧快速适配的具体路径。
Google Research 发布论文 SymptomAI,一种用于日常症状评估的对话式 AI 智能体,基于 Gemini Flash 2.0 构建五个不同提问策略的原型。
推荐理由:Google 用 1.3 万人规模的随机研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
DharmaOCR 在葡萄牙语专用基准上取得 0.925 分,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量与稳定性上保持优势。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的开源多模态 MoE 模型,同时发布 276B 总参数 12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与多模态评测数据,可据此判断开源大模型在长上下文与多模态推理上的进展。
加州大学伯克利分校 BAIR 实验室展示 2026 届博士毕业生,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价与可用入口,读者可据此判断图像与视频生成链路的成本取舍。
PaddleOCR 发布新一代通用 OCR 模型家族 PP-OCRv6,已在 Hugging Face 上线,提供 tiny、small、medium 三档,参数量从 1.5M 到 34.5M。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙和树丛清单,覆盖英国超 13 万平方公里。
Google Research 公布两项皮肤健康 AI 研究:一项发表于 JAMA Dermatology 的大规模调查中,2345 名参与者使用 AI 工具后尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近对照组 8% 的三倍。但 AI 组在判断下一步就医建议上未获统计显著提升,且比对照组更易给出不够紧急的建议(30% vs 27%)。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于端侧 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼装成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了如何让编码智能体串联两个 Space 完成图像到 3D 的流水线,方法可直接复用。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后的数秒内拍摄视频,通过深度学习在后台估算心率和静息心率。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、多语言覆盖、自定义企业策略执行和可审计推理链统一到一次推理调用中。
推荐理由:NVIDIA 发布 4B 多模态安全模型,支持自定义策略与可审计推理链,并公开训练数据集。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国境内地点并搭配风格与角色描述生成可交互世界。该能力由 Maps Imagery Grounding 驱动,目前仅支持美国地点,并随 Project Genie 逐步向全球 Google AI Ultra 200 美元订阅用户(18 岁以上)开放。
推荐理由:Project Genie 接入 Street View 真实影像,读者可了解世界模型如何用真实地点锚定生成环境。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入生成放在同一模型里,可据此判断视频创作流程的变化。
Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能此前已在全球被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
Google DeepMind 与新加坡政府达成国家 AI 合作,在新加坡推出多项计划,覆盖医疗健康、生命科学、教育和气候领域。合作包括探索 AI 辅助临床的"三方护理"、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,以及为盲人和低视力运动员开发基于 Gemma 的跑步助手。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 等渠道开放。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放渠道,可据此判断其速度与成本定位。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 在医生监督下作为护理团队成员与患者交互。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于两款医生常用 AI;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。
推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。
推荐理由:原文给出架构、训练配方与多榜成绩,可据此判断开源全模态模型在文档、音视频与智能体场景的可用性。