跳到正文

#Google

今日 6 条
9月2日周三
  1. Google DeepMind75

    Google DeepMind 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出视频分析在 token 消耗、成本与准确率上的量化变化,以及 API 启用方式,便于开发者评估是否迁移现有视频处理流程。

9月1日周二
8月28日周五
  1. Google Research62

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程压缩到数分钟。

    推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的对比数字,可了解地理空间建模自动化的实际增益。

  2. Google DeepMind74

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。

    推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与 API 入口,可据此判断生成视频工作流的可控性变化。

8月27日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均 WER 为 4.0%,非流式 2.6%;相比此前的 Chirp 3,最终转写时间改善 70%。

    推荐理由:官方给出流式与非流式两套 API 的 WER 数据和相对 Chirp 3 的延迟提升,便于判断语音转写能否接入现有工作流。

8月26日周三
  1. Google Research31

    Google 推出 AgentHands:为 XR 智能体对话生成空间化手势

    Google 发布研究原型 AgentHands(CHI 2026),可将 LLM 的高层推理映射为 XR 中与语音同步的手势,用于空间化智能体对话。系统包含环境感知、手势事件库、手势嵌入推理与本地 XR 同步执行四步,支持指示、象形与表达三类手势。在 N=12 的用户研究中,AgentHands 相较纯语音基线在空间定位等指标上显著提升。

8月22日周六
8月21日周五
8月17日周一
8月14日周五
8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首个支持场景为美国手语(ASL)转英文。该模型基于超过 50 种手语、逾 10 万小时数据训练,其中约四分之一为 ASL 数据,在 FLEURS-ASL(sd-test)上取得 70 BLEURT 的零样本成绩。

    推荐理由:官方披露了 SL2T 的训练规模、手语翻译难点与端侧隐私方案,可了解手语 AI 从实验室走向消费产品的路径。

  2. Google Research62

    Google Research 提出知识画像框架:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 发布研究,提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并构建含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。

    推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以取用而非未存储。

  3. Google Research72

    Google 推出 AMIE (Video),实时视频问诊达到专家级水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步完成诊断推理。

    推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 视频版与真人医生同级的评测结果,可了解多智能体异步架构如何兼顾对话延迟与临床推理。

8月6日周四
  1. Google DeepMind74

    Google DeepMind 开源 WeatherNext 气旋预报模型

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天预警时间,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出气旋预报精度提升与开源权重,读者可据此判断气象预报工作流的可用入口。

7月31日周五
7月30日周四
  1. Hugging Face Blog22

    GPU 管理:为什么闲置 GPU 是新的停飞飞机

    Hugging Face 博客指出,AI 的下一个真正约束是 GPU 利用率而非智能本身。GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因利用率差异而拉开差距。企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让它们保持忙碌。

  2. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还可原生调用 Google Search 等工具。

    推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。

7月28日周二
7月23日周四
7月22日周三
7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

    推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。

7月16日周四
7月13日周一
  1. Google DeepMind32

    Google DeepMind 推出 Gemini 驱动的 ATL Saathi,为印度 Tinkering Lab 教师提供 24/7 助教

    Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 整理 12 个核心模块内容,支持 10 个模块的项目生成,初期支持 8 种语言,底层由 Gemini 3.5 Flash 提供智能。首批覆盖印度 100 所试点学校。

7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 联合 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用五百万人的万亿分钟可穿戴数据训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。

7月8日周三
7月3日周五
  1. Google DeepMind31

    Google DeepMind 与 A24 宣布首个研究型合作伙伴关系

    Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,将顶尖研究实验室与电影制作公司配对,帮助艺术家开发新工作流与技术。双方将围绕多个项目展开长期深度研发协作,Google 同时已对 A24 进行投资。该合作初期聚焦弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。

7月1日周三
  1. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 合作展示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 的推理。该架构为级联式模块化设计,依次经过 Nvidia Parakeet 语音识别、Cerebras 上的 Gemma 4 VLM 推理和阿里 Qwen3TTS 文本转语音,各层均可替换。

    推荐理由:原文给出了一套可替换的实时语音到语音开源架构,读者可据此了解各层组件如何组合并复用到自己的项目。

6月30日周二
  1. Google Research72

    Google 发布表格数据零样本基础模型 TabFM

    Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:Google 把零样本思路搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比表现。

6月27日周六