GPU 管理:为什么闲置 GPU 是新的停飞飞机
Hugging Face 博客指出,AI 的下一个真正约束是 GPU 利用率而非智能本身。GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因利用率差异而拉开差距。企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让它们保持忙碌。
Hugging Face 博客指出,AI 的下一个真正约束是 GPU 利用率而非智能本身。GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因利用率差异而拉开差距。企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让它们保持忙碌。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还可原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更丰富自然的旋律结构、提示词遵循与结构感知更好的歌词、更具情感表达和发音更准确的人声,以及更易控制输出节奏与时长。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,首次实现对完整人形机器人的全身控制,并带来更精细的手部与夹爪操作能力。
推荐理由:Gemini Robotics 2 把机器人控制从上半身扩展到全身,并给出多机协作与端侧快速适配的具体路径。
Google Research 发布论文 SymptomAI,一种用于日常症状评估的对话式 AI 智能体,基于 Gemini Flash 2.0 构建五个不同提问策略的原型。
推荐理由:Google 用 1.3 万人规模的随机研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google Research 在 Nature 发表论文,提出一种强化学习框架,让智能体从量子纠错检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。
推荐理由:Google 用强化学习让量子处理器在计算中持续校准,读者可了解其 3.5 倍稳定性提升与扩展性验证。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云额度,支持 Genesis Mission 的研究人员。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家与生物安全专家用 AI 构建更具韧性的社会。
Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于 score smoothing:神经网络训练中的正则化使学到的 score function 变平滑,导致去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 整理 12 个核心模块内容,支持 10 个模块的项目生成,初期支持 8 种语言,底层由 Gemini 3.5 Flash 提供智能。首批覆盖印度 100 所试点学校。
Google Research 联合 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的万亿分钟可穿戴数据训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至相似耗时的替代路线,在美国 10 座城市测试后,目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。
Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,将顶尖研究实验室与电影制作公司配对,帮助艺术家开发新工作流与技术。双方将围绕多个项目展开长期深度研发协作,Google 同时已对 A24 进行投资。该合作初期聚焦弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。
Hugging Face 与 Cerebras 合作展示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 的推理。该架构为级联式模块化设计,依次经过 Nvidia Parakeet 语音识别、Cerebras 上的 Gemma 4 VLM 推理和阿里 Qwen3TTS 文本转语音,各层均可替换。
推荐理由:原文给出了一套可替换的实时语音到语音开源架构,读者可据此了解各层组件如何组合并复用到自己的项目。
Google Research 将建筑级屋顶反射率(albedo)数据集从 2024 年试点的 14 座城市扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价与可用入口,读者可据此判断图像与视频生成链路的成本取舍。
Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:Google 把零样本思路搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比表现。
Google Research 提出一种新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在 Pixel 9 和 10 系列上实现开箱即用的加速。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何在内存受限下提速。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法用浅层决策树预测页面 TTL,并已在 CIDR 发表。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:推理 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可据此判断智能体跨平台自动化的落地路径。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客中,试验了拟议的 Cross-Origin Storage(COS)API 如何解决 Transformers.js 的跨源缓存重复问题。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为数千个 Skills、ML 应用和 MCP Server 提供搜索入口。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,可据此判断智能体能力发现如何落地。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,开发基于 Gemini 的 AI 规划审批原型,目标是把住户规划申请的处理时间缩短 50%。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙和树丛清单,覆盖英国超 13 万平方公里。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。
Google Research 公布两项皮肤健康 AI 研究:一项发表于 JAMA Dermatology 的大规模调查中,2345 名参与者使用 AI 工具后尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近对照组 8% 的三倍。但 AI 组在判断下一步就医建议上未获统计显著提升,且比对照组更易给出不够紧急的建议(30% vs 27%)。
加州大学圣地亚哥分校在 Google 支持下,正用 2000 台退役 Pixel 手机的主板搭建数据中心,为数百名师生提供低成本、低碳的云计算。SPEC 基准显示 25-50 台手机约等于一台现代服务器,手机主板占硬件隐含碳排约 50%。该系统预计 2026 年秋季上线。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的开放权重与硬件门槛,读者可据此判断本地低并发推理的适用边界。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助,面向全球研究者征集方案。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方给出 70+ 语言实时语音翻译的连续生成机制与多端上线节奏,可据此判断实时翻译的可用形态。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于端侧 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选出 15 家机器人初创公司,提供技术指导并开放其 AI 技术栈与 Gemini 机器人模型。入选企业覆盖物流、制造、医疗、气候与导航等领域,本周在伦敦启动。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与教师主导的实施细节,可了解 AI 辅助教学的实际效果与局限。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 与 Sufficient Context Agent 等角色协作处理多源多跳查询。
推荐理由:Google 公布 Agentic RAG 的充足上下文机制与跨语料检索数据,可据此判断多源多跳检索的落地方式。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后的数秒内拍摄视频,通过深度学习在后台估算心率和静息心率。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、多语言覆盖、自定义企业策略执行和可审计推理链统一到一次推理调用中。
推荐理由:NVIDIA 发布 4B 多模态安全模型,支持自定义策略与可审计推理链,并公开训练数据集。