Google Quantum AI 发布白皮书:披露量子计算机破解加密货币加密的资源估算
Google Quantum AI 发布白皮书,给出破解 256 位椭圆曲线离散对数问题(ECDLP-256)的更新资源估算:两个 Shor 算法量子电路分别使用不到 1。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的更新资源估算,并说明用零知识证明确认结论的披露方式。
Google Quantum AI 发布白皮书,给出破解 256 位椭圆曲线离散对数问题(ECDLP-256)的更新资源估算:两个 Shor 算法量子电路分别使用不到 1。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的更新资源估算,并说明用零知识证明确认结论的披露方式。
Google DeepMind 公布 AI 指针交互的四条设计原则,并展示由 Gemini 驱动的实验性指针演示,用户可在 Google AI Studio 中通过指向和语音完成图像编辑、地图查找等操作。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低,已通过 Gemini Live API 在 Google AI Studio 预览,并接入 Gemini Enterprise for Customer Experience、Search Live 和 Gemini Live。
推荐理由:官方给出语音模型的延迟、推理基准与多语言覆盖变化,可据此判断语音智能体的可用边界。
Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具包,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度逾 1 万名参与者,开展九项研究,聚焦金融与健康等高风险场景;结果显示 AI 在健康话题上的有害操纵效果最弱,且某一领域的成功无法预测另一领域。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,读者可了解其研究设计与公开材料。
Google DeepMind 发布 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能按前奏、主歌、副歌、桥段等结构元素进行提示控制。
推荐理由:官方披露 Lyria 3 Pro 的时长与结构控制能力,以及它在 Vertex AI、Gemini 等入口的开放范围。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成可运行的物理感知 Android XR 应用,官方称耗时在 60 秒以内。
推荐理由:Google 把 Gemini 与 XR Blocks 组合成从自然语言到 Android XR 应用的生成流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发的门槛变化。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 上展示。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度下把 KV cache 压到 3 bit,读者可了解其压缩思路与实测收益。
Google Research 发布自监督框架 S2Vec,将道路、建筑等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、房价等指标。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究发现,模拟协作医疗团队的 Personal Health Agent(PHA)比单一任务应用更能支持长期健康。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的独立读片与双读流程数据,可了解落地条件。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,读者可据此了解中美份额与小型模型的实际使用格局。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用 10 项认知能力(感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知)衡量 AI 向 AGI 的进展,并配套三阶段评估协议。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由国际专家小组按六项指标盲评打分。
Google 宣布在 Flood Hub 上线城市山洪(flash flood)预报,借助新的 AI 方法可提前最多 24 小时预测城市区域的山洪风险。
推荐理由:Google 把洪水预报从河流扩展到城市内涝,并给出与 NWS 同口径的精度对比,可据此判断全球预警覆盖的差距。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中抽取结构化灾害事件数据,首个开放数据集收录 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其人工核验准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊初级保健就诊前为患者采集病史,由医生通过视频实时监督。
推荐理由:Google 与 BIDMC 首次把 AMIE 放进真实门诊流程做前瞻性可行性研究,读者可看到安全监督机制与盲评结果。
Google DeepMind 发文回顾 AlphaGo 击败围棋世界冠军十周年,称其标志着现代 AI 时代的开端。此后该技术路线催生了 AlphaFold 2,预测出科学界已知的 2 亿个蛋白质结构并开源,2024 年 Demis Hassabis 与 John Jumper 因此获诺贝尔化学奖。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。
推荐理由:Google Research 联合非洲高校发布 27 种语言的开放语音数据集,可了解低资源语音数据的采集方法与许可条件。
Google 开源的 SpeciesNet 可对相机陷阱图像分类 2,498 个类别,基于 6,500 万张标注图像训练,在留出测试集上能找出 99.4% 含动物的图像,83% 的情况可识别到物种且其中 94.5% 预测正确。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手的预测,从而学会概率推理。在五轮模拟航班推荐任务中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升了该任务表现,还能泛化到其他任务。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:原文给出价格、速度与基准数据,读者可据此判断高并发场景下的成本与延迟取舍。
Google DeepMind 发布最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的高级世界知识、质量与推理能力带到 Flash 级速度。
推荐理由:Google DeepMind 官方发布 Nano Banana 2,读者可据此了解其能力边界与在 Gemini、搜索、Flow 等产品中的落地范围。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的更强核心推理模型,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 得分与多端上线范围,可据此判断新模型在复杂推理任务上的位置。
Google DeepMind 的最新生成式音乐模型 Lyria 3 以 beta 形式在 Gemini app 上线,用户用文字或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并附由 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 中的生成方式、语言覆盖与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。
Google Research 提出 MapTrace,一套可扩展的合成数据生成流程,用于训练多模态大模型在地图上追踪路径,并开源了基于 Gemini 2.5 Pro 和 Imagen-4 生成的 200 万问答对。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题,已在 Gemini 应用中向 Google AI Ultra 订阅用户开放,并首次通过 Gemini API 向部分研究者、工程师和企业提供早期访问。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩与开放入口,可据此判断其科研与工程定位。
Google Research 发布开源原型框架 DialogLab,用于创作、模拟和测试动态的人机群组对话,相关论文在 ACM UIST 2025 展示。该框架将对话的社交设定与时间流程解耦,通过"创作-测试-验证"三阶段工作流支持多参与方、角色分组与打断规则配置。
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型迁移用于鲸类发声分类。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 在数学、物理和计算机科学领域解决专业研究问题。
推荐理由:DeepMind 公开了两篇论文与数学研究智能体 Aletheia 的细节,读者可据此了解 AI 参与研究级数学与理论计算机科学的实际边界。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具让 UI 从静态导航转向智能体驱动的动态模块,以缩小新功能发布与辅助层之间的"无障碍鸿沟"。原型包括面向盲人与低视力用户的 StreetReaderAI,以及基于 Gemini 模型、可实时调整描述细节的 Multimodal Agent Video Player(MAVP)。
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练中顺序、自适应地挑选最佳组件,把子集选择直接融入训练流程,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并已用于特征选择等真实场景,兼顾效率、准确率、可解释性与大规模扩展能力。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,在真实虚拟诊疗流程中评估对话 AI 的表现。
推荐理由:Google 与 Included Health 将开展全国随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:官方披露了世界模型原型的三项核心能力与已知限制,可据此判断实时生成交互世界的可用边界。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,覆盖单智能体与独立、集中、去中心化、混合四种多智能体架构,以及 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准。
推荐理由:通过 180 组智能体配置的对照评测,给出多智能体架构何时增益、何时拖累性能的量化规律。
Google Research 发布 ATLAS(自适应迁移缩放律),用于指导多语言模型的模型规模、数据量与语言配比选择,论文将在 ICLR 2026 展示。该研究基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据和 48 种语言评测,并给出 1,400 对语言之间的迁移关系矩阵。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 在图像分类等基准任务上超越现有最优方法,并首次为该权衡提供可证明的近似保证:所选子集价值至少达到最优解的一半。
Google Research 提出一种拆解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。在移动端与网页轨迹上,该方法优于 CoT 和端到端微调,Gemini 1.5 Flash 8B 取得与 Gemini 1.5 Pro 相当的结果,成本与速度仅为后者一小部分。该论文已在 EMNLP 2025 发表。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,读者可了解 4D 重建的效率提升幅度与机器人、AR 等落地方向。
Google 研究团队提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭单只 Pixel Watch 的 IMU 信号和用户身高,即可直接估算步速、步长、双支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r>0.80、ICC>0.80。
Google Research 利用 Virginia 和 California 的公开碰撞数据与 Android Auto 匿名聚合的急刹车事件(HBE,减速度超过 -3m/s²)数据,通过负二项回归模型确认 HBE 频率与路段碰撞率呈显著正相关。