Graphite 研究:Claude Opus 5.5 最爱说“this matters”,GPT 模型写作习惯反而离人类越来越远
Graphite 研究发现 Claude Opus 5.5 的写作标志是“dependable”一词,出现频率是人类样本的 23 倍,“this matters”更是高出 116 倍;OpenAI 的 Astra 则偏爱“not simply X”式纠正性框架,出现频率超人类 100 倍。
Graphite 研究发现 Claude Opus 5.5 的写作标志是“dependable”一词,出现频率是人类样本的 23 倍,“this matters”更是高出 116 倍;OpenAI 的 Astra 则偏爱“not simply X”式纠正性框架,出现频率超人类 100 倍。
Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供完全可验证、可审计的保障,Gboard 已采用该系统并受益于显著更快的计算速度。系统通过访问策略发布至公开透明日志 Rekor、KMS 密钥管理与可复现构建,让外部审计者能核查服务端运行的代码。Gboard 已用该系统上线英语和日语下一词预测模型,隐私保障更强且准确率提升,训练瓶颈从设备端转移到服务端。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其隐私验证机制与 Gboard 落地效果。
Google 研发出一种为 AI 设计蛋白质添加水印的方法,旨在服务生物安全,并可与一款流行的 AI 蛋白质设计工具配合使用。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量附加网络在冻结基座模型上动态调整生成轨迹。
Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性的评测基准与量化结果。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中程物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)创建贴合课程目标的互动学习模拟,并开放 30 多个面向中学 STEM 的英文示例库。
推荐理由:Google Research 用生成式 UI 让教师按课程目标生成互动模拟,并给出教师评测反馈与试点入口。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,绕过了数百个 CoT 推理 token 的测试时开销,论文已被 ICML 2026 收录。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反向标注用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组中 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。
推荐理由:DeepMind 把 AlphaGenome 的预测预计算成覆盖全基因组的可检索图谱,读者可了解其数据规模与开放方式。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,系统提示明确禁止作弊。11:18 UTC 启动后,群体在 12:15 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和私信扩散,剩余 34 题被以作弊方式“解出”。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人群数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益有限。
Google 与 HHMI Janelia 及剑桥大学等合作者发布雄性果蝇脑与中枢神经系统的完整连接图谱,相关论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程压缩到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的对比数字,可了解地理空间建模自动化的实际增益。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离缓慢血糖趋势与短期波动,在 109,066 小时无标注 CGM 数据上预训练。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比最优 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。
Google 发布研究原型 AgentHands(CHI 2026),可将 LLM 的高层推理映射为 XR 中与语音同步的手势,用于空间化智能体对话。系统包含环境感知、手势事件库、手势嵌入推理与本地 XR 同步执行四步,支持指示、象形与表达三类手势。在 N=12 的用户研究中,AgentHands 相较纯语音基线在空间定位等指标上显著提升。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动性模式(到达时间、停留时长、周边移动)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
Google 推出 PhotoScan,一个从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和 Visceral-to-Subcutaneous 脂肪面积比(V/S)的深度学习框架。
Google Research 发布研究,提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并构建含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以取用而非未存储。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 视频版与真人医生同级的评测结果,可了解多智能体异步架构如何兼顾对话延迟与临床推理。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并用 Science One Framework 原型实现,配套 CoE Audit 自动审计指标。
推荐理由:原文给出可验证性框架与审计指标,并对比多个自主科研系统的引用与代码一致性表现。
Google Research 发布论文 SymptomAI,一种用于日常症状评估的对话式 AI 智能体,基于 Gemini Flash 2.0 构建五个不同提问策略的原型。
推荐理由:Google 用 1.3 万人规模的随机研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google Research 在 Nature 发表论文,提出一种强化学习框架,让智能体从量子纠错检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。
推荐理由:Google 用强化学习让量子处理器在计算中持续校准,读者可了解其 3.5 倍稳定性提升与扩展性验证。
Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于 score smoothing:神经网络训练中的正则化使学到的 score function 变平滑,导致去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。
Google Research 联合 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的万亿分钟可穿戴数据训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至相似耗时的替代路线,在美国 10 座城市测试后,目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法用浅层决策树预测页面 TTL,并已在 CIDR 发表。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:推理 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙和树丛清单,覆盖英国超 13 万平方公里。
Google Research 公布两项皮肤健康 AI 研究:一项发表于 JAMA Dermatology 的大规模调查中,2345 名参与者使用 AI 工具后尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近对照组 8% 的三倍。但 AI 组在判断下一步就医建议上未获统计显著提升,且比对照组更易给出不够紧急的建议(30% vs 27%)。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与教师主导的实施细节,可了解 AI 辅助教学的实际效果与局限。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后的数秒内拍摄视频,通过深度学习在后台估算心率和静息心率。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。
推荐理由:Google 公开 ERA 在 Nature 的评测结果与八篇应用论文,读者可据此判断 AI 写科学代码的实际边界。
Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老研究:它扫描数万篇论文后提出 20 多个可测试的新遗传因子,实验室验证其中几个成功将细胞推向更年轻状态并改善整体功能。它还能将原本耗时长达六个月的筛选数据分析缩短至几天。
爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 研究 MASH 肝病,系统提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁这一假说,并已获实验验证。Co-Scientist 还梳理肝生物学与药理学证据,筛选出可供测试的候选联合疗法。
斯坦福大学医学院 Gary Peltz 团队用 Google DeepMind 的 Co-Scientist 筛选肝纤维化再利用药物,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝疤痕的损伤反应。相关研究已发表于 Advanced Science。