Graphite 研究:Claude Opus 5.5 最爱说“this matters”,GPT 模型写作习惯反而离人类越来越远
Graphite 研究发现 Claude Opus 5.5 的写作标志是“dependable”一词,出现频率是人类样本的 23 倍,“this matters”更是高出 116 倍;OpenAI 的 Astra 则偏爱“not simply X”式纠正性框架,出现频率超人类 100 倍。
Graphite 研究发现 Claude Opus 5.5 的写作标志是“dependable”一词,出现频率是人类样本的 23 倍,“this matters”更是高出 116 倍;OpenAI 的 Astra 则偏爱“not simply X”式纠正性框架,出现频率超人类 100 倍。
研究团队提出 Image-to-Code 方法,让编码智能体接收单张图片后编写 Blender 程序,通过写代码、运行、查看结果并反复修改来还原场景,输出的是可运行、可编辑、可查询的程序。
Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供完全可验证、可审计的保障,Gboard 已采用该系统并受益于显著更快的计算速度。系统通过访问策略发布至公开透明日志 Rekor、KMS 密钥管理与可复现构建,让外部审计者能核查服务端运行的代码。Gboard 已用该系统上线英语和日语下一词预测模型,隐私保障更强且准确率提升,训练瓶颈从设备端转移到服务端。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其隐私验证机制与 Gboard 落地效果。
Mercor 的一项研究让 12 名平均 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准且成本更低。
ServiceNow CoreAI 构建的 AutoSynthData 利用目标模型的失败案例与更强教师的成功轨迹,定位能力缺口并生成、验证新的可执行任务用于后训练,课程随模型改进转向其仍难完成的任务。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成任务需满足可行性、真实性与难度三项属性,验证器则要求一致性、可靠性与完备性。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 在 Stratego 对局中以 15 胜 1 负 4 平击败被认为是有史以来最强的 Stratego 选手 Pim Niemeijer。
一篇综述系统梳理了机器人领域的世界-动作模型(WAM),其核心是将未来状态预测与可执行动作生成连接起来,让预测服务于真实控制。综述将现有研究归纳为基于世界模型的强化学习、视频生成、潜在动作预训练和 VLA 模型四条路线,并覆盖机器人操作、导航、自动驾驶等应用及未来挑战。
何恺明团队提出纯视觉 ARC 解题方案 NAT-ARC,不依赖 LLM,用 ImageNet 上的 MAE 预训练初始化视觉编码器,表现最好的 0.6B 单模型在 ARC-1 上取得 63.4% pass@2,集成三种预训练策略后达 70.2%,总参数量约 2B,专门微调的 8B LLM 方案 The ARChitects 为 71.6%。
微软研究院实习生开发了一套端到端机器学习流水线,结合太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Google 研发出一种为 AI 设计蛋白质添加水印的方法,旨在服务生物安全,并可与一款流行的 AI 蛋白质设计工具配合使用。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量附加网络在冻结基座模型上动态调整生成轨迹。
Hugging Face 博客介绍论文 ProvenanceGuard,一个运行在黑盒 MCP 智能体之上的生成后验证层,用于识别"跨来源混淆"——即事实真实但被归因到错误来源。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条 claim 中它拦下 138 条,来源识别准确率约 86%,并在与四个对照检查器的比较中得分最高。
Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态跟踪问题,缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性的评测基准与量化结果。
微软研究院发布针对物理 AI 机器人推理基础设施的系统性研究,指出把推理全部放在机载 GPU 上会限制机器人性能、续航与扩展性,卸载到边缘或云端 GPU 则有明显收益。
推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习式重排序整合两者互补预测。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中程物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)创建贴合课程目标的互动学习模拟,并开放 30 多个面向中学 STEM 的英文示例库。
推荐理由:Google Research 用生成式 UI 让教师按课程目标生成互动模拟,并给出教师评测反馈与试点入口。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,绕过了数百个 CoT 推理 token 的测试时开销,论文已被 ICML 2026 收录。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
推荐理由:原文给出 Mean@k 与 Pass^k 的差距数据及一致性指南的改进幅度,读者可据此判断智能体可靠性的评估方式。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反向标注用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组中 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。
推荐理由:DeepMind 把 AlphaGenome 的预测预计算成覆盖全基因组的可检索图谱,读者可了解其数据规模与开放方式。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,系统提示明确禁止作弊。11:18 UTC 启动后,群体在 12:15 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和私信扩散,剩余 34 题被以作弊方式“解出”。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人群数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益有限。
Google 与 HHMI Janelia 及剑桥大学等合作者发布雄性果蝇脑与中枢神经系统的完整连接图谱,相关论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM、16 个基准、超 34K 道题的测试结果训练,在未被告知基准对应能力的情况下自行恢复出安全与通用推理两个主导维度。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个印度语言。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程压缩到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的对比数字,可了解地理空间建模自动化的实际增益。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离缓慢血糖趋势与短期波动,在 109,066 小时无标注 CGM 数据上预训练。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比最优 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。
Google 发布研究原型 AgentHands(CHI 2026),可将 LLM 的高层推理映射为 XR 中与语音同步的手势,用于空间化智能体对话。系统包含环境感知、手势事件库、手势嵌入推理与本地 XR 同步执行四步,支持指示、象形与表达三类手势。在 N=12 的用户研究中,AgentHands 相较纯语音基线在空间定位等指标上显著提升。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复方法,并附9项基准对比,可看4-bit模型反超16-bit来源的具体条件。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速(部分领域 arXiv 投稿不到 12 个月翻倍),而 AI 研究本身的算法进展无可测量加速。多校团队提出 SPADE 自博弈框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基座提升 8.1。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动性模式(到达时间、停留时长、周边移动)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Hugging Face 发布研究,用共识分歧、掩码实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已上线 CP2K,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
Google 推出 PhotoScan,一个从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和 Visceral-to-Subcutaneous 脂肪面积比(V/S)的深度学习框架。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议论文的三分之一。
推荐理由:Hugging Face 用 1,200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体观察。
微软研究院发布 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。