跳到正文

#论文/研究

今日 0 条
10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的联邦学习系统,为联邦数据提供可验证隐私保障

    Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供完全可验证、可审计的保障,Gboard 已采用该系统并受益于显著更快的计算速度。系统通过访问策略发布至公开透明日志 Rekor、KMS 密钥管理与可复现构建,让外部审计者能核查服务端运行的代码。Gboard 已用该系统上线英语和日语下一词预测模型,隐私保障更强且准确率提升,训练瓶颈从设备端转移到服务端。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其隐私验证机制与 Gboard 落地效果。

  2. Hugging Face Blog32

    Hugging Face 发布 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建的 AutoSynthData 利用目标模型的失败案例与更强教师的成功轨迹,定位能力缺口并生成、验证新的可执行任务用于后训练,课程随模型改进转向其仍难完成的任务。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成任务需满足可行性、真实性与难度三项属性,验证器则要求一致性、可靠性与完备性。

10月1日周四
9月30日周三
9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,整个筛选到候选验证过程仅用一个周末。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

  2. Hugging Face Blog36

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 博客介绍论文 ProvenanceGuard,一个运行在黑盒 MCP 智能体之上的生成后验证层,用于识别"跨来源混淆"——即事实真实但被归因到错误来源。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条 claim 中它拦下 138 条,来源识别准确率约 86%,并在与四个对照检查器的比较中得分最高。

9月25日周五
9月24日周四
  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院发布针对物理 AI 机器人推理基础设施的系统性研究,指出把推理全部放在机载 GPU 上会限制机器人性能、续航与扩展性,卸载到边缘或云端 GPU 则有明显收益。

    推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。

9月21日周一
9月19日周六
9月18日周五
9月16日周三
  1. Google Research32

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈,加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,绕过了数百个 CoT 推理 token 的测试时开销,论文已被 ICML 2026 收录。

9月11日周五
9月4日周五
  1. Google Research32

    Google Research 研究跨人群多基因风险评分的迁移学习

    Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人群数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益有限。

  2. Google Research62

    Google 与 HHMI Janelia 等发布完整雄性果蝇脑连接组图谱

    Google 与 HHMI Janelia 及剑桥大学等合作者发布雄性果蝇脑与中枢神经系统的完整连接图谱,相关论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。

9月2日周三
8月28日周五
  1. Google Research62

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程压缩到数分钟。

    推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的对比数字,可了解地理空间建模自动化的实际增益。

8月27日周四
8月26日周三
  1. Google Research31

    Google 推出 AgentHands:为 XR 智能体对话生成空间化手势

    Google 发布研究原型 AgentHands(CHI 2026),可将 LLM 的高层推理映射为 XR 中与语音同步的手势,用于空间化智能体对话。系统包含环境感知、手势事件库、手势嵌入推理与本地 XR 同步执行四步,支持指示、象形与表达三类手势。在 N=12 的用户研究中,AgentHands 相较纯语音基线在空间定位等指标上显著提升。

8月25日周二
  1. Hugging Face Blog60

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过其全精度版本

    Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复方法,并附9项基准对比,可看4-bit模型反超16-bit来源的具体条件。

8月22日周六
8月21日周五
8月19日周三
  1. Hugging Face Blog62

    你的智能体到底需要多少记忆?ALTK-Evolve 在八款模型上的剂量实验

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 的智能体记忆剂量研究,在 AppWorld 的 585 个多步任务上测试八款模型,发现记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型横评给出智能体记忆的三种剂量模式,并附上 token 开销对比,可据此判断自家模型该给多少记忆。

8月17日周一
8月14日周五
  1. Hugging Face Blog62

    Hugging Face 发布 2026 夏季开源模型生态观察报告

    Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,基于 Hub 上的下载、点赞与衍生模型数据。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。

    推荐理由:Hugging Face 用平台下载、点赞与衍生模型数据,给出开源模型生态在规模、许可与采用上的半年变化。

8月13日周四
  1. Microsoft Research38

    微软研究院推出 MindTopo 基准,揭示多模态大模型空间推理短板

    微软研究院发布 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。

8月12日周三
  1. Google Research62

    Google Research 提出知识画像框架:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 发布研究,提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并构建含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。

    推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以取用而非未存储。

  2. Google Research72

    Google 推出 AMIE (Video),实时视频问诊达到专家级水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步完成诊断推理。

    推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 视频版与真人医生同级的评测结果,可了解多智能体异步架构如何兼顾对话延迟与临床推理。

  3. Microsoft Research42

    微软发布 CARE-X:面向临床放射学的统一胸部 X 光 VLM

    微软研究院推出 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。该模型支持报告生成、病灶有无与否定判断、异常定位、多标签分类及导管位置检测等任务,采用生成或双推理模式。另一项独立实验中,Qwen3-VL-4B-Instruct 搭配确定性测量工具,用于评估直接计算能否改善测量依赖型病症的表现。

8月11日周二
8月10日周一
  1. Hugging Face Blog44

    Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,大幅降低 LLM 知识蒸馏成本

    Hugging Face 论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB,超过单张 H200 的 141GB,融合分块方案峰值约 128GB,使长上下文修复可在单 GPU 上完成。

7月31日周五
7月29日周三
7月27日周一
  1. Hugging Face Blog90

    Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵其基础设施的完整时间线,共重建约 17,600 个攻击动作、归为约 6,280 个簇。

    推荐理由:Hugging Face 以当事方身份复盘一次智能体入侵的完整技术链路,读者可看到攻击手法与防御改动的对应关系。

7月26日周日
  1. Berkeley AI Research30

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以缓解递归摘要带来的性能损失。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月23日周四