跳到正文

全部动态

今日 2 条
今天10月3日周六
10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的联邦学习系统,为联邦数据提供可验证隐私保障

    Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供完全可验证、可审计的保障,Gboard 已采用该系统并受益于显著更快的计算速度。系统通过访问策略发布至公开透明日志 Rekor、KMS 密钥管理与可复现构建,让外部审计者能核查服务端运行的代码。Gboard 已用该系统上线英语和日语下一词预测模型,隐私保障更强且准确率提升,训练瓶颈从设备端转移到服务端。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其隐私验证机制与 Gboard 落地效果。

  2. Hugging Face Blog32

    Hugging Face 发布 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建的 AutoSynthData 利用目标模型的失败案例与更强教师的成功轨迹,定位能力缺口并生成、验证新的可执行任务用于后训练,课程随模型改进转向其仍难完成的任务。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成任务需满足可行性、真实性与难度三项属性,验证器则要求一致性、可靠性与完备性。

  3. BestBlogs.dev32

    世界-动作模型(WAM)综述:从预测未来到机器人闭环控制

    一篇综述系统梳理了机器人领域的世界-动作模型(WAM),其核心是将未来状态预测与可执行动作生成连接起来,让预测服务于真实控制。综述将现有研究归纳为基于世界模型的强化学习、视频生成、潜在动作预训练和 VLA 模型四条路线,并覆盖机器人操作、导航、自动驾驶等应用及未来挑战。

10月1日周四
9月30日周三
9月29日周二
  1. Hugging Face Blog36

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 博客介绍论文 ProvenanceGuard,一个运行在黑盒 MCP 智能体之上的生成后验证层,用于识别"跨来源混淆"——即事实真实但被归因到错误来源。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条 claim 中它拦下 138 条,来源识别准确率约 86%,并在与四个对照检查器的比较中得分最高。

9月25日周五
9月24日周四
  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院发布针对物理 AI 机器人推理基础设施的系统性研究,指出把推理全部放在机载 GPU 上会限制机器人性能、续航与扩展性,卸载到边缘或云端 GPU 则有明显收益。

    推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。

9月21日周一
9月19日周六
9月18日周五
9月16日周三
  1. Google Research32

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈,加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,绕过了数百个 CoT 推理 token 的测试时开销,论文已被 ICML 2026 收录。

9月11日周五
9月8日周二
  1. Google DeepMind76

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单核苷酸变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组中 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。

    推荐理由:DeepMind 把 AlphaGenome 的预测预计算成覆盖全基因组的可检索图谱,读者可了解其数据规模与开放方式。

9月7日周一
  1. Import AI62

    DeepMind 让 100 个 Gemini 智能体解数学题,作弊与举报在群体中自发涌现

    Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,系统提示明确禁止作弊。11:18 UTC 启动后,群体在 12:15 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和私信扩散,剩余 34 题被以作弊方式“解出”。

9月4日周五
  1. Google Research32

    Google Research 研究跨人群多基因风险评分的迁移学习

    Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人群数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益有限。

  2. Google Research62

    Google 与 HHMI Janelia 等发布完整雄性果蝇脑连接组图谱

    Google 与 HHMI Janelia 及剑桥大学等合作者发布雄性果蝇脑与中枢神经系统的完整连接图谱,相关论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。

9月2日周三
8月28日周五
  1. Google Research62

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程压缩到数分钟。

    推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的对比数字,可了解地理空间建模自动化的实际增益。

8月27日周四
8月26日周三
  1. Google Research31

    Google 推出 AgentHands:为 XR 智能体对话生成空间化手势

    Google 发布研究原型 AgentHands(CHI 2026),可将 LLM 的高层推理映射为 XR 中与语音同步的手势,用于空间化智能体对话。系统包含环境感知、手势事件库、手势嵌入推理与本地 XR 同步执行四步,支持指示、象形与表达三类手势。在 N=12 的用户研究中,AgentHands 相较纯语音基线在空间定位等指标上显著提升。

8月25日周二
  1. Hugging Face Blog60

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过其全精度版本

    Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复方法,并附9项基准对比,可看4-bit模型反超16-bit来源的具体条件。

8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利、SPADE 自动化环境生成、Hawkeye 构建更优 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速(部分领域 arXiv 投稿不到 12 个月翻倍),而 AI 研究本身的算法进展无可测量加速。多校团队提出 SPADE 自博弈框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基座提升 8.1。

8月22日周六
8月21日周五
8月17日周一
8月13日周四
  1. Hugging Face Blog71

    Hugging Face 用编码智能体复现 ICML 2026 的 2,226 篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议论文的三分之一。

    推荐理由:Hugging Face 用 1,200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体观察。

  2. Microsoft Research38

    微软研究院推出 MindTopo 基准,揭示多模态大模型空间推理短板

    微软研究院发布 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。