跳到正文

#Agent

今日 20 条
8月17日周一
8月14日周五
  1. Hugging Face Blog62

    Hugging Face 发布 2026 夏季开源模型生态观察报告

    Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,基于 Hub 上的下载、点赞与衍生模型数据。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。

    推荐理由:Hugging Face 用平台下载、点赞与衍生模型数据,给出开源模型生态在规模、许可与采用上的半年变化。

8月13日周四
  1. Hugging Face Blog71

    Hugging Face 用编码智能体复现 ICML 2026 的 2,226 篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议论文的三分之一。

    推荐理由:Hugging Face 用 1,200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体观察。

8月12日周三
  1. Google Research72

    Google 推出 AMIE (Video),实时视频问诊达到专家级水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步完成诊断推理。

    推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 视频版与真人医生同级的评测结果,可了解多智能体异步架构如何兼顾对话延迟与临床推理。

8月11日周二
8月10日周一
8月4日周二
  1. Microsoft Research72

    微软研究院开源 Orchard:面向可扩展智能体的开放框架

    微软研究院发布开源框架 Orchard,核心是 Orchard Env 这一可复用的 Kubernetes 环境服务,支持软件工程、网页导航和个人助理等任务,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。

    推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的做法。

8月3日周一
7月31日周五
7月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还可原生调用 Google Search 等工具。

    推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。

7月28日周二
7月27日周一
  1. Hugging Face Blog90

    Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵其基础设施的完整时间线,共重建约 17,600 个攻击动作、归为约 6,280 个簇。

    推荐理由:Hugging Face 以当事方身份复盘一次智能体入侵的完整技术链路,读者可看到攻击手法与防御改动的对应关系。

7月26日周日
  1. Berkeley AI Research30

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以缓解递归摘要带来的性能损失。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月23日周四
7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

    推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。

7月16日周四
7月14日周二
7月13日周一
  1. Google DeepMind32

    Google DeepMind 推出 Gemini 驱动的 ATL Saathi,为印度 Tinkering Lab 教师提供 24/7 助教

    Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 整理 12 个核心模块内容,支持 10 个模块的项目生成,初期支持 8 种语言,底层由 Gemini 3.5 Flash 提供智能。首批覆盖印度 100 所试点学校。

7月9日周四
  1. Mistral AI38

    Mistral Studio 为 Prompts 和 Skills 提供版本管理系统

    Mistral Studio 现已上线 Prompts 和 Skills 管理功能,为每个提示词和技能提供版本记录、明确归属和可追溯性。每个版本不可篡改,支持对比、回滚和审计日志,并可通过标签区分 Production 与 Staging。资产可通过 MCP server 直接调用,确保生产环境运行的是受治理的同一版本,数据保留在企业边界内。

  2. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 联合 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用五百万人的万亿分钟可穿戴数据训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。

7月7日周二
7月6日周一
7月1日周三
  1. Hugging Face Blog39

    ScarfBench:面向企业级 Java 框架迁移的 AI 智能体基准测试

    Hugging Face 发布开源基准 ScarfBench,用于评测 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。评测显示最强智能体行为成功率不足 10%,Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。

6月29日周一
  1. Import AI38

    Import AI 463:NVIDIA 用 ENPIRE 让机器人自我改进;1 万卡中国 GPU 集群;人类时代的挽歌

    NVIDIA 推出 ENPIRE 框架,让编码智能体自主驱动真实机器人完成策略迭代,在 PushT、整理插针、用切割器剪断扎带等任务上达到 99% 成功率,测试硬件为 I2RT 的 YAM 双臂机器人加 NVIDIA RTX 5090 工作站。GPT-5.5(Codex)与 Opus 4.7(Claude Code)表现互有胜负,Kimi-2.6 落后,8 个智能体并行时得分更高。

6月25日周四
6月23日周二
  1. Mistral AI71

    Mistral 发布 OCR 4,支持 170 种语言与单容器自托管

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,独立标注者在 600 多份文档的盲评中平均 72% 的情况下更偏好其输出。

    推荐理由:OCR 4 把边界框、块分类和置信度分数一并输出,读者可据此判断文档解析如何接入 RAG 与智能体流程。

6月22日周一
6月19日周五
  1. Hugging Face Blog48

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。

6月18日周四
  1. Hugging Face Blog62

    Hugging Face 发布 agent-eval:在自有工具上评测开源模型的智能体表现

    Hugging Face 发布 agent-eval 工具,用于评测智能体使用某个库完成任务的全过程,而不只看最终答案,并以 transformers 为案例在模型、版本、任务三个维度上展开测试。

    推荐理由:原文给出了一套可复用的工具基准方法,并展示了同一改动对不同规模模型效果相反的具体证据。

6月17日周三
  1. Hugging Face Blog62

    用 Strands Agents 和 LeRobot 把 Hugging Face Hub 数据集接到机器人硬件

    AWS 开源的 Strands Robots SDK(Apache 2.0)把 LeRobot 栈封装成 AgentTools,让一个 Strands 智能体在单次循环里完成仿真录制演示、推送 LeRobotDataset 到 Hub、跑策略、再以改一个关键字参数的方式部署到实体 SO-101,并通过 Zenoh 对等网格广播指令到多台机器人。

    推荐理由:AWS 团队给出从 Hub 数据集到实体机器人的五步流程,可看到仿真与真机共用同一数据集格式的工程取舍。

  2. Hugging Face Blog88

    智谱发布 GLM-5.2:面向长程任务,支持 1M 上下文并采用 MIT 开源许可

    智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文上稳定支撑长程工作,并以 MIT 开源许可发布。模型引入 IndexShare 架构,每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9 倍,同时改进 MTP 层使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文与长程编码能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。