跳到正文

#Agent

今日 0 条
10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。

  2. Hugging Face Blog32

    Hugging Face 发布 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建的 AutoSynthData 利用目标模型的失败案例与更强教师的成功轨迹,定位能力缺口并生成、验证新的可执行任务用于后训练,课程随模型改进转向其仍难完成的任务。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成任务需满足可行性、真实性与难度三项属性,验证器则要求一致性、可靠性与完备性。

10月1日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月30日周三
  1. AWS Machine Learning Blog62

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线

    AWS 官方博客介绍如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线,由作曲、交付、合规三个智能体在同一 GPU 实例的共享会话中协作产出可播放的 .wav。

    推荐理由:原文给出可复现的三智能体音乐制作流水线代码与实测耗时,读者可据此迁移到其他长时 GPU 工作流。

  2. NVIDIA Blog60

    NVIDIA 与 CoreWeave 将 Vera Rubin NVL72 投入生产,Cognition 为首家客户

    CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网网络,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。

    推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码的算力成本走向。

  3. AWS Machine Learning Blog62

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。

    推荐理由:官方给出 GPT-6.1 Sol 在 Bedrock 上的可用入口与成本对比,读者可据此判断智能体编码任务的性价比。

  4. AWS Machine Learning Blog22

    Amazon Quick 提示词工程基础指南

    Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,核心原则包括以具体细节消除歧义、提供业务上下文、用示例代替描述。文章给出通用提示词框架 CRISPE,涵盖上下文与约束、角色与职责、意图与输入、步骤与范围等要素,适用于构建自定义智能体、自动化流程和对话式数据分析。

9月29日周二
  1. Hugging Face Blog36

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 博客介绍论文 ProvenanceGuard,一个运行在黑盒 MCP 智能体之上的生成后验证层,用于识别"跨来源混淆"——即事实真实但被归因到错误来源。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条 claim 中它拦下 138 条,来源识别准确率约 86%,并在与四个对照检查器的比较中得分最高。

9月28日周一
  1. Hugging Face Blog71

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时给出两种尺寸、多接口能力与 OSWorld 2.0 分数,可对照前沿闭源模型看成本与参数差距。

9月26日周六
  1. GitHub Blog · AI & ML38

    GitHub Copilot 如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘,且双向同步更新。用户无需写代码,在 agent 会话中输入 /create-canvas 并用自然语言描述工作流即可生成界面,随后可继续让智能体增删列、筛选器或拉取 open PR 来调整。

9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的覆盖率迭代与崩溃分诊交给 LLM 智能体,读者可了解其任务流与工具分工设计。

9月24日周四
9月23日周三
9月21日周一
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 生成的代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需人来负责,但审查力度应随风险而定;Skills 与 MCP 解决的是不同问题,MCP 提供连接工具和数据的标准,Skills 则封装团队流程与最佳实践;RAG 并未消亡,它与 Agent、Skills、MCP 可以共存于同一工作流。

9月17日周四
  1. GitHub Blog · AI & ML67

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中并逐步发布。

    推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整数据,可看到智能体协作与人工把关的实际分工。

9月16日周三
  1. Mistral AI58

    Mistral 与 Mozilla 合作,为 Firefox 智能窗口提供模型支持

    Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,先面向法国和北美用户,英国和德国预计今年晚些时候跟进。Mistral 表示会针对区域语言、方言和文化语境微调模型,并称 Smart Window 的对话默认不保存在 Mozilla 服务器上,合作方同意零数据留存。

9月12日周六
  1. GitHub Blog · AI & ML26

    GitHub 如何用 Copilot 把营销活动运营变成代码

    GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、标签和 Actions 搭建自动化流水线,活动从单个 Issue 自动完成建站、UTM 链接生成、报名者筛选和会后清理。团队在仓库根目录放置 AGENTS.md 运行手册,Copilot 据此沿用命名规则、时区与邮件模板,流程改动以 pull request 方式评审合并。

9月11日周五
9月10日周四
  1. Hugging Face Blog62

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111,73 个节点复刻 11 条媒体管线

    Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。

    推荐理由:原文给出用 Gradio Workflow 重建 A1111 全部管线的节点构成与运行方式,可据此判断无 GPU 搭建多模型工作流的可行性。

9月9日周三
  1. Mistral AI60

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,再用 Vibe CLI 启动上百个智能体解析调用树并生成文档,最终采用规划、编码、测试、审查加人工审核的分模块工作流。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,读者可参考其数值对齐与人工审核节点的做法。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion:用多模型编排实现前沿质量

    GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时编排多个提供商的模型,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。

    推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个基准上的质量成本对照,可据此判断多模型编排在编码任务中的取舍。

9月3日周四