OpenAI 如何用 Responses API 打造智能体运行环境
OpenAI 基于 Responses API、shell 工具和托管容器构建了一套智能体运行时,让智能体能够使用文件、工具和状态,并以安全、可扩展的方式运行。该方案将 Responses API 从模型调用接口扩展为具备计算机环境的智能体运行平台。
OpenAI 基于 Responses API、shell 工具和托管容器构建了一套智能体运行时,让智能体能够使用文件、工具和状态,并以安全、可扩展的方式运行。该方案将 Responses API 从模型调用接口扩展为具备计算机环境的智能体运行平台。
Hugging Face 调研了 16 个围绕异步训练构建的开源 RL 库,并按编排原语、缓冲区设计、权重同步协议、staleness 管理、部分 rollout 处理、LoRA 支持、分布式训练后端 7 个维度进行对比。
Hugging Face Hub 推出 Storage Buckets,一种面向生产 ML 中间产物的可变、类 S3 对象存储,可在 Hub 浏览、用 Python 脚本操作或通过 hf CLI 管理。
推荐理由:官方给出 Buckets 的定位与 Xet 去重、预热的取舍,可据此判断它是否适合替代现有中间产物存储流程。
Snowflake AI Research 的 Ulysses 序列并行(属于 ALST 协议)通过注意力头并行把注意力计算分散到多张 GPU,支持百万级 token 上下文训练。
Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。
OpenAI 公布其与 Department of War 的合同细节,内容涵盖安全红线、法律保护条款,以及 AI 系统在涉密环境中的部署方式。
推荐理由:OpenAI 官方披露与国防部门合同的边界设定,可了解 AI 进入涉密环境的合规与部署约束。
OpenAI 在 Amazon Bedrock 推出面向智能体的有状态运行时(Stateful Runtime for Agents),为基于 OpenAI 的多步 AI 工作流提供持久编排、记忆与安全执行能力。
OpenAI 与 Amazon 宣布战略合作,将 OpenAI 的 Frontier 平台引入 AWS。合作范围涵盖 AI 基础设施扩展、定制模型以及企业级 AI 智能体。
推荐理由:OpenAI 与 Amazon 的这次合作把 Frontier 平台接入 AWS,读者可据此了解企业级 AI 基础设施与智能体的落地路径。
Hugging Face 发布博客,讲解 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端、专家并行和 MoE 训练四个方面。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重做的权重加载、专家后端与并行方案,并给出 v4 与 v5 的加载耗时对比。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
Hugging Face 宣布 GGML 及其 llama.cpp 团队加入,Georgi Gerganov 和团队将全职继续维护 llama.cpp,并保持技术方向与社区上的完全自主权。
推荐理由:官方说明 GGML 团队加入 Hugging Face 后的权责与资源安排,可据此判断 llama.cpp 后续走向。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析了 310 条 ITBench SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
OpenAI 为 Codex 和 Sora 构建了一套实时访问系统,将速率限制、用量追踪与 credits 结合,以支撑持续访问。该系统旨在突破单一速率限制的局限,实现更稳定的规模化接入。
Hugging Face 构建了一个 agent skill,教编码智能体编写生产级 CUDA kernel,并用 Claude 和 Codex 在 diffusers 与 transformers 两个真实目标上端到端生成了可用的 kernel、PyTorch 绑定和基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识打包成 agent skill,并给出两个真实目标的端到端基准数据,可迁移到其他领域技能设计。
OpenAI for Government 宣布在 GenAI.mil 上部署定制版 ChatGPT,为美国国防团队提供安全、注重安全的 AI 能力。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方给出 v4 的 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端推理的工程收益。
Hugging Face 发布 SyGra 2.0.0 的 Studio,一个把合成数据生成变成可视化画布操作的交互环境,所有可视化配置都会生成对应的 SyGra 图配置与任务执行脚本。
OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限与治理能力。
推荐理由:OpenAI 把智能体构建、部署与治理收进一个企业平台,可据此判断企业级 Agent 落地路径。
Hugging Face 博客系列第三篇指出,开源已成为中国 AI 机构近期的主流路线,DeepSeek 是 Hugging Face 上关注度最高的组织,Qwen 位列第四。
中国开源模型近一年几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在算力约束下平衡能力与成本。开源方向从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露新版本号、参数规模或 benchmark 数据。
OpenAI 发文介绍其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。文中提到的主要手段包括副本、缓存、限流和工作负载隔离。
Mistral AI 团队在预生产测试中发现,Mistral Medium 3.1 在 vLLM 上启用图编译并采用 NIXL 的 Prefill/Decode 分离式部署时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
OpenAI 公布 Stargate Community 计划,提出以社区优先的方式建设 AI 基础设施。该计划采用因地制宜的方案,由社区意见、能源需求与劳动力优先事项共同塑造。
ServiceNow 扩大对 OpenAI 前沿模型的接入,用于驱动 ServiceNow 平台上的 AI 企业工作流、摘要、搜索与语音功能。
微软发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下将查询头数量翻倍,使解码速度与标准 Transformer 持平,且无需自定义注意力内核。
OpenAI 发起一项新的 RFP,旨在通过加速美国本土制造、创造就业岗位并扩展 AI 基础设施,来强化美国 AI 供应链。
OpenAI 宣布与 Cerebras 合作,新增 750MW 高速 AI 算力,用于降低推理延迟并让 ChatGPT 在实时 AI 负载下响应更快。
OpenAI 与软银集团合作,联合 SB Energy 开发多吉瓦级 AI 数据中心园区,其中包括一座位于德克萨斯州、容量 1.2 GW 的设施,用于支持 Stargate 计划。
Netomi 借助 GPT-4.1 和 GPT-5.2 扩展企业级 AI 智能体,通过并发、治理与多步推理支撑可靠的生产工作流。该方案面向企业规模化部署场景,强调智能体系统在生产环境中的稳定性。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。
推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。
llama.cpp server 新增 router 模式,无需重启即可动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;模型按需加载,超过 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。
推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型热切换与显存回收的具体做法。
Hugging Face 推出 swift-huggingface,一个面向 Hub 的完整 Swift 客户端包,可独立使用,后续将并入 swift-transformers 替换现有 HubApi。它提供完整 Hub API 覆盖、断点续传与进度追踪、与 Python 兼容的共享缓存,以及 TokenProvider 认证和 OAuth 2.0 支持,基于分块去重的 Xet 存储后端即将上线。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天经 pip 安装超 300 万次,累计安装量超 12 亿次。
推荐理由:官方给出 v5 在模型定义、训练、推理与量化上的重构方向,可据此判断生态工具链的兼容变化。
OpenAI 为 ChatGPT Enterprise、ChatGPT Edu 和 API Platform 扩展数据驻留能力,符合条件的客户可将静态数据存储于所在区域。
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,来提升高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Hugging Face 分享构建 SOTA 深度研究智能体的经验:七个月前其首版架构因假设过于复杂,在新一代模型到来后成为瓶颈,被迫推倒重建。团队转向更简化的编排逻辑并依赖模型自主性,同时借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。
OVHcloud 正式加入 Hugging Face Hub 的 Inference Providers 生态,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源模型。
OpenAI 与富士康达成合作,将在美国设计并制造下一代 AI 基础设施硬件。双方将共同开发多代数据中心系统,强化美国本土供应链,并在美国国内生产关键组件,以加速先进 AI 基础设施建设。
AnyLanguageModel 发布,这是一个 Swift 包,可作为 Apple Foundation Models 框架的 drop-in 替代,只需把 import FoundationModels 换成 import AnyLanguageModel 即可切换模型提供方。