OpenAI 如何用 Responses API 打造智能体运行环境
OpenAI 基于 Responses API、shell 工具和托管容器构建了一套智能体运行时,让智能体能够使用文件、工具和状态,并以安全、可扩展的方式运行。该方案将 Responses API 从模型调用接口扩展为具备计算机环境的智能体运行平台。
OpenAI 基于 Responses API、shell 工具和托管容器构建了一套智能体运行时,让智能体能够使用文件、工具和状态,并以安全、可扩展的方式运行。该方案将 Responses API 从模型调用接口扩展为具备计算机环境的智能体运行平台。
Wayfair 借助 OpenAI 模型自动分拣客服工单,并大规模优化数百万条商品属性,以提升电商支持效率与商品目录准确率。
OpenAI 发布 IH-Challenge,用于训练模型优先执行可信指令,从而改进指令层级、安全可控性和对提示词注入攻击的抵抗能力。
推荐理由:OpenAI 公开 IH-Challenge 训练方法,读者可了解指令层级与提示词注入防御的一条技术路径。
ChatGPT 推出面向数学与科学的交互式可视化讲解,帮助学生实时探索公式、变量和概念。该功能由 OpenAI 官方发布,具体入口与覆盖范围尚未在摘要中说明。
OpenAI 宣布收购 AI 安全平台 Promptfoo,该平台帮助企业在开发阶段识别并修复 AI 系统中的漏洞。
推荐理由:OpenAI 收购 AI 安全平台 Promptfoo,读者可据此了解其在企业 AI 安全测试环节的布局。
OpenAI 发布 Codex Security,定位为 AI 应用安全智能体,目前处于研究预览阶段。该智能体通过分析项目上下文来检测、验证并修复复杂漏洞,官方称其置信度更高、噪声更少。
Descript 借助 OpenAI 推理模型实现大型内容库的自动本地化,在不丢失时间轴与语义的前提下完成多语言视频配音。该方案面向大规模内容库的配音场景,解决了规模化本地化中的时序与含义保持问题。
Balyasny Asset Management 通过严格的模型评估、全平台使用 OpenAI 以及智能体工作流,重构了投资研究流程。其做法是将模型评测与 agent 工作流结合,在 OpenAI 平台上搭建起一套 AI 研究引擎。
OpenAI 提出 CoT-Control,发现推理模型难以控制自身的思维链,这反而强化了可监控性作为 AI 安全保障的价值。
OpenAI 发布 GPT-5.4,称其为面向专业工作能力最强且最高效的前沿模型,具备 SOTA 级编码、电脑操作和工具搜索能力,上下文窗口为 1M token。
推荐理由:官方给出 GPT-5.4 的定位与能力清单,可据此了解前沿模型在专业工作场景的迭代方向。
OpenAI 发布面向学校的 AI 工具、认证和评估资源,帮助中小学与高校缩小 AI 能力差距、扩大机会。这些资源旨在确保教育领域的 AI 使用真正转化为发展机遇。
OpenAI 提出五种 AI 价值模型,帮助领导者按从员工熟练度到流程重塑的顺序推进 AI 落地,以构建持久的业务优势。
德甲俱乐部 VfL Wolfsburg 将 ChatGPT 推广为全俱乐部层面的能力,重点不在试点项目而在人。该俱乐部借此提升效率、创造力与知识共享,同时保持自身的足球身份认同。
OpenAI 上线 Adoption 新闻频道,提供将 AI 进展转化为业务优势的实用洞察与框架。该频道面向企业落地场景,内容聚焦可操作的实践方法与框架。
OpenAI 发布 ChatGPT for Excel 和新的金融应用集成,由 GPT-5.4 驱动,用于在受监管环境中加速建模、研究与分析。
推荐理由:OpenAI 官方发布 ChatGPT for Excel 并接入金融数据源,可了解 GPT-5.4 在受监管场景中的落地方式。
一篇新预印本将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
OpenAI 推出 Learning Outcomes Measurement Suite,用于长期评估 AI 对不同教育环境中学生学习的影响。该套件面向多样化教育场景,追踪 AI 使用与学习成果之间的关系。
Axios COO Allison Murphy 介绍了该公司如何用 AI 支持本地记者、简化新闻编辑室工作流程,并大规模产出高影响力的本地新闻。
OpenAI 发布 GPT-5.3 Instant,官方称其在日常对话中更顺畅、更实用。该条目来自 OpenAI 官方新闻页,正文未能抓取,除标题外暂无更多细节。
OpenAI 公布其与 Department of War 的合同细节,内容涵盖安全红线、法律保护条款,以及 AI 系统在涉密环境中的部署方式。
推荐理由:OpenAI 官方披露与国防部门合同的边界设定,可了解 AI 进入涉密环境的合规与部署约束。
OpenAI 在 Amazon Bedrock 推出面向智能体的有状态运行时(Stateful Runtime for Agents),为基于 OpenAI 的多步 AI 工作流提供持久编排、记忆与安全执行能力。
OpenAI 与 Amazon 宣布战略合作,将 OpenAI 的 Frontier 平台引入 AWS。合作范围涵盖 AI 基础设施扩展、定制模型以及企业级 AI 智能体。
推荐理由:OpenAI 与 Amazon 的这次合作把 Frontier 平台接入 AWS,读者可据此了解企业级 AI 基础设施与智能体的落地路径。
OpenAI 与 Microsoft 发布联合声明,称双方将继续在研究、工程和产品开发方面紧密合作。声明表示,这一合作建立在多年深度协作与共同成功的基础之上。
OpenAI 宣布获得 1100 亿美元新投资,投前估值 7300 亿美元。出资方包括 SoftBank 300 亿美元、NVIDIA 300 亿美元和 Amazon 500 亿美元。
推荐理由:OpenAI 公布 1100 亿美元新融资与投前估值,可据此观察其资本结构和主要出资方。
OpenAI 更新其心理健康安全相关工作,涵盖家长控制、可信联系人、改进的痛苦检测,以及近期诉讼进展。
OpenAI 与太平洋西北国家实验室联合推出 DraftNEPABench,用于评估 AI 编程智能体加速联邦许可审批的能力。该基准显示,NEPA 草案撰写时间有望最多缩短 15%,并推动基础设施审查现代化。
OpenAI 与 Figma 推出 Codex 集成,打通代码与设计,让团队在实现与 Figma canvas 之间自由切换、加快迭代与交付。
OpenAI 最新威胁报告剖析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,并探讨这对检测与防御意味着什么。报告聚焦于这类组合式滥用手法的识别与应对。
OpenAI 任命 Arvind KC 为首席人力官,负责帮助公司规模化扩张、强化企业文化,并主导 AI 时代工作方式的演进。
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编程能力,原因是该基准正日益受到污染,且存在测试缺陷与训练数据泄漏问题,已无法准确衡量模型进展。OpenAI 建议改用 SWE-bench Pro。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
OpenAI 公开了其 AI 模型针对 First Proof 数学挑战的证明尝试,用于测试模型在专家级问题上的研究级推理能力。该挑战聚焦研究级数学推理,OpenAI 未披露具体模型名称与成绩。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究,以加强全球应对 AGI 安全与安保风险的努力。
OpenAI 推出 OpenAI for India,在印度扩大 AI 接入,建设本地基础设施、赋能企业并提升劳动力技能。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞,覆盖发现、修复与攻击三类任务。
OpenAI 发布新预印本,显示 GPT-5.2 为胶子振幅提出一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。官方仅给出这两项功能的名称与防护目标,未披露具体机制和可用范围。
推荐理由:OpenAI 在 ChatGPT 中新增面向组织的提示词注入与数据外泄防护选项,可了解其安全边界思路。
OpenAI 推出开源工具包 GABRIEL,借助 GPT 把定性文本和图像转化为定量数据,帮助社会科学家大规模分析研究。该工具面向社会科学研究场景,目前已开源。
OpenAI 为 Codex 和 Sora 构建了一套实时访问系统,将速率限制、用量追踪与 credits 结合,以支撑持续访问。该系统旨在突破单一速率限制的局限,实现更稳定的规模化接入。
Hugging Face 构建了一个 agent skill,教编码智能体编写生产级 CUDA kernel,并用 Claude 和 Codex 在 diffusers 与 transformers 两个真实目标上端到端生成了可用的 kernel、PyTorch 绑定和基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识打包成 agent skill,并给出两个真实目标的端到端基准数据,可迁移到其他领域技能设计。