Cloudflare Agent Cloud 引入 OpenAI GPT-5.4 与 Codex,支持企业构建智能体工作流
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体,兼顾速度与安全。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体,兼顾速度与安全。
OpenAI 发布面向金融服务机构的 AI 资源,包含提示词包、GPTs、指南和工具,帮助机构安全部署并规模化应用 AI。
CyberAgent 采用 ChatGPT Enterprise 与 Codex,在广告、媒体和游戏业务中安全扩大 AI 应用规模、提升质量并加快决策。
Hugging Face 发布 gradio.Server,它扩展自 FastAPI,允许用 React、Svelte 或原生 HTML/JS 自建前端,同时保留 Gradio 的排队、SSE 流式、并发控制、MCP 支持和 Spaces 上的 ZeroGPU。
推荐理由:官方给出 gradio.Server 的完整示例与代码,读者可据此判断自建前端如何复用 Gradio 的队列与 GPU 能力。
Mistral AI 发布 Spaces CLI,一款同时面向人类开发者与编码智能体的命令行工具,通过 `spaces init`、`spaces dev` 等命令可从零搭建带热重载、数据库和 Dockerfile 的多服务项目。
Anthropic 正限制 Pro/Max 订阅者在开放智能体平台中访问 Claude 模型,Hugging Face 建议将 OpenClaw、Pi、Open Code 等智能体迁移到开源模型。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 上展示。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度下把 KV cache 压到 3 bit,读者可了解其压缩思路与实测收益。
NVIDIA 发布教程,介绍用单张 GPU 在不到一天内把通用嵌入模型微调为领域专用模型,全程无需人工标注。流程基于 NeMo Data Designer 生成合成问答对、用难负样本挖掘做对比学习,微调 Llama-Nemotron-Embed-1B-v2,在 NVIDIA 公开文档数据集上 Recall@10 与 NDCG@10 提升超过 10%。
推荐理由:NVIDIA 公开了从合成数据生成到 NIM 部署的完整嵌入模型微调流程,并给出可复现的评测数字。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段,并同时支持稠密与 MoE 架构及多模态输入。
推荐理由:原文给出企业用自有数据训练前沿模型的分阶段训练路径与智能体落地方式,可据此判断企业自建模型的可行边界。
OpenAI 基于 Responses API、shell 工具和托管容器构建了一套智能体运行时,让智能体能够使用文件、工具和状态,并以安全、可扩展的方式运行。该方案将 Responses API 从模型调用接口扩展为具备计算机环境的智能体运行平台。
Hugging Face 调研了 16 个围绕异步训练构建的开源 RL 库,并按编排原语、缓冲区设计、权重同步协议、staleness 管理、部分 rollout 处理、LoRA 支持、分布式训练后端 7 个维度进行对比。
Hugging Face Hub 推出 Storage Buckets,一种面向生产 ML 中间产物的可变、类 S3 对象存储,可在 Hub 浏览、用 Python 脚本操作或通过 hf CLI 管理。
推荐理由:官方给出 Buckets 的定位与 Xet 去重、预热的取舍,可据此判断它是否适合替代现有中间产物存储流程。
Snowflake AI Research 的 Ulysses 序列并行(属于 ALST 协议)通过注意力头并行把注意力计算分散到多张 GPU,支持百万级 token 上下文训练。
Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。
OpenAI 公布其与 Department of War 的合同细节,内容涵盖安全红线、法律保护条款,以及 AI 系统在涉密环境中的部署方式。
推荐理由:OpenAI 官方披露与国防部门合同的边界设定,可了解 AI 进入涉密环境的合规与部署约束。
OpenAI 在 Amazon Bedrock 推出面向智能体的有状态运行时(Stateful Runtime for Agents),为基于 OpenAI 的多步 AI 工作流提供持久编排、记忆与安全执行能力。
OpenAI 与 Amazon 宣布战略合作,将 OpenAI 的 Frontier 平台引入 AWS。合作范围涵盖 AI 基础设施扩展、定制模型以及企业级 AI 智能体。
推荐理由:OpenAI 与 Amazon 的这次合作把 Frontier 平台接入 AWS,读者可据此了解企业级 AI 基础设施与智能体的落地路径。
Hugging Face 发布博客,讲解 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端、专家并行和 MoE 训练四个方面。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重做的权重加载、专家后端与并行方案,并给出 v4 与 v5 的加载耗时对比。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
Hugging Face 宣布 GGML 及其 llama.cpp 团队加入,Georgi Gerganov 和团队将全职继续维护 llama.cpp,并保持技术方向与社区上的完全自主权。
推荐理由:官方说明 GGML 团队加入 Hugging Face 后的权责与资源安排,可据此判断 llama.cpp 后续走向。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析了 310 条 ITBench SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
OpenAI 为 Codex 和 Sora 构建了一套实时访问系统,将速率限制、用量追踪与 credits 结合,以支撑持续访问。该系统旨在突破单一速率限制的局限,实现更稳定的规模化接入。
Hugging Face 构建了一个 agent skill,教编码智能体编写生产级 CUDA kernel,并用 Claude 和 Codex 在 diffusers 与 transformers 两个真实目标上端到端生成了可用的 kernel、PyTorch 绑定和基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识打包成 agent skill,并给出两个真实目标的端到端基准数据,可迁移到其他领域技能设计。
OpenAI for Government 宣布在 GenAI.mil 上部署定制版 ChatGPT,为美国国防团队提供安全、注重安全的 AI 能力。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方给出 v4 的 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端推理的工程收益。
Hugging Face 发布 SyGra 2.0.0 的 Studio,一个把合成数据生成变成可视化画布操作的交互环境,所有可视化配置都会生成对应的 SyGra 图配置与任务执行脚本。
OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限与治理能力。
推荐理由:OpenAI 把智能体构建、部署与治理收进一个企业平台,可据此判断企业级 Agent 落地路径。
Hugging Face 博客系列第三篇指出,开源已成为中国 AI 机构近期的主流路线,DeepSeek 是 Hugging Face 上关注度最高的组织,Qwen 位列第四。
中国开源模型近一年几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在算力约束下平衡能力与成本。开源方向从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露新版本号、参数规模或 benchmark 数据。
OpenAI 发文介绍其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。文中提到的主要手段包括副本、缓存、限流和工作负载隔离。
Mistral AI 团队在预生产测试中发现,Mistral Medium 3.1 在 vLLM 上启用图编译并采用 NIXL 的 Prefill/Decode 分离式部署时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
OpenAI 公布 Stargate Community 计划,提出以社区优先的方式建设 AI 基础设施。该计划采用因地制宜的方案,由社区意见、能源需求与劳动力优先事项共同塑造。
ServiceNow 扩大对 OpenAI 前沿模型的接入,用于驱动 ServiceNow 平台上的 AI 企业工作流、摘要、搜索与语音功能。
微软发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下将查询头数量翻倍,使解码速度与标准 Transformer 持平,且无需自定义注意力内核。
OpenAI 发起一项新的 RFP,旨在通过加速美国本土制造、创造就业岗位并扩展 AI 基础设施,来强化美国 AI 供应链。
OpenAI 宣布与 Cerebras 合作,新增 750MW 高速 AI 算力,用于降低推理延迟并让 ChatGPT 在实时 AI 负载下响应更快。
OpenAI 与软银集团合作,联合 SB Energy 开发多吉瓦级 AI 数据中心园区,其中包括一座位于德克萨斯州、容量 1.2 GW 的设施,用于支持 Stargate 计划。
Netomi 借助 GPT-4.1 和 GPT-5.2 扩展企业级 AI 智能体,通过并发、治理与多步推理支撑可靠的生产工作流。该方案面向企业规模化部署场景,强调智能体系统在生产环境中的稳定性。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。
推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。