OpenAI 前沿模型与 Codex 上线 AWS
OpenAI 前沿模型与 Codex 已在 AWS 正式可用,企业可通过现有的 AWS 环境、控制项和采购流程接入 OpenAI。OpenAI 表示客户可借此更快从评估阶段推进到生产部署。
OpenAI 前沿模型与 Codex 已在 AWS 正式可用,企业可通过现有的 AWS 环境、控制项和采购流程接入 OpenAI。OpenAI 表示客户可借此更快从评估阶段推进到生产部署。
Hugging Face 发布 PyTorch 性能分析系列第一篇,讲解如何用 torch.profiler 分析矩阵乘法加法运算。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。
推荐理由:Mistral 一次性公布工业 AI 栈、Vibe 智能体与自建数据中心,可据此判断其企业级全栈路线。
Mistral 将 Emmi AI 纳入麾下,推出面向工业工程的物理 AI 基础能力,可从几何与边界条件直接预测物理场,单次前向推理在单 GPU 上以秒级完成。该能力面向设计迭代提速,传统求解器保留用于验证与边缘场景,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
Cisco 与 OpenAI 正用 Codex 重塑企业工程,帮助 Cisco 扩展 AI 原生开发、加速 AI Defense 工作并自动化缺陷修复。
Hugging Face 让 Reachy Mini 机器人实现完全本地语音对话,无需云端和 API key。
Hugging Face 在 TRL 中落地 Delta Weight Sync:只把 RL 优化步之间发生变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步落到可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的成本结构变化。
Mistral AI 本周签署最终协议,收购奥地利 Physics AI 公司 Emmi AI,以强化其面向工业企业的 AI 转型服务能力。Emmi AI 专注物理 AI 与大型工程模型,可将多日计算替换为实时仿真并构建数字孪生,其 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购补齐物理仿真与工业数据能力,读者可了解其面向工程场景的 AI 布局方向。
Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,目前处于 Public Preview。
推荐理由:原文给出连接器的注册、调用与人工审批代码路径,读者可据此判断企业级 MCP 集成如何从散落代码收拢到平台。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排序模型,参数规模覆盖 17m、32m、68m、150m、400m 到 1b,均基于 Ettin ModernBERT 编码器构建。
PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5、PaddleOCR-VL 1.5 等模型。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署环境,让企业在自有数据和业务流程中安全部署 AI 编程智能体。
Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能此前已在全球被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
Hugging Face 发文解析连续批处理中的异步化,指出默认同步批处理下 CPU 与 GPU 轮流工作,用 8B 模型、batch size 32 生成 8K tokens 时总耗时 300.6 秒,其中 24.0% 时间 GPU 处于空闲等待 CPU。
OpenAI 为在 Windows 上启用 Codex 构建了安全沙箱,通过受控的文件访问和网络限制来隔离其运行环境。该沙箱旨在兼顾安全性与有效性,让 Codex 能在 Windows 平台受限地执行任务。
Hugging Face 发布系列文章,分析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。
OpenAI 成立新企业部署公司 DeployCo,帮助各类组织将前沿 AI 投入生产环境,并转化为可衡量的业务成果。该公司聚焦企业级部署环节,目标是让前沿 AI 真正落地并产生业务影响。
OpenAI 通过沙箱、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持编程智能体的安全合规采用。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:processed_logprobs 语义、V1 专属运行时默认值、inflight 权重更新路径,以及最终投影所用的 fp32 lm_head。
OpenAI 推出 MRC(Multipath Reliable Connection)超级计算机网络协议,通过 OCP 开放发布,用于提升大规模 AI 训练集群的韧性与性能。
OpenAI 重建了其 WebRTC 技术栈,以支撑实时语音 AI 的低延迟、全球规模与流畅的对话轮转。该方案面向大规模部署场景,重点解决实时语音交互中的延迟与轮次衔接问题。
OpenAI 正扩建 Stargate 项目,通过新增数据中心容量来构建支撑 AGI 的算力基础设施,以应对不断增长的 AI 需求。
DeepInfra 正式接入 Hugging Face Hub 的 Inference Providers,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开源权重模型。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。
推荐理由:Mistral 把企业 AI 编排层做成 Studio 内的一体化产品,读者可据此判断生产级智能体落地的工程门槛。
OpenAI 本周在 Hugging Face Hub 发布开源 PII 检测模型 Privacy Filter,可在单次 128k 上下文前向传播中标注八类个人信息,采用 Apache 2.0 许可,1.5B 参数、50M 激活参数,在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章给出三个基于 Privacy Filter 的可运行应用与 gradio.Server 前后端分工写法,可迁移到自己的 PII 脱敏工具。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算岛屿并在其间异步传输数据,从而隔离局部硬件故障。
推荐理由:Google DeepMind 披露 Decoupled DiLoCo 的异步训练架构,读者可了解跨数据中心训练在带宽与容错上的取舍。
OpenAI 详解 Codex 智能体循环如何借助 WebSockets 与连接级缓存降低 API 开销并改善模型延迟。该文深入 Responses API 的智能体工作流,说明连接复用对减少请求开销的作用。
Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使长时程规划更稳健。
Hyatt 在全球员工队伍中部署 ChatGPT Enterprise,使用 GPT-5.4 和 Codex 提升生产力、运营效率与宾客体验。OpenAI 为此次落地提供支持。
Hugging Face 发布了一个 Skill 和配套测试工具,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试工具,读者可了解其流程与对评审者的减负方式。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体,兼顾速度与安全。
OpenAI 发布面向金融服务机构的 AI 资源,包含提示词包、GPTs、指南和工具,帮助机构安全部署并规模化应用 AI。
CyberAgent 采用 ChatGPT Enterprise 与 Codex,在广告、媒体和游戏业务中安全扩大 AI 应用规模、提升质量并加快决策。
Hugging Face 发布 gradio.Server,它扩展自 FastAPI,允许用 React、Svelte 或原生 HTML/JS 自建前端,同时保留 Gradio 的排队、SSE 流式、并发控制、MCP 支持和 Spaces 上的 ZeroGPU。
推荐理由:官方给出 gradio.Server 的完整示例与代码,读者可据此判断自建前端如何复用 Gradio 的队列与 GPU 能力。
Mistral AI 发布 Spaces CLI,一款同时面向人类开发者与编码智能体的命令行工具,通过 `spaces init`、`spaces dev` 等命令可从零搭建带热重载、数据库和 Dockerfile 的多服务项目。
Anthropic 正限制 Pro/Max 订阅者在开放智能体平台中访问 Claude 模型,Hugging Face 建议将 OpenClaw、Pi、Open Code 等智能体迁移到开源模型。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 上展示。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度下把 KV cache 压到 3 bit,读者可了解其压缩思路与实测收益。
NVIDIA 发布教程,介绍用单张 GPU 在不到一天内把通用嵌入模型微调为领域专用模型,全程无需人工标注。流程基于 NeMo Data Designer 生成合成问答对、用难负样本挖掘做对比学习,微调 Llama-Nemotron-Embed-1B-v2,在 NVIDIA 公开文档数据集上 Recall@10 与 NDCG@10 提升超过 10%。
推荐理由:NVIDIA 公开了从合成数据生成到 NIM 部署的完整嵌入模型微调流程,并给出可复现的评测数字。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段,并同时支持稠密与 MoE 架构及多模态输入。
推荐理由:原文给出企业用自有数据训练前沿模型的分阶段训练路径与智能体落地方式,可据此判断企业自建模型的可行边界。