Google DeepMind 回顾 AlphaEvolve 一年跨领域落地成果
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计并发现更高效的缓存替换策略。
推荐理由:汇总 AlphaEvolve 一年来在基因组、电网、量子物理与 TPU 设计等领域的落地数据,可看到编码智能体跨领域应用的具体边界。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计并发现更高效的缓存替换策略。
推荐理由:汇总 AlphaEvolve 一年来在基因组、电网、量子物理与 TPU 设计等领域的落地数据,可看到编码智能体跨领域应用的具体边界。
OpenAI 发布 GPT-5.5,该模型面向编码、研究和数据分析等复杂任务,并支持跨工具使用。
推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析的定位。
OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动化复杂工作流并在云端运行,帮助团队跨工具安全地扩展工作。官方称其面向团队协作场景,强调安全地跨工具使用。
推荐理由:OpenAI 官方给出 ChatGPT 工作区智能体的定位与云端运行方式,可据此判断团队自动化流程的形态。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增电脑操作、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:官方列出 Codex 桌面端新增的电脑操作、应用内浏览与插件等能力,可据此判断编码智能体的功能边界。
OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 的更小、更快版本。两款模型针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。
推荐理由:OpenAI 官方给出 GPT-5.4 mini 与 nano 的定位,读者可据此判断小模型在编码与工具调用场景的取舍。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合并进单一开源模型,并给出与 GPT-OSS 120B 的输出长度对比,便于判断效率取舍。
Mistral 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并同步上线 Mistral Vibe 的 agent 模式与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出权重、API 与 FLTEval 评测,可对照其与 Claude 系列的成本差距。
Mistral 基于其开源编码助手 Vibe 搭建了一个自动编写 Rails RSpec 测试的智能体,可读取源码、生成或改进测试、按风格规则与覆盖率目标校验,并在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 搭建自动写 RSpec 测试智能体的完整方案,包括 AGENTS.md、skills 与自定义工具的具体做法和实测数据。
OpenAI 发布 GPT-5.4,称其为面向专业工作能力最强且最高效的前沿模型,具备 SOTA 级编码、电脑操作和工具搜索能力,上下文窗口为 1M token。
推荐理由:官方给出 GPT-5.4 的定位与能力清单,可据此了解前沿模型在专业工作场景的迭代方向。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端与状态管理,全部写在一个 Python 文件里。
推荐理由:原文给出 gr.HTML 的模板与状态同步写法,读者可据此判断单文件生成自定义组件的可行边界。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 公布实时编码模型的速度与上下文规格,可据此判断编码工作流的响应变化。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生智能体,将前沿编码能力与通用推理结合,面向长周期、真实世界的技术工作。
推荐理由:OpenAI 官方发布 Codex 原生智能体模型,可据此了解其在编码与通用推理上的定位。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于把 Codex 智能体嵌入到应用中。该接口支持流式进度、工具调用、审批和 diff 等能力。
推荐理由:OpenAI 官方说明 Codex App Server 的 JSON-RPC 接口设计,读者可了解如何把 Codex 智能体嵌入自有应用。
OpenAI 发布面向 macOS 的 Codex 应用,定位为 AI 编码与软件开发的指挥中心,支持多智能体、并行工作流和长时间运行的任务。
推荐理由:OpenAI 官方给出 Codex 桌面端的产品定位与多智能体并行能力,可据此判断 AI 编码入口的形态变化。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的使用成本。
OpenAI 发布 GPT-5.2-Codex,称其为该公司最先进的编码模型。该模型主打长程推理、大规模代码转换以及增强的网络安全能力。
推荐理由:OpenAI 官方发布新一代编码模型,读者可据此了解其在长程推理与大规模代码改造上的定位。
OpenAI 发布 GPT-5.2 系统卡增补文件,涉及 GPT-5.2-Codex。该页面为 OpenAI News 官方条目,正文内容未能抓取,仅标题可用。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支持更快、更可靠的智能体工作流。
推荐理由:官方给出 GPT-5.2 在推理、长上下文、编码与视觉上的定位,可据此判断日常专业工作与智能体流程的可用性。
Mistral AI 发布新一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比评测,可据此判断开源编码智能体的当前水位。