Google DeepMind 与英国政府共建 AI 规划审批原型,目标将审批时间减半
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,开发基于 Gemini 的 AI 规划审批原型,目标是把住户规划申请的处理时间缩短 50%。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,开发基于 Gemini 的 AI 规划审批原型,目标是把住户规划申请的处理时间缩短 50%。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。
OpenAI 推出三门 Academy 新课程,帮助人们建立实用 AI 技能、创建可复用工作流,并在日常工作中应用智能体。课程面向“下一代工作方式”,聚焦实际动手能力与工作流落地。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助,面向全球研究者征集方案。
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼装成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了如何让编码智能体串联两个 Space 完成图像到 3D 的流水线,方法可直接复用。
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,用 72 个沙盒社会环境测试 AI 的"社会性 hacking",RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的规则漏洞。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此判断开源智能体 RL 环境标准化的走向。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 与 Sufficient Context Agent 等角色协作处理多源多跳查询。
推荐理由:Google 公布 Agentic RAG 的充足上下文机制与跨语料检索数据,可据此判断多源多跳检索的落地方式。
Endava 正利用 AI 智能体、ChatGPT Enterprise 和 Codex 加速软件交付、自动化工作流,并在全企业范围内构建 AI 原生文化。
Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类用户和编码智能体,通过环境变量自动识别 Claude Code、Codex、Cursor 等智能体并切换输出格式。
推荐理由:官方给出 hf CLI 面向智能体重构的细节与基准数据,可据此判断命令行工具如何适配编码智能体。
Hcompany 发布 Holo3.1 系列 computer-use 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。
推荐理由:Holo3.1 给出跨环境、跨框架与本地量化的具体数据,可据此判断端侧 computer-use 智能体的部署成本。
Travelers 基于 OpenAI 打造了 AI 理赔助手 Claim Assistant,引导客户完成理赔申请,并提供 24/7 支持。该助手已在全国范围部署,用于在理赔高峰期扩展业务处理能力。
OpenAI 发布《The Next Era of Knowledge Work》报告,探讨 Codex 如何通过 AI 驱动的调研、数据分析、工作流自动化和内容创作提升生产力。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升 2 倍以上。模型已在 Hugging Face 开放下载,架构、训练与评测细节见技术报告。
推荐理由:JetBrains 开源 12B MoE 模型,激活 2.5B 参数并主打 2 倍以上推理速度,可据此判断轻量模型在 RAG 与子智能体中的定位。
Hugging Face 博客发文指出,企业级 AI 规模化落地的关键不在 LLM 本身,而在 agentic layer 中的 agent logic——即知识图谱、算法、程序分析库等软件原语,可主动引导 LLM 聚焦企业工作流、压缩上下文空间。
Google Research 在 I/O 2026 上发布 Gemini for Science 实验工具套件,包含基于 ERA 和 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation,以及基于 NotebookLM 的 Literature Insights。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。
推荐理由:Mistral 一次性公布工业 AI 栈、Vibe 智能体与自建数据中心,可据此判断其企业级全栈路线。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类任务,原有对话、设置和订阅方案一并迁移。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作与编码两种模式的能力边界和定价。
Endava 借助 Codex 构建智能体组织,将需求分析周期从数周缩短至数小时,并加速软件交付。该案例展示了 Codex 在企业级软件交付流程中的实际应用方式。
OpenAI、Thrive 和 Crete 用 Codex 构建了一个可自我改进的税务智能体,用于自动完成报税、提升准确率并加速工作流。该智能体面向税务申报场景,将申报流程自动化。
Warp 正利用 GPT-5.5 及 OpenAI 模型,在本地、云端和开源开发工作流中协调多个编码智能体。该举措是 Warp 在开源方向上的重要押注。
Hugging Face 在 TRL 中落地 Delta Weight Sync:只把 RL 优化步之间发生变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步落到可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的成本结构变化。
Hugging Face 发布 AI Agent 术语表,聚焦常被混用的 harness、scaffold、agent、context engineering 等概念,并给出 Agent = Model + Harness 的实用心智模型。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,把指令遵循、推理和编码合并到同一套权重中,以修改版 MIT 许可开放权重,公开预览阶段成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:Mistral 把编码智能体搬到云端并同步放出 128B 开源权重,读者可据此判断自托管与异步编码的可行边界。
Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,目前处于 Public Preview。
推荐理由:原文给出连接器的注册、调用与人工审批代码路径,读者可据此判断企业级 MCP 集成如何从散落代码收拢到平台。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。
推荐理由:Google 公开 ERA 在 Nature 的评测结果与八篇应用论文,读者可据此判断 AI 写科学代码的实际边界。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署环境,让企业在自有数据和业务流程中安全部署 AI 编程智能体。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国境内地点并搭配风格与角色描述生成可交互世界。该能力由 Maps Imagery Grounding 驱动,目前仅支持美国地点,并随 Project Genie 逐步向全球 Google AI Ultra 200 美元订阅用户(18 岁以上)开放。
推荐理由:Project Genie 接入 Street View 真实影像,读者可了解世界模型如何用真实地点锚定生成环境。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,可据此判断智能体在科研流程中的落点。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 等渠道开放。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放渠道,可据此判断其速度与成本定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文给出多智能体系统的三阶段架构与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体机制。
OpenAI 的 Parameter Golf 活动吸引 1,000+ 名参与者、收到 2,000+ 份提交,探索严格约束下的 AI 辅助机器学习研究、编码智能体、量化与新型模型设计。
Parloa 利用 OpenAI 模型打造可扩展的语音驱动 AI 客服智能体,让企业能够设计、模拟并部署可靠的实时交互。该方案面向大规模客服场景,强调客户愿意与之对话的服务体验。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计并发现更高效的缓存替换策略。
推荐理由:汇总 AlphaEvolve 一年来在基因组、电网、量子物理与 TPU 设计等领域的落地数据,可看到编码智能体跨领域应用的具体边界。
OpenAI 的 B2B Signals 研究显示,前沿企业正通过深化 AI 采用、规模化 Codex 驱动的智能体工作流来构建持久竞争优势。该研究聚焦于前沿企业与其余企业之间不断扩大的差距。
OpenAI 与 PwC 达成合作,帮助企业用 AI 智能体自动化财务工作流、改进预测、强化管控并推动 CFO 职能现代化。
Jack Clark 在 Import AI 第 455 期中判断,到 2028 年底出现无需人类参与的 AI 研发(前沿模型能自主训练出自己的后继版本)的概率约为 60%,2027 年前实现的概率约 30%。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 在医生监督下作为护理团队成员与患者交互。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于两款医生常用 AI;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。
推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的实际用法,可据此判断 AI 辅助科研的落地边界。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。
推荐理由:Mistral 把企业 AI 编排层做成 Studio 内的一体化产品,读者可据此判断生产级智能体落地的工程门槛。