Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。
Cars24 借助 OpenAI 驱动的语音和聊天智能体,每月处理超 100 万分钟对话,并挽回 12% 的流失线索。该公司还将智能体工作流推广至全公司各团队。
在 AppWorld Test Challenge 的 417 个任务上,同一 CodeAct 智能体下 Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),尽管后者 token 单价更低——缓存命中率才是关键。
OpenAI 提出企业在智能体时代应以"每美元有效工作量"衡量 AI 投资回报,通过提升效率、扩展高价值工作流来管理投入。文章围绕这一指标展开,指导企业评估并放大 AI 的实际产出价值。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 整理 12 个核心模块内容,支持 10 个模块的项目生成,初期支持 8 种语言,底层由 Gemini 3.5 Flash 提供智能。首批覆盖印度 100 所试点学校。
Mistral Studio 现已上线 Prompts 和 Skills 管理功能,为每个提示词和技能提供版本记录、明确归属和可追溯性。每个版本不可篡改,支持对比、回滚和审计日志,并可通过标签区分 Production 与 Staging。资产可通过 MCP server 直接调用,确保生产环境运行的是受治理的同一版本,数据保留在企业边界内。
Google Research 联合 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的万亿分钟可穿戴数据训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。
微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型以每周刷新的方式一键部署到 Foundry 托管 GPU 平台。
推荐理由:微软把 Hugging Face 开源模型的部署运维层接进 Foundry,读者可据此判断开源模型进入企业生产环境的门槛变化。
UC Berkeley 团队提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分低于 $0.10,数据系统面临三大新挑战。
Hugging Face 发布开源基准 ScarfBench,用于评测 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。评测显示最强智能体行为成功率不足 10%,Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。
OpenAI 发布新研究论文,展示 AI 智能体正在改变工作方式,能够承担更长、更复杂的任务,并在各类岗位中提升生产力。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可据此判断智能体跨平台自动化的落地路径。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,独立标注者在 600 多份文档的盲评中平均 72% 的情况下更偏好其输出。
推荐理由:OCR 4 把边界框、块分类和置信度分数一并输出,读者可据此判断文档解析如何接入 RAG 与智能体流程。
Hugging Face 博客介绍了用本地模型 Gemma 和 Qwen 在 agent harness 中对 OpenClaw 仓库的 issue 和 PR 做分类分诊的方案。
推荐理由:作者用本地模型加受限 shell 做 PR 分类,给出了可复用的 agentic classification 配方与实测对比数据。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。
Hugging Face 发布 agent-eval 工具,用于评测智能体使用某个库完成任务的全过程,而不只看最终答案,并以 transformers 为案例在模型、版本、任务三个维度上展开测试。
推荐理由:原文给出了一套可复用的工具基准方法,并展示了同一改动对不同规模模型效果相反的具体证据。
AWS 开源的 Strands Robots SDK(Apache 2.0)把 LeRobot 栈封装成 AgentTools,让一个 Strands 智能体在单次循环里完成仿真录制演示、推送 LeRobotDataset 到 Hub、跑策略、再以改一个关键字参数的方式部署到实体 SO-101,并通过 Zenoh 对等网格广播指令到多台机器人。
推荐理由:AWS 团队给出从 Hub 数据集到实体机器人的五步流程,可看到仿真与真机共用同一数据集格式的工程取舍。
智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文上稳定支撑长程工作,并以 MIT 开源许可发布。模型引入 IndexShare 架构,每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9 倍,同时改进 MTP 层使投机解码接受长度最高提升 20%。
推荐理由:GLM-5.2 把 1M 上下文与长程编码能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为数千个 Skills、ML 应用和 MCP Server 提供搜索入口。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,可据此判断智能体能力发现如何落地。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,开发基于 Gemini 的 AI 规划审批原型,目标是把住户规划申请的处理时间缩短 50%。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。
OpenAI 推出三门 Academy 新课程,帮助人们建立实用 AI 技能、创建可复用工作流,并在日常工作中应用智能体。课程面向“下一代工作方式”,聚焦实际动手能力与工作流落地。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助,面向全球研究者征集方案。
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼装成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了如何让编码智能体串联两个 Space 完成图像到 3D 的流水线,方法可直接复用。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此判断开源智能体 RL 环境标准化的走向。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 与 Sufficient Context Agent 等角色协作处理多源多跳查询。
推荐理由:Google 公布 Agentic RAG 的充足上下文机制与跨语料检索数据,可据此判断多源多跳检索的落地方式。
Endava 正利用 AI 智能体、ChatGPT Enterprise 和 Codex 加速软件交付、自动化工作流,并在全企业范围内构建 AI 原生文化。
Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类用户和编码智能体,通过环境变量自动识别 Claude Code、Codex、Cursor 等智能体并切换输出格式。
推荐理由:官方给出 hf CLI 面向智能体重构的细节与基准数据,可据此判断命令行工具如何适配编码智能体。
Hcompany 发布 Holo3.1 系列 computer-use 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。
推荐理由:Holo3.1 给出跨环境、跨框架与本地量化的具体数据,可据此判断端侧 computer-use 智能体的部署成本。
Travelers 基于 OpenAI 打造了 AI 理赔助手 Claim Assistant,引导客户完成理赔申请,并提供 24/7 支持。该助手已在全国范围部署,用于在理赔高峰期扩展业务处理能力。
OpenAI 发布《The Next Era of Knowledge Work》报告,探讨 Codex 如何通过 AI 驱动的调研、数据分析、工作流自动化和内容创作提升生产力。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升 2 倍以上。模型已在 Hugging Face 开放下载,架构、训练与评测细节见技术报告。
推荐理由:JetBrains 开源 12B MoE 模型,激活 2.5B 参数并主打 2 倍以上推理速度,可据此判断轻量模型在 RAG 与子智能体中的定位。
Hugging Face 博客发文指出,企业级 AI 规模化落地的关键不在 LLM 本身,而在 agentic layer 中的 agent logic——即知识图谱、算法、程序分析库等软件原语,可主动引导 LLM 聚焦企业工作流、压缩上下文空间。
Google Research 在 I/O 2026 上发布 Gemini for Science 实验工具套件,包含基于 ERA 和 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation,以及基于 NotebookLM 的 Literature Insights。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。
推荐理由:Mistral 一次性公布工业 AI 栈、Vibe 智能体与自建数据中心,可据此判断其企业级全栈路线。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类任务,原有对话、设置和订阅方案一并迁移。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作与编码两种模式的能力边界和定价。
Endava 借助 Codex 构建智能体组织,将需求分析周期从数周缩短至数小时,并加速软件交付。该案例展示了 Codex 在企业级软件交付流程中的实际应用方式。
OpenAI、Thrive 和 Crete 用 Codex 构建了一个可自我改进的税务智能体,用于自动完成报税、提升准确率并加速工作流。该智能体面向税务申报场景,将申报流程自动化。
Warp 正利用 GPT-5.5 及 OpenAI 模型,在本地、云端和开源开发工作流中协调多个编码智能体。该举措是 Warp 在开源方向上的重要押注。
Hugging Face 在 TRL 中落地 Delta Weight Sync:只把 RL 优化步之间发生变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步落到可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的成本结构变化。