一个智能体如何串联两个 Hugging Face Space 搭建 3D 巴黎画廊
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼装成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了如何让编码智能体串联两个 Space 完成图像到 3D 的流水线,方法可直接复用。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼装成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了如何让编码智能体串联两个 Space 完成图像到 3D 的流水线,方法可直接复用。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此判断开源智能体 RL 环境标准化的走向。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 与 Sufficient Context Agent 等角色协作处理多源多跳查询。
推荐理由:Google 公布 Agentic RAG 的充足上下文机制与跨语料检索数据,可据此判断多源多跳检索的落地方式。
Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类用户和编码智能体,通过环境变量自动识别 Claude Code、Codex、Cursor 等智能体并切换输出格式。
推荐理由:官方给出 hf CLI 面向智能体重构的细节与基准数据,可据此判断命令行工具如何适配编码智能体。
Hcompany 发布 Holo3.1 系列 computer-use 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。
推荐理由:Holo3.1 给出跨环境、跨框架与本地量化的具体数据,可据此判断端侧 computer-use 智能体的部署成本。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升 2 倍以上。模型已在 Hugging Face 开放下载,架构、训练与评测细节见技术报告。
推荐理由:JetBrains 开源 12B MoE 模型,激活 2.5B 参数并主打 2 倍以上推理速度,可据此判断轻量模型在 RAG 与子智能体中的定位。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。
推荐理由:Mistral 一次性公布工业 AI 栈、Vibe 智能体与自建数据中心,可据此判断其企业级全栈路线。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类任务,原有对话、设置和订阅方案一并迁移。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作与编码两种模式的能力边界和定价。
Hugging Face 在 TRL 中落地 Delta Weight Sync:只把 RL 优化步之间发生变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步落到可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的成本结构变化。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,把指令遵循、推理和编码合并到同一套权重中,以修改版 MIT 许可开放权重,公开预览阶段成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:Mistral 把编码智能体搬到云端并同步放出 128B 开源权重,读者可据此判断自托管与异步编码的可行边界。
Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,目前处于 Public Preview。
推荐理由:原文给出连接器的注册、调用与人工审批代码路径,读者可据此判断企业级 MCP 集成如何从散落代码收拢到平台。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。
推荐理由:Google 公开 ERA 在 Nature 的评测结果与八篇应用论文,读者可据此判断 AI 写科学代码的实际边界。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国境内地点并搭配风格与角色描述生成可交互世界。该能力由 Maps Imagery Grounding 驱动,目前仅支持美国地点,并随 Project Genie 逐步向全球 Google AI Ultra 200 美元订阅用户(18 岁以上)开放。
推荐理由:Project Genie 接入 Street View 真实影像,读者可了解世界模型如何用真实地点锚定生成环境。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,可据此判断智能体在科研流程中的落点。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 等渠道开放。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放渠道,可据此判断其速度与成本定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文给出多智能体系统的三阶段架构与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体机制。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计并发现更高效的缓存替换策略。
推荐理由:汇总 AlphaEvolve 一年来在基因组、电网、量子物理与 TPU 设计等领域的落地数据,可看到编码智能体跨领域应用的具体边界。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 在医生监督下作为护理团队成员与患者交互。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于两款医生常用 AI;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。
推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的实际用法,可据此判断 AI 辅助科研的落地边界。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。
推荐理由:Mistral 把企业 AI 编排层做成 Studio 内的一体化产品,读者可据此判断生产级智能体落地的工程门槛。