用一条命令在 HF Jobs 上运行 vLLM 服务器
Hugging Face 发布教程,介绍用一条 hf jobs run 命令在 HF Jobs 上启动私有、OpenAI 兼容的 vLLM 端点,按秒计费,无需自行配置服务器或 Kubernetes。
推荐理由:原文给出从启动到查询、清理的完整命令链路,读者可据此在 HF 基础设施上自建 OpenAI 兼容端点。
Hugging Face 发布教程,介绍用一条 hf jobs run 命令在 HF Jobs 上启动私有、OpenAI 兼容的 vLLM 端点,按秒计费,无需自行配置服务器或 Kubernetes。
推荐理由:原文给出从启动到查询、清理的完整命令链路,读者可据此在 HF 基础设施上自建 OpenAI 兼容端点。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法用浅层决策树预测页面 TTL,并已在 CIDR 发表。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:推理 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可据此判断智能体跨平台自动化的落地路径。
NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%,且只需改动一行 import。
推荐理由:原文给出同一 from_pretrained() 接口下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织管理连接器访问权限的管理员控制、带连接器作用域的 API key、支持多账号登录的连接器均已 GA。
Hugging Face 与 Treble Technologies 发布首个开放、社区驱动的远场 ASR 基准 FFASR Leaderboard,覆盖 14 个模拟房间,并设有 Lab Measured 与 Lab Simulated 的 sim-to-real 验证轨道。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,独立标注者在 600 多份文档的盲评中平均 72% 的情况下更偏好其输出。
推荐理由:OCR 4 把边界框、块分类和置信度分数一并输出,读者可据此判断文档解析如何接入 RAG 与智能体流程。
Hugging Face 将 huggingface_hub 的发版周期从每 4 到 6 周缩短到每周一次,整套流程跑在单个 GitHub Actions workflow 上,由 OpenCode 驱动开放权重模型(当前为 Z.ai 的 GLM-5.2)起草 release notes 和 Slack 公告。
推荐理由:Hugging Face 公开了每周发版的完整 CI 流程,其中模型起草加确定性校验的循环可直接迁移到其他项目。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客中,试验了拟议的 Cross-Origin Storage(COS)API 如何解决 Transformers.js 的跨源缓存重复问题。
PaddleOCR 发布新一代通用 OCR 模型家族 PP-OCRv6,已在 Hugging Face 上线,提供 tiny、small、medium 三档,参数量从 1.5M 到 34.5M。
Hugging Face 博客介绍了用本地模型 Gemma 和 Qwen 在 agent harness 中对 OpenClaw 仓库的 issue 和 PR 做分类分诊的方案。
推荐理由:作者用本地模型加受限 shell 做 PR 分类,给出了可复用的 agentic classification 配方与实测对比数据。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。
Hugging Face 发布 agent-eval 工具,用于评测智能体使用某个库完成任务的全过程,而不只看最终答案,并以 transformers 为案例在模型、版本、任务三个维度上展开测试。
推荐理由:原文给出了一套可复用的工具基准方法,并展示了同一改动对不同规模模型效果相反的具体证据。
Hugging Face 在 PEFT 库中对比了 LoRA 之外的多种参数高效微调技术,并指出仅凭论文结果难以判断哪种技术最优。其统计显示,Hugging Face Hub 上提及单一 PEFT 技术的 20,834 个模型卡中有 20,509 个(98.4%)提到 LoRA,外部站点 10,000 个图像生成 checkpoint 中 7,111 个为 LoRA。
AWS 开源的 Strands Robots SDK(Apache 2.0)把 LeRobot 栈封装成 AgentTools,让一个 Strands 智能体在单次循环里完成仿真录制演示、推送 LeRobotDataset 到 Hub、跑策略、再以改一个关键字参数的方式部署到实体 SO-101,并通过 Zenoh 对等网格广播指令到多台机器人。
推荐理由:AWS 团队给出从 Hub 数据集到实体机器人的五步流程,可看到仿真与真机共用同一数据集格式的工程取舍。
智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文上稳定支撑长程工作,并以 MIT 开源许可发布。模型引入 IndexShare 架构,每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9 倍,同时改进 MTP 层使投机解码接受长度最高提升 20%。
推荐理由:GLM-5.2 把 1M 上下文与长程编码能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为数千个 Skills、ML 应用和 MCP Server 提供搜索入口。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,可据此判断智能体能力发现如何落地。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,开发基于 Gemini 的 AI 规划审批原型,目标是把住户规划申请的处理时间缩短 50%。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙和树丛清单,覆盖英国超 13 万平方公里。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。
Google Research 公布两项皮肤健康 AI 研究:一项发表于 JAMA Dermatology 的大规模调查中,2345 名参与者使用 AI 工具后尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近对照组 8% 的三倍。但 AI 组在判断下一步就医建议上未获统计显著提升,且比对照组更易给出不够紧急的建议(30% vs 27%)。
加州大学圣地亚哥分校在 Google 支持下,正用 2000 台退役 Pixel 手机的主板搭建数据中心,为数百名师生提供低成本、低碳的云计算。SPEC 基准显示 25-50 台手机约等于一台现代服务器,手机主板占硬件隐含碳排约 50%。该系统预计 2026 年秋季上线。
PyTorch 性能剖析系列第二部分用 nn.Linear(bias=True)替换手写的 matmul-add,并堆叠三层加激活构成 MLP,在 NVIDIA A100-SXM4-80GB 上分析 profiler trace。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的开放权重与硬件门槛,读者可据此判断本地低并发推理的适用边界。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助,面向全球研究者征集方案。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方给出 70+ 语言实时语音翻译的连续生成机制与多端上线节奏,可据此判断实时翻译的可用形态。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于端侧 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选出 15 家机器人初创公司,提供技术指导并开放其 AI 技术栈与 Gemini 机器人模型。入选企业覆盖物流、制造、医疗、气候与导航等领域,本周在伦敦启动。
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼装成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了如何让编码智能体串联两个 Space 完成图像到 3D 的流水线,方法可直接复用。
Hugging Face 发布教程,介绍如何保留 GitHub Actions 调度、把 CI 任务放到 Hugging Face Jobs 上运行,通过 huggingface/jobs-actions 桥接把 GitHub Actions 任务变成 HF Job 内的临时自托管 runner。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与教师主导的实施细节,可了解 AI 辅助教学的实际效果与局限。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此判断开源智能体 RL 环境标准化的走向。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 与 Sufficient Context Agent 等角色协作处理多源多跳查询。
推荐理由:Google 公布 Agentic RAG 的充足上下文机制与跨语料检索数据,可据此判断多源多跳检索的落地方式。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后的数秒内拍摄视频,通过深度学习在后台估算心率和静息心率。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、多语言覆盖、自定义企业策略执行和可审计推理链统一到一次推理调用中。
推荐理由:NVIDIA 发布 4B 多模态安全模型,支持自定义策略与可审计推理链,并公开训练数据集。
Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类用户和编码智能体,通过环境变量自动识别 Claude Code、Codex、Cursor 等智能体并切换输出格式。
推荐理由:官方给出 hf CLI 面向智能体重构的细节与基准数据,可据此判断命令行工具如何适配编码智能体。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可了解其能力边界与接入方式。
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,以正确转录为 chosen、退化循环为 rejected 构建偏好数据,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。