Hugging Face 详解异步机器人推理:解耦动作预测与执行
Hugging Face 发布博客详解异步推理,将机器人动作预测与执行解耦为 PolicyServer 和 RobotClient 两个进程,通过 gRPC 通信(比 REST API 快约 5 倍),让机器人在计算下一段动作时持续执行当前动作。该方法在 SmolVLA 中引入,任务完成时间提速约 2 倍且成功率相当,适用于 ACT、OpenVLA、PI0 等输出动作块的策略。
Hugging Face 发布博客详解异步推理,将机器人动作预测与执行解耦为 PolicyServer 和 RobotClient 两个进程,通过 gRPC 通信(比 REST API 快约 5 倍),让机器人在计算下一段动作时持续执行当前动作。该方法在 SmolVLA 中引入,任务完成时间提速约 2 倍且成功率相当,适用于 ACT、OpenVLA、PI0 等输出动作块的策略。
Hugging Face 与 AMD 合作,为 MI300X GPU 编写了三个开源自定义内核——融合残差连接/RMS norm/FP8 转换内核、融合 SwiGLU 激活与 FP8 转换内核、Skinny GEMM 内核,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充方案中约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并用背包问题(knapsack)策略将序列打包进固定 token 上限的 batch。
Hugging Face 基础设施团队公开了支撑其生产环境的三大关键告警机制,包括 NAT 网关吞吐量告警和 Hub 请求日志归档成功率告警。NAT 网关告警采用静态阈值,用于发现流量异常并优化云成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成日志的采集、加工与存储。
SGLang 新增 Hugging Face transformers 后端支持,可自动回退运行其未原生支持的 transformers 模型,也可通过 impl="transformers" 显式指定。
Groq 现已作为 Inference Provider 接入 Hugging Face Hub,支持 Llama 4、QWQ-32B 等开源模型的 serverless 推理,并集成 JS 和 Python 客户端 SDK。
TNG 在 24 张 H100 上自托管多个大语言模型,日均消耗超 1 亿 token、生成超 1000 万 token,发现 vLLM 默认 chunked-prefill 会顺序调度 prefill,单个长提示词请求会阻塞后续请求的 prefill 队列,显著拉高首 token 延迟。
Hugging Face 推出 Kernel Hub,让 Python 库和应用直接从 Hugging Face Hub 加载预编译的优化计算内核,无需本地编译。通过 kernels 库的 get_kernel 函数,一行代码即可调用 FlashAttention、量化内核、MoE 层等,自动匹配 Python、PyTorch 和 CUDA 版本,数秒内完成下载。
Featherless AI 现已作为 Inference Provider 接入 Hugging Face Hub,支持 DeepSeek、Meta、Google、Qwen 等最新开源文本与对话模型,并集成到 JS 和 Python 客户端 SDK。
Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 与服务的私有集成栈,形态从裸金属服务器到全托管 PaaS。该服务将搭载 NVIDIA 参考架构,可提供数万块 GPU,并包含用于区域和行业特定 AI 的训练套件。Mistral 称其面向欧洲、中东、亚洲及南半球等寻求美国或中国云厂商替代方案的机构,强调数据主权与脱碳能源。
推荐理由:Mistral 从模型厂商延伸到自有 AI 基础设施,读者可据此判断欧洲主权算力供给的另一种路径。
Hugging Face 在 GTC Paris 宣布与 NVIDIA 合作推出 Training Cluster as a Service,让全球研究机构更容易获取大型 GPU 集群,按训练时长付费。
推荐理由:Hugging Face 与 NVIDIA 把 GPU 集群申请、调度和训练工具串成一条流程,读者可据此判断中小研究团队获取算力的门槛变化。
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项和企业管理工具,基于开源项目 Continue 构建。
推荐理由:Mistral 把模型、IDE 插件与企业管控打包成一套可私有部署的编码方案,读者可据此判断企业级 AI 编码的落地路径。
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使自回归生成速度提升 38%。该实现覆盖 Attention 块、逐层缓存的语言模型以及区分 prefill 与 decode 的生成循环三部分,经验可推广到所有自回归语言模型生成。
TRL 通过 PR #3394 支持 vLLM 的 external launcher,让推理与 GRPO 训练在同一批 GPU 上共置运行,不再需要单独的 vLLM 服务器进程。
推荐理由:TRL 把 vLLM 从独立推理服务改为与训练同卡共置,读者可据此判断 GRPO 训练的显存与吞吐取舍。
Mistral AI 发布首个专为代码设计的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型在检索任务上的对比与维度精度取舍,可据此评估代码 RAG 的存储成本。
Mistral 发布 Agents API,将自家语言模型与代码执行、网页搜索、图像生成、MCP 工具等内置连接器结合,并提供跨对话的持久记忆和智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,读者可据此判断企业级智能体平台的搭建方式。
Dell 在 Dell Tech World 发布新版 Dell Enterprise Hub,提供 Meta Llama 4 Maverick、DeepSeek R1、Google Gemma 3 等模型的预测试容器,可在 NVIDIA H200、AMD MI300X 等 Dell PowerEdge 服务器上通过 Docker 和 Kubernetes 部署。
OpenAI 宣布推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:OpenAI 官方公布 Stargate 首次落地海外,读者可据此了解其 AI 基础设施的国际化布局。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
微软在 Build 大会上宣布扩大与 Hugging Face 的合作,Azure AI Foundry 的 Hugging Face Collection 现已提供 10,000+ 开源模型,可一键部署到 Azure 安全基础设施,覆盖文本、音频和图像任务。
Hugging Face 宣布将 Transformers 打造为跨框架的模型定义中枢,模型架构只要被 Transformers 支持,就能在生态其他工具中获得支持。目前 Transformers 已支持 300+ 模型架构,平均每周新增约 3 个,并与 vLLM、SGLang、TGI 等推理引擎及 llama.cpp、MLX 打通互操作。官方还计划简化建模代码、弃用冗余组件,降低社区贡献门槛。
推荐理由:Hugging Face 官方说明 Transformers 将作为跨框架的模型定义中枢,读者可据此理解模型一次贡献、多引擎复用的生态走向。
Hugging Face 与 Kaggle 推出集成,Kaggle 用户可直接在平台上发现并使用 Hugging Face 模型,如在 Qwen/Qwen3-1.7B 等模型页点击“Use this model”选择 Kaggle 即可生成含加载代码的 Notebook。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较此前版本最高提升 8 倍,转录质量无损。
OpenAI 在亚洲推出数据驻留功能,延续其面向全球客户的企业级数据隐私、安全与合规体系。
Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进同一平台,可据此判断企业级 AI 助手的集成路径。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业选型的成本与落地条件。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟(light 模式)。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token,并分析了并发请求下 prefill 与 decode 两阶段的性能差异。
Gradio 不只是构建 UI 的 Python 库,而是通过 UI 和 API 与机器学习模型交互的框架。所有 Gradio 应用自带 API,提供 Python(gradio_client)和 JavaScript(@gradio/client)官方 SDK 及 cURL 访问,并自动生成 REST 端点和 API 文档。
Hugging Face 的 Gradio 月活开发者已超过 100 万,Automatic1111、Oobabooga 的 Text Generation WebUI、Dall-E Mini 和 LLaMA-Factory 等热门开源项目均基于它构建。
TNG Technology Consulting 分享了自托管 LLM 服务中请求排队问题的解决方案:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列并采用轮询调度,避免"重度用户"阻塞他人。
Hugging Face 将密钥管理从 AWS 单云方案迁移至 Infisical,以支撑其 Hub 上超 400 万构建者的多云端(Azure、GCP)环境。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,取代了不安全的本地 .env 文件。工程师仍偏好手动重新部署,以应对每分钟超 1000 万请求的高流量场景。
Hugging Face 通过 PR #3091 将 Intel Gaudi 硬件支持原生集成进 Text Generation Inference(TGI),取代此前独立维护的 tgi-gaudi 分支,覆盖 Gaudi1、Gaudi2、Gaudi3 全线硬件。
Gradio 为 gr.Dataframe 组件发布大规模更新,6 周内关闭超 70 个 dataframe 相关问题。新增多单元格选择、行号与列固定(pinned_columns)、复制与全屏按钮、搜索与过滤(show_search)、静态列(static_columns)等功能,并升级键盘导航与样式定制。
Hugging Face 为 Inference Endpoints 上线新版分析面板,指标数据改为实时更新,并重写了后端以加快高流量端点的数据加载。新面板支持自定义时间范围与自动刷新,还新增副本生命周期视图,可追踪每个副本从初始化到终止的每次状态转换。官方表示仍在持续迭代并欢迎用户反馈。
Booking.com 将自身数据系统与 OpenAI 的 LLM 集成,用于提供更智能的搜索、更快的客服支持和意图驱动的旅行体验。
Hugging Face 的 Xet 团队将首批 Model 和 Dataset 仓库从 LFS 迁移到 Xet 存储,迁移了 4.5 TB 数据,约 6% 的 Hub 下载流量转到 Xet 基础设施。
推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移,给出块级去重带来的上传下载变化与迁移中的工程取舍。
Hugging Face 发布教程,演示如何用 React Native 和 llama.rn(llama.cpp 的绑定)构建 Android/iOS 应用,从 Hugging Face hub 下载 GGUF 模型并在设备本地离线运行。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并已作为 Le Chat 文档理解的默认模型。
推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断它在文档解析与 RAG 流程中的位置。
OpenAI 帮助将工程周期加速 20%。