Hugging Face 盘点视觉语言模型一年进展:更小、更快、更强
Hugging Face 发布博客盘点过去一年视觉语言模型的关键变化,涵盖 any-to-any、推理、小尺寸、MoE 解码器、视觉语言动作模型等新趋势。
Hugging Face 发布博客盘点过去一年视觉语言模型的关键变化,涵盖 any-to-any、推理、小尺寸、MoE 解码器、视觉语言动作模型等新趋势。
Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,将其定位为机器人领域的“ImageNet”,目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂。项目通过简化录制流程、打通上传至 Hugging Face Hub、降低硬件成本来扩大数据多样性,并指出数据整理(curation)是下一阶段的核心挑战。
Gradio 官方教程介绍如何用几行 Python 把 Gradio 应用变成 MCP Server,只需在 launch() 中设置 mcp_server=True,函数即被自动转换为 LLM 可调用的工具,docstring 会生成工具描述和参数。
推荐理由:Gradio 官方给出把任意 Python 函数变成 MCP 工具的最短路径,可据此判断自家应用接入 LLM 工具调用的成本。
Qwen-3 的 chat template 相比 Qwen-2.5 和 QwQ 有四处关键变化:通过 enable_thinking 标志可开关推理,不再强制输出思维链。
Meta 发布 Llama Guard 4,一个 12B dense 多模态安全模型,以及两个新的 Llama Prompt Guard 2 模型,模型 checkpoint 已上线 Hugging Face Hub 的 Llama 4 Collection。
推荐理由:Meta 开源多模态安全模型,给出架构剪枝思路与相对上一代的召回对比,可据此评估内容审核管线。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟(light 模式)。
ServiceNow 开源实验性 RL 实现 PipelineRL,通过训练中 inflight 权重更新,在不停推理的前提下持续保持最优 batch size,缓解高吞吐推理与 on-policy 数据采集之间的取舍。
Hugging Face 发布 Tiny Agents,用约 50 行 TypeScript 代码实现一个由 MCP 驱动的智能体。
推荐理由:作者用 50 行代码把 MCP 客户端与 Agent 循环讲清楚,读者可据此理解工具调用如何接入现有推理客户端。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,使模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。微调模型已在 Hugging Face 开源。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token,并分析了并发请求下 prefill 与 decode 两阶段的性能差异。
Gradio 不只是构建 UI 的 Python 库,而是通过 UI 和 API 与机器学习模型交互的框架。所有 Gradio 应用自带 API,提供 Python(gradio_client)和 JavaScript(@gradio/client)官方 SDK 及 cURL 访问,并自动生成 REST 端点和 API 文档。
Cohere 正式接入 Hugging Face Inference Providers,成为首个在 HF Hub 上直接分享并托管自家模型的模型厂商。
Protect AI 与 Hugging Face 合作半年,截至 2025 年 4 月 1 日已扫描 Hugging Face Hub 上 141 万个仓库中的 447 万个模型版本,在 5.17 万个模型中识别出 35.2 万个不安全或可疑问题。
Hugging Face 宣布收购已成立 9 年的开源机器人公司 Pollen Robotics,这是其第五次收购,此前曾收购 Gradio 和 XetHub。
推荐理由:Hugging Face 收购 Pollen Robotics 并开卖 Reachy 2,可看到开源机器人从代码库走向硬件销售的具体路径。
Hugging Face 与 Cloudflare 达成合作,FastRTC 开发者用 Hugging Face token 即可接入 Cloudflare 的 WebRTC 基础设施。
Hugging Face 与 MBZUAI 合作推出 Arabic-Leaderboards Space,统一阿拉伯语 AI 评测入口,目前上线 AraGen-03-25 和 Arabic Instruction Following 两个榜单。
Meta 发布 Llama 4 Maverick(约 400B 总参数)与 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持文本与图像输入,并已在 Hugging Face Hub 上线。
推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的架构细节与部署入口,可据此判断长上下文与多模态的落地条件。
Hugging Face 的 Gradio 月活开发者已超过 100 万,Automatic1111、Oobabooga 的 Text Generation WebUI、Dall-E Mini 和 LLaMA-Factory 等热门开源项目均基于它构建。
Hugging Face 将已有 3 年历史的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 Deepseek R1 等推理模型的章节。
TNG Technology Consulting 分享了自托管 LLM 服务中请求排队问题的解决方案:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列并采用轮询调度,避免"重度用户"阻塞他人。
Hugging Face 将密钥管理从 AWS 单云方案迁移至 Infisical,以支撑其 Hub 上超 400 万构建者的多云端(Azure、GCP)环境。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,取代了不安全的本地 .env 文件。工程师仍偏好手动重新部署,以应对每分钟超 1000 万请求的高流量场景。
Hugging Face 通过 PR #3091 将 Intel Gaudi 硬件支持原生集成进 Text Generation Inference(TGI),取代此前独立维护的 tgi-gaudi 分支,覆盖 Gaudi1、Gaudi2、Gaudi3 全线硬件。
DeepSeek 本周在 Hugging Face Hub 上线 DeepSeek-V3 0324,架构与初代 DeepSeek-V3 相同,但改用 MIT 许可,重点提升指令遵循、代码与数学能力。
推荐理由:梳理 DeepSeek-V3 0324 的基准提升与 MIT 许可变化,并给出本地部署与安全使用的具体路径。
Sentence Transformers 库可用于微调 reranker(Cross Encoder)模型,使其在自有数据上超越所有现有方案,也能从零训练出强力的新 reranker。
Gradio 为 gr.Dataframe 组件发布大规模更新,6 周内关闭超 70 个 dataframe 相关问题。新增多单元格选择、行号与列固定(pinned_columns)、复制与全屏按钮、搜索与过滤(show_search)、静态列(static_columns)等功能,并升级键盘导航与样式定制。
Hugging Face 为 Inference Endpoints 上线新版分析面板,指标数据改为实时更新,并重写了后端以加快高流量端点的数据加载。新面板支持自定义时间范围与自动刷新,还新增副本生命周期视图,可追踪每个副本从初始化到终止的每次状态转换。官方表示仍在持续迭代并欢迎用户反馈。
Hugging Face 博客介绍了如何在本地通过 LM Studio 和 VS Code 的 Continue 扩展运行 OlympicCoder 7B 编程模型,推荐使用 4bit GGUF 量化版本。该模型在 LiveCodeBench 评测中表现优于 Claude 3.7 Sonnet 和 GPT-4o,基于 CodeForces-CoTs 数据集优化,适合处理竞赛类编程难题。
Hugging Face 于 3 月 14 日向白宫 OSTP 的 AI 行动计划 RFI 提交回应,主张开放 AI 系统与开放科学是提升性能、采用率与安全性的基础。
Hugging Face 的 Xet 团队将首批 Model 和 Dataset 仓库从 LFS 迁移到 Xet 存储,迁移了 4.5 TB 数据,约 6% 的 Hub 下载流量转到 Xet 基础设施。
推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移,给出块级去重带来的上传下载变化与迁移中的工程取舍。
NVIDIA 在 GTC 2025 上发布三项面向物理 AI 的开源成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。
推荐理由:NVIDIA 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此判断物理 AI 开发可用的工具链起点。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,采用 Apache 2.0 许可。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与端侧运行门槛,便于判断小模型选型。
Google 发布 Gemma 3 系列开放权重模型,提供 1B、4B、12B、27B 四种规模,含预训练与指令微调版本。4B、12B、27B 支持图像与文本输入及 140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k,1B 版本为纯文本、32k 上下文。
推荐理由:梳理 Gemma 3 的四种规模、多模态与 128k 上下文改动,并给出 transformers、MLX、llama.cpp 的落地路径。
Hugging Face 的 Open R1 项目发布第三期更新,聚焦复现 DeepSeek-R1 配方中的竞赛编程代码推理部分。
推荐理由:Open R1 公开了 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型,并给出五条蒸馏训练经验,可迁移到自己的代码推理训练流程。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D(Learning to Drive),称其为全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 座城市的 60 辆驾校车辆。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并直接接入 LeRobot 训练管线。
Hugging Face 发布教程,演示如何用 React Native 和 llama.rn(llama.cpp 的绑定)构建 Android/iOS 应用,从 Hugging Face hub 下载 GGUF 模型并在设备本地离线运行。
Cohere For AI 发布 Aya Vision 系列 8B 和 32B 参数视觉语言模型,覆盖 23 种语言,并以开放权重形式发布。
推荐理由:官方披露了 8B 与 32B 两个开源权重的多语言视觉语言模型,并给出与更大规模模型的对比胜率,便于判断小参数多模态模型的当前水位。
Hugging Face 宣布与 JFrog 合作,将 JFrog 扫描器集成到 Hugging Face Hub,用于检测模型权重中的恶意代码。相比仅对模块名做模式匹配的 picklescan,JFrog 会解析并分析模型权重中的代码,以减少误报。所有公开模型仓库在推送文件后将自动被扫描,目前已扫描数亿个文件。
Hugging Face 博客介绍如何用 Arize Phoenix 为 smolagents 构建的 Agent 做追踪与评估,通过 OpenTelemetry 和 OpenInference 自动捕获每次 Agent 调用。
Hugging Face 与印度科学研究所 IISc/ARTPARK 达成合作,让全球开发者更便捷地使用印度多模态多语言数据集 Vaani。
Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的实时通信库。它内置自动语音检测与轮次切换、WebRTC 版 Gradio UI、WebSocket 支持,并可通过 fastphone() 获取免费电话号码接入音频流。库还提供语音转文字、文字转语音和停用词检测等工具,可挂载到任意 FastAPI 应用部署。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。