Transformers v5 重构 Tokenization:更简单、更清晰、更模块化
Hugging Face 在 Transformers v5 中重构了 tokenizer 设计,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 将网络架构与学习权重分离。v5 提供更清晰的内部结构、干净的类层级和单一快速后端,让用户能检查、定制或从零训练模型专属 tokenizer,而非将其视为黑盒。
Hugging Face 在 Transformers v5 中重构了 tokenizer 设计,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 将网络架构与学习权重分离。v5 提供更清晰的内部结构、干净的类层级和单一快速后端,让用户能检查、定制或从零训练模型专属 tokenizer,而非将其视为黑盒。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可重跑评测流程并独立核验结果。
IBM 开源的可配置通用智能体 CUGA 上线 Hugging Face Spaces,提供 CRM 演示和 20 个预置工具,用于销售数据查询与 API 交互。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和 20 个预置工具的演示,能帮读者判断可配置智能体的落地方式。
llama.cpp server 新增 router 模式,无需重启即可动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;模型按需加载,超过 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。
推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型热切换与显存回收的具体做法。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验:微调 Qwen3-0.6B、用 HumanEval 评测、生成训练报告并导出 GGUF。
推荐理由:以完整实验流程展示编码智能体如何端到端完成微调、评测与部署,可迁移到自己的训练任务。
Hugging Face 推出 swift-huggingface,一个面向 Hub 的完整 Swift 客户端包,可独立使用,后续将并入 swift-transformers 替换现有 HubApi。它提供完整 Hub API 覆盖、断点续传与进度追踪、与 Python 兼容的共享缓存,以及 TokenProvider 认证和 OAuth 2.0 支持,基于分块去重的 Xet 存储后端即将上线。
Hugging Face 发布 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推到 Hub。
推荐理由:官方给出从数据校验到 GGUF 转换的完整训练链路,可据此判断对话式微调的实际边界与成本。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性开源从 3B 到 675B 的完整模型族,读者可据此了解开源模型在参数规模与部署形态上的最新覆盖范围。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天经 pip 安装超 300 万次,累计安装量超 12 亿次。
推荐理由:官方给出 v5 在模型定义、训练、推理与量化上的重构方向,可据此判断生态工具链的兼容变化。
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,来提升高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Hugging Face Diffusers 官方博客宣布支持 FLUX.2,并给出基于 diffusers/FLUX.2-dev-bnb-4bit 仓库的完整推理示例。
推荐理由:Diffusers 官方给出 FLUX.2 的加载与推理代码,读者可据此判断本地部署所需的显存与量化方案。
OVHcloud 正式加入 Hugging Face Hub 的 Inference Providers 生态,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源模型。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Hugging Face TRL 正式集成 RapidFire AI,用户可发现、安装并运行它来并发比较多组微调与后训练配置,无需大幅改代码,也不额外增加 GPU 需求。
推荐理由:官方给出与 TRL 的集成方式和并发调度机制,读者可据此判断多配置微调实验的提速空间。
AnyLanguageModel 发布,这是一个 Swift 包,可作为 Apple Foundation Models 框架的 drop-in 替代,只需把 import FoundationModels 换成 import AnyLanguageModel 即可切换模型提供方。
ServiceNow 的 SLAM Lab 将 15B 推理模型 Apriel-Nemotron-15B-Thinker 蒸馏改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 在 50 层中替换 30 层为 Mamba。
Hugging Face 的 kernels 库支持用 kernel-builder 构建并分享 ROCm 内核,可集成进 PyTorch 工作流。指南以 RadeonFlow GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,采用 FP8 e4m3fnuz 格式与分块缩放,曾获 AMD Developer Challenge 2025 大奖。
AMD、Hugging Face 与 Data Monsters 联合举办 AMD Open Robotics Hackathon,首场线下赛于 2025 年 12 月 5-7 日在东京举行,第二场于 12 月 12-14 日在巴黎举行。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自有 AI。
Hugging Face 发布长文分析全球 AI 算力格局的变化,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。
推荐理由:梳理美国出口管制与中国国产芯片、开源模型之间的因果链,并给出从硬件到软件栈的替代进展时间线。
NVIDIA Isaac for Healthcare v0.4 发布基于 SO-ARM 的端到端入门工作流,开发者可用 LeRobot 采集数据、微调 GR00T N1.5、在 IsaacLab 评估后部署到真实硬件。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、GR00T N1.5 后训练与真机部署。该流程中超过 93% 的训练数据由仿真合成生成,混合约 70 个仿真 episode 与 10-20 个真实 episode,可在单台 DGX Spark 上完成仿真、训练与部署。
IBM 发布 Granite 4.0 家族最小的 Granite 4.0 Nano,含 4 个 instruct 模型及对应 base 版本,参数规模从约 350M 到约 1.5B,采用 hybrid-SSM 与 Transformer 两种架构,Apache 2.0 许可并在 vLLM、llama.cpp、MLX 上原生支持。
Hugging Face 提出“语音同意门”机制,让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆。该方案用语言模型为每次授权生成一对全新句子,一句表达明确同意并包含模型名,另一句提供语音多样性,从而支持可追溯、可审计的授权流程。官方同时发布了示例 Space 和配套代码。
Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 接口保持不变,启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多提升 2 倍。
推荐理由:官方给出流式加载的请求数、解析时间和吞吐变化,读者可据此判断大规模训练的数据管线是否值得切换。
Hugging Face 发布 huggingface_hub v1.0,这是该库五年来的首个大版本,带来破坏性变更。主要变化包括后端从 requests 迁移到 httpx、全新的 hf CLI 取代已弃用的 huggingface-cli、文件传输全面改用 hf_xet 替代 hf_transfer。
推荐理由:官方梳理了五年演进与 v1.0 的破坏性变更,读者可据此判断升级成本与迁移路径。
Hugging Face 发布 LeRobot v0.4.0,为开源机器人学习带来 LeRobotDataset v3.0、硬件插件系统以及 PI0.5、GR00T N1.5 等 VLA 模型集成。
推荐理由:LeRobot v0.4.0 把数据集、VLA 策略与硬件插件整合进同一开源栈,可据此判断机器人学习工具链的成熟度。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放共享社区平台,环境可用于训练和部署。下周起开发者可在 Hugging Face 上访问该 Hub,以人类智能体身份直接与环境交互、让模型在环境中解题,并查看环境暴露的工具和观测定义;符合 OpenEnv 规范的环境上传后自动获得这些功能。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并公开 0.1 规范草案,读者可据此了解智能体训练与部署环境的标准化路径。
Sentence Transformers 从 TU Darmstadt 的 UKP Lab 转由 Hugging Face 维护,Hugging Face 的 Tom Aarsen 自 2023 年底起已负责该项目并将继续领导。
Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,从即日起对 Hub 上 220 万以上公开模型和数据集仓库进行持续扫描。
Hugging Face 发布指南,介绍如何用 Chandra、OlmOCR-2 等开源权重 OCR 模型搭建文档处理流水线,并给出各模型的 OlmOCR 评测分数。指南覆盖模型能力对比、微调与开箱即用的取舍、选型要点,以及用多模态检索和文档问答超越传统 OCR。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉支持,可在表格中查看、分析图像并抽取信息,也能从文本生成图像和编辑图像,全部由 Inference Providers 上的开放模型驱动。
Hugging Face 发起 AI for Food Allergies 项目,计划打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。
Intel 与 Hugging Face 联合在 Google Cloud C4 虚拟机(Intel Xeon 6 处理器)上对 OpenAI GPT OSS 大模型做文本生成基准测试,相比上一代 C3 实例实现 1.7 倍 TCO 提升,TPOT 吞吐/vCPU/美元提升 1.4 至 1.7 倍,每小时价格更低。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化(INT8)或静态量化压缩模型,最后执行推理,无需 GPU。
Hugging Face 推出 BigCodeArena,这是首个通过实际执行来评估代码生成模型的人类参与平台,支持 10 种语言和 8 种执行环境,可实时运行模型生成的代码并投票。平台自 2025 年 2 月上线以来已收集超 14,000 段对话、4,700+ 条偏好投票,覆盖 10 个前沿 LLM,o3-mini 与 o1-mini 在 Elo 排名中稳居第一梯队。
Hugging Face 发布三部分系列文章,讲解如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超越 Gemini 2.5 Pro。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评估嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,部分模型在私有集上出现明显性能下滑。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 为草稿模型做投机解码,生成速度提升约 1.3×;再对草稿模型剪掉 28 层中的 6 层并用 Qwen3-8B 生成的合成数据微调,加速比进一步升至约 1.4×。