Hugging Face 发布 SmolLM3:3B 多语言长上下文推理模型
Hugging Face 发布完全开源的 3B 模型 SmolLM3,在 11T tokens 上训练,支持 think / no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:官方完整公开了 3B 模型的预训练、中训练与后训练配方,读者可据此复现或迁移到自研小模型。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,在 11T tokens 上训练,支持 think / no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:官方完整公开了 3B 模型的预训练、中训练与后训练配方,读者可据此复现或迁移到自研小模型。
Hugging Face 基础设施团队公开了支撑其生产环境的三大关键告警机制,包括 NAT 网关吞吐量告警和 Hub 请求日志归档成功率告警。NAT 网关告警采用静态阈值,用于发现流量异常并优化云成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成日志的采集、加工与存储。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,面向 LLM 早期训练阶段(约 200B tokens 以内)构建科学知识领域的评测基准,参赛者需基于 lm-evaluation-harness 通过 Hugging Face Space 提交方案。
Sentence Transformers 现已支持训练和微调稀疏嵌入模型,可产出如 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 这类低成本模型,尤其适合混合检索或先检索后重排场景。
NVIDIA 发布 Llama Nemotron Nano VL,一个 8B 视觉语言模型,面向智能文档处理,已在 Hugging Face 上线并可通过 NVIDIA NIM API 调用。
Gemma 3n 从 Google I/O 的预览版转为正式发布,已在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等开源库上线。
推荐理由:Gemma 3n 正式开源并接入主流推理库,读者可据此了解端侧多模态模型的部署路径与内存优化思路。
SGLang 新增 Hugging Face transformers 后端支持,可自动回退运行其未原生支持的 transformers 模型,也可通过 impl="transformers" 显式指定。
Hugging Face 发布教程,介绍用 diffusers 库以 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,方法可直接复用。
Groq 现已作为 Inference Provider 接入 Hugging Face Hub,支持 Llama 4、QWQ-32B 等开源模型的 serverless 推理,并集成 JS 和 Python 客户端 SDK。
Hugging Face 推出 Kernel Hub,让 Python 库和应用直接从 Hugging Face Hub 加载预编译的优化计算内核,无需本地编译。通过 kernels 库的 get_kernel 函数,一行代码即可调用 FlashAttention、量化内核、MoE 层等,自动匹配 Python、PyTorch 和 CUDA 版本,数秒内完成下载。
Featherless AI 现已作为 Inference Provider 接入 Hugging Face Hub,支持 DeepSeek、Meta、Google、Qwen 等最新开源文本与对话模型,并集成到 JS 和 Python 客户端 SDK。
NVIDIA 发布 Isaac GR00T N1.5,这是其开源人形机器人基础模型 GR00T N1 的首次重大更新,支持语言和图像多模态输入并可通过后训练适配特定本体。
推荐理由:原文给出从数据准备到真机部署的完整命令流程,读者可据此在低成本 SO-101 机械臂上复现微调。
Hugging Face 在 GTC Paris 宣布与 NVIDIA 合作推出 Training Cluster as a Service,让全球研究机构更容易获取大型 GPU 集群,按训练时长付费。
推荐理由:Hugging Face 与 NVIDIA 把 GPU 集群申请、调度和训练工具串成一条流程,读者可据此判断中小研究团队获取算力的门槛变化。
Hugging Face 发布 ScreenSuite,称其为面向 GUI 智能体的最全面评测套件,统一整合了 13 个基准,覆盖感知与定位、单步动作、多步智能体三类能力。
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使自回归生成速度提升 38%。该实现覆盖 Attention 块、逐层缓存的语言模型以及区分 prefill 与 decode 的生成循环三部分,经验可推广到所有自回归语言模型生成。
Arm 工程师 Michael Gamble 基于 Stability AI 的 Stable Audio Open 模型,在 Arm CPU 上构建了一款完全本地运行的音效生成应用,无需 GPU 和云端推理,几秒内即可根据提示词生成 .wav 文件并直接导入 Ableton Live。
H Company 发布 Holo1 系列 Action VLM 及多模态定位基准 WebClick,模型已开源在 Hugging Face。该系列包含 Holo1-3B 和 Holo1-7B,其中 7B 在常见 UI 定位基准上平均准确率达 76.2%,为小尺寸模型中最高。
推荐理由:Holo1 开源了 GUI 定位模型与配套基准,读者可据此评估浏览器自动化在成本与精度上的取舍。
Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉语言动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。
TRL 通过 PR #3394 支持 vLLM 的 external launcher,让推理与 GRPO 训练在同一批 GPU 上共置运行,不再需要单独的 vLLM 服务器进程。
推荐理由:TRL 把 vLLM 从独立推理服务改为与训练同卡共置,读者可据此判断 GRPO 训练的显存与吞吐取舍。
Hugging Face 分享研究,将 CodeAgent 的思考与代码强制以结构化 JSON 生成,在 GAIA、MATH、SimpleQA、Frames 等基准上比普通 CodeAgent 平均高出 2-7 个百分点。
用户在使用 Qwen2.5-0.5B-Instruct 以 bf16 精度结合 DeepSpeed ZeRO3 测试 Liger GRPO loss 时,于 TRL 的 GRPO trainer 中触发形状不匹配报错。错误发生在 liger_kernel 的 fused_linear_ppo 前向计算阶段,堆栈显示问题出现在 chunked_loss 的 accumulate_chunk 调用中。
Hugging Face 发布 Python 版 Tiny Agents,把 huggingface_hub 客户端 SDK 扩展为 MCP Client,可从 MCP 服务器拉取工具并在推理时传给 LLM,核心智能体代码约 70 行。
推荐理由:Hugging Face 官方给出约 70 行 Python 代码实现 MCP 智能体的完整拆解,可直接照着搭一个自己的智能体。
Dell 在 Dell Tech World 发布新版 Dell Enterprise Hub,提供 Meta Llama 4 Maverick、DeepSeek R1、Google Gemma 3 等模型的预测试容器,可在 NVIDIA H200、AMD MI300X 等 Dell PowerEdge 服务器上通过 Docker 和 Kubernetes 部署。
Falcon-LLM 团队发布 Falcon-H1 系列开源模型,共六款,参数规模从 0.5B 到 34B,每款均含 base 与 instruct 版本,采用 Apache 2.0 许可。
推荐理由:Falcon-H1 用混合注意力与 SSM 架构在长上下文吞吐上取得明显优势,读者可据此判断小参数模型的部署取舍。
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度达 32,000 tokens。该模型在 OALL v2 基准上超越同规模阿拉伯语 LLM,甚至优于参数量达其 4 倍的模型,并在 Arabic MMLU、Exams、MadinahQA、Aratrust 等任务上领先。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,可在免费 Colab 上启动训练。其视觉骨干采用 Google 的 SigLIP 编码器,语言骨干沿用 Llama 3 架构,两者通过 Modality Projection 模块对齐,训练目标为视觉问答。
推荐理由:官方给出 nanoVLM 的架构选择与训练流程,读者可据此在免费 Colab 上跑通一个 VLM。
微软在 Build 大会上宣布扩大与 Hugging Face 的合作,Azure AI Foundry 的 Hugging Face Collection 现已提供 10,000+ 开源模型,可一键部署到 Azure 安全基础设施,覆盖文本、音频和图像任务。
Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。
Hugging Face 宣布将 Transformers 打造为跨框架的模型定义中枢,模型架构只要被 Transformers 支持,就能在生态其他工具中获得支持。目前 Transformers 已支持 300+ 模型架构,平均每周新增约 3 个,并与 vLLM、SGLang、TGI 等推理引擎及 llama.cpp、MLX 打通互操作。官方还计划简化建模代码、弃用冗余组件,降低社区贡献门槛。
推荐理由:Hugging Face 官方说明 Transformers 将作为跨框架的模型定义中枢,读者可据此理解模型一次贡献、多引擎复用的生态走向。
Hugging Face 与 Kaggle 推出集成,Kaggle 用户可直接在平台上发现并使用 Hugging Face 模型,如在 Qwen/Qwen3-1.7B 等模型页点击“Use this model”选择 Kaggle 即可生成含加载代码的 Notebook。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较此前版本最高提升 8 倍,转录质量无损。
Hugging Face 发布博客盘点过去一年视觉语言模型的关键变化,涵盖 any-to-any、推理、小尺寸、MoE 解码器、视觉语言动作模型等新趋势。
Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,将其定位为机器人领域的“ImageNet”,目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂。项目通过简化录制流程、打通上传至 Hugging Face Hub、降低硬件成本来扩大数据多样性,并指出数据整理(curation)是下一阶段的核心挑战。
Gradio 官方教程介绍如何用几行 Python 把 Gradio 应用变成 MCP Server,只需在 launch() 中设置 mcp_server=True,函数即被自动转换为 LLM 可调用的工具,docstring 会生成工具描述和参数。
推荐理由:Gradio 官方给出把任意 Python 函数变成 MCP 工具的最短路径,可据此判断自家应用接入 LLM 工具调用的成本。
Qwen-3 的 chat template 相比 Qwen-2.5 和 QwQ 有四处关键变化:通过 enable_thinking 标志可开关推理,不再强制输出思维链。
Meta 发布 Llama Guard 4,一个 12B dense 多模态安全模型,以及两个新的 Llama Prompt Guard 2 模型,模型 checkpoint 已上线 Hugging Face Hub 的 Llama 4 Collection。
推荐理由:Meta 开源多模态安全模型,给出架构剪枝思路与相对上一代的召回对比,可据此评估内容审核管线。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟(light 模式)。
ServiceNow 开源实验性 RL 实现 PipelineRL,通过训练中 inflight 权重更新,在不停推理的前提下持续保持最优 batch size,缓解高吞吐推理与 on-policy 数据采集之间的取舍。
Hugging Face 发布 Tiny Agents,用约 50 行 TypeScript 代码实现一个由 MCP 驱动的智能体。
推荐理由:作者用 50 行代码把 MCP 客户端与 Agent 循环讲清楚,读者可据此理解工具调用如何接入现有推理客户端。