Hugging Face 发布轻量实验追踪库 Trackio
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘,并可同步到 Hugging Face Spaces 分享。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘,并可同步到 Hugging Face Spaces 分享。
Hugging Face 将 CLI 从 huggingface-cli 正式更名为 hf,命令按 auth、cache、repo 等资源分组,upload 和 download 保留在根级,旧命令仍可用但会提示弃用警告。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),可在 Hugging Face 的 Xet 存储层上对 Parquet 文件高效去重,只上传或下载发生变化的 chunk,从而降低传输与存储成本。
Hugging Face 发布教程,介绍如何用 Diffusers 和 PEFT 优化 Flux.1-Dev 的 LoRA 推理速度,在 H100 上通过 Flash Attention 3、torch.compile 和 FP8 量化配合 LoRA 热插拔,实现约 2.23 倍加速。
推荐理由:Hugging Face 官方给出 Flux LoRA 推理的完整优化配方与实测数据,可迁移到其他扩散模型。
NVIDIA 宣布 NIM 推理微服务现可在 Hugging Face 上快速部署超过 10 万个 LLM。NIM 提供单个 Docker 容器,自动识别模型架构与量化格式(如 FP16、FP8、INT4),并在 NVIDIA TensorRT-LLM、vLLM 和 SGLang 之间选择推理后端,无需手动配置。
推荐理由:NIM 单个容器即可自动识别模型格式并选择 TensorRT-LLM、vLLM 或 SGLang 后端,读者可据此判断部署流程能省掉多少手工调优。
Gradio 5.38.0 为 MCP Servers 带来五项改进:新增 "File Upload" MCP server 让智能体直接上传文件,支持实时进度通知,并可通过 gr.load_openapi 一行代码将 OpenAPI 规范转为 MCP server。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备原生多语言、音频问答与摘要、语音触发函数调用等能力,API 定价为每分钟 $0.001。
推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此评估自部署与调用成本。
Hugging Face 宣布 Hub 存储从 Git LFS 迁移到 Xet,6 个月内已有 50 万个仓库、20 PB 数据完成迁移,超过 100 万用户在用 Xet,5 月起成为新用户和组织的默认选项。
推荐理由:官方复盘 Hub 从 Git LFS 迁移到 Xet 的工程细节,可看到大规模存储迁移如何做到对用户零打扰。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 至 1.1 版本。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数、开源许可与 API 定价,便于读者比较开源与闭源方案的成本性能。
Hugging Face 发布官方 MCP Server(hf.co/mcp),用户可通过一个 URL 访问 Hub 与 Spaces 上的数千个 AI 应用,并可在设置页自定义工具。
Hugging Face 发布 ScreenEnv,一个可在 Docker 容器中创建隔离 Ubuntu 桌面环境的 Python 库,用于测试和部署 GUI 智能体(Computer Use 智能体)。
推荐理由:ScreenEnv 把桌面智能体的运行环境封装进 Docker,并同时提供 MCP 与直接 API 两种接入方式,读者可据此判断现有智能体架构能否低成本迁移。
Gradio 5.28.0 起支持 MCP 协议,使 Hugging Face Spaces 上数千个 AI 应用可作为 MCP server 接入 LLM,相当于一个「MCP App Store」。
Hugging Face 与 AMD 合作,为 MI300X GPU 编写了三个开源自定义内核——融合残差连接/RMS norm/FP8 转换内核、融合 SwiGLU 激活与 FP8 转换内核、Skinny GEMM 内核,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face 与 Pollen Robotics 发布开源机器人 Reachy Mini,Lite 版 399 美元、带板载计算与电池的无线版 499 美元,均需另付税费和运费,预计约 90 天发货。
推荐理由:官方给出开源桌面机器人的两档配置、价格与 Python SDK,可据此判断入门机器人 AI 实验的成本与上手门槛。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,在 11T tokens 上训练,支持 think / no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:官方完整公开了 3B 模型的预训练、中训练与后训练配方,读者可据此复现或迁移到自研小模型。
Hugging Face 基础设施团队公开了支撑其生产环境的三大关键告警机制,包括 NAT 网关吞吐量告警和 Hub 请求日志归档成功率告警。NAT 网关告警采用静态阈值,用于发现流量异常并优化云成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成日志的采集、加工与存储。
Mistral AI 推出 AI for Citizens 协作计划,帮助各国政府和公共机构战略性地运用 AI 改造公共服务、推动创新。该计划已与法国、卢森堡、新加坡、荷兰、英国、瑞士等国政府、国防部队及公共部门机构合作,提供开源模型、自托管部署、数据主权保障及定制化研发,以替代"一刀切"的封闭 AI 方案。
Sentence Transformers 现已支持训练和微调稀疏嵌入模型,可产出如 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 这类低成本模型,尤其适合混合检索或先检索后重排场景。
NVIDIA 发布 Llama Nemotron Nano VL,一个 8B 视觉语言模型,面向智能文档处理,已在 Hugging Face 上线并可通过 NVIDIA NIM API 调用。
Gemma 3n 从 Google I/O 的预览版转为正式发布,已在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等开源库上线。
推荐理由:Gemma 3n 正式开源并接入主流推理库,读者可据此了解端侧多模态模型的部署路径与内存优化思路。
SGLang 新增 Hugging Face transformers 后端支持,可自动回退运行其未原生支持的 transformers 模型,也可通过 impl="transformers" 显式指定。
Hugging Face 发布教程,介绍用 diffusers 库以 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,方法可直接复用。
Groq 现已作为 Inference Provider 接入 Hugging Face Hub,支持 Llama 4、QWQ-32B 等开源模型的 serverless 推理,并集成 JS 和 Python 客户端 SDK。
Hugging Face 推出 Kernel Hub,让 Python 库和应用直接从 Hugging Face Hub 加载预编译的优化计算内核,无需本地编译。通过 kernels 库的 get_kernel 函数,一行代码即可调用 FlashAttention、量化内核、MoE 层等,自动匹配 Python、PyTorch 和 CUDA 版本,数秒内完成下载。
Featherless AI 现已作为 Inference Provider 接入 Hugging Face Hub,支持 DeepSeek、Meta、Google、Qwen 等最新开源文本与对话模型,并集成到 JS 和 Python 客户端 SDK。
NVIDIA 发布 Isaac GR00T N1.5,这是其开源人形机器人基础模型 GR00T N1 的首次重大更新,支持语言和图像多模态输入并可通过后训练适配特定本体。
推荐理由:原文给出从数据准备到真机部署的完整命令流程,读者可据此在低成本 SO-101 机械臂上复现微调。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开 AIME2024 成绩与多语言推理定位,可据此判断其与现有推理模型的差异。
Hugging Face 发布 ScreenSuite,称其为面向 GUI 智能体的最全面评测套件,统一整合了 13 个基准,覆盖感知与定位、单步动作、多步智能体三类能力。
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使自回归生成速度提升 38%。该实现覆盖 Attention 块、逐层缓存的语言模型以及区分 prefill 与 decode 的生成循环三部分,经验可推广到所有自回归语言模型生成。
Arm 工程师 Michael Gamble 基于 Stability AI 的 Stable Audio Open 模型,在 Arm CPU 上构建了一款完全本地运行的音效生成应用,无需 GPU 和云端推理,几秒内即可根据提示词生成 .wav 文件并直接导入 Ableton Live。
H Company 发布 Holo1 系列 Action VLM 及多模态定位基准 WebClick,模型已开源在 Hugging Face。该系列包含 Holo1-3B 和 Holo1-7B,其中 7B 在常见 UI 定位基准上平均准确率达 76.2%,为小尺寸模型中最高。
推荐理由:Holo1 开源了 GUI 定位模型与配套基准,读者可据此评估浏览器自动化在成本与精度上的取舍。
Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉语言动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。
TRL 通过 PR #3394 支持 vLLM 的 external launcher,让推理与 GRPO 训练在同一批 GPU 上共置运行,不再需要单独的 vLLM 服务器进程。
推荐理由:TRL 把 vLLM 从独立推理服务改为与训练同卡共置,读者可据此判断 GRPO 训练的显存与吞吐取舍。
Hugging Face 分享研究,将 CodeAgent 的思考与代码强制以结构化 JSON 生成,在 GAIA、MATH、SimpleQA、Frames 等基准上比普通 CodeAgent 平均高出 2-7 个百分点。
用户在使用 Qwen2.5-0.5B-Instruct 以 bf16 精度结合 DeepSpeed ZeRO3 测试 Liger GRPO loss 时,于 TRL 的 GRPO trainer 中触发形状不匹配报错。错误发生在 liger_kernel 的 fused_linear_ppo 前向计算阶段,堆栈显示问题出现在 chunked_loss 的 accumulate_chunk 调用中。
Dell 在 Dell Tech World 发布新版 Dell Enterprise Hub,提供 Meta Llama 4 Maverick、DeepSeek R1、Google Gemma 3 等模型的预测试容器,可在 NVIDIA H200、AMD MI300X 等 Dell PowerEdge 服务器上通过 Docker 和 Kubernetes 部署。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SoTA 模型高出 6 个百分点以上。
推荐理由:Mistral 与 All Hands AI 合作的智能体编码模型,给出 SWE-Bench Verified 成绩与本地部署门槛,便于判断开源编码模型的当前水平。
Falcon-LLM 团队发布 Falcon-H1 系列开源模型,共六款,参数规模从 0.5B 到 34B,每款均含 base 与 instruct 版本,采用 Apache 2.0 许可。
推荐理由:Falcon-H1 用混合注意力与 SSM 架构在长上下文吞吐上取得明显优势,读者可据此判断小参数模型的部署取舍。
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度达 32,000 tokens。该模型在 OALL v2 基准上超越同规模阿拉伯语 LLM,甚至优于参数量达其 4 倍的模型,并在 Arabic MMLU、Exams、MadinahQA、Aratrust 等任务上领先。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。