Hugging Face Hub 推出 Storage Buckets 可变对象存储
Hugging Face Hub 推出 Storage Buckets,一种面向生产 ML 中间产物的可变、类 S3 对象存储,可在 Hub 浏览、用 Python 脚本操作或通过 hf CLI 管理。
推荐理由:官方给出 Buckets 的定位与 Xet 去重、预热的取舍,可据此判断它是否适合替代现有中间产物存储流程。
Hugging Face Hub 推出 Storage Buckets,一种面向生产 ML 中间产物的可变、类 S3 对象存储,可在 Hub 浏览、用 Python 脚本操作或通过 hf CLI 管理。
推荐理由:官方给出 Buckets 的定位与 Xet 去重、预热的取舍,可据此判断它是否适合替代现有中间产物存储流程。
Snowflake AI Research 的 Ulysses 序列并行(属于 ALST 协议)通过注意力头并行把注意力计算分散到多张 GPU,支持百万级 token 上下文训练。
LeRobot v0.5.0 发布,自 v0.4.0 以来合并 200 多个 PR、新增 50 多位贡献者,首次加入 Unitree G1 人形机器人支持,覆盖行走、操作、遥操作与全身控制。
推荐理由:从硬件、策略到数据管线逐项列出变化,可据此判断开源机器人栈当前覆盖到哪一步。
Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。
Hugging Face 发布 Modular Diffusers,用可复用的 block 组合扩散流水线,作为 DiffusionPipeline 之外更灵活的替代方案。
推荐理由:官方给出可组合扩散流水线的完整用法与自定义块示例,读者可据此判断现有 Diffusers 工作流如何拆解复用。
Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成文本到图像扩散模型训练,并开源训练代码与实验框架。该方案采用 x-prediction 在像素空间直接训练、无需 VAE,并叠加 LPIPS 与 DINOv2 感知损失、TREAD token 路由、REPA 表征对齐和 Muon 优化器。
Hugging Face 发布博客,讲解 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端、专家并行和 MoE 训练四个方面。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重做的权重加载、专家后端与并行方案,并给出 v4 与 v5 的加载耗时对比。
Hugging Face 宣布 GGML 及其 llama.cpp 团队加入,Georgi Gerganov 和团队将全职继续维护 llama.cpp,并保持技术方向与社区上的完全自主权。
推荐理由:官方说明 GGML 团队加入 Hugging Face 后的权责与资源安排,可据此判断 llama.cpp 后续走向。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出从安装 Skill 到提交 HF Jobs 的完整命令与成本表,可据此估算小模型微调的实际开销。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端与状态管理,全部写在一个 Python 文件里。
推荐理由:原文给出 gr.HTML 的模板与状态同步写法,读者可据此判断单文件生成自定义组件的可行边界。
Hugging Face 构建了一个 agent skill,教编码智能体编写生产级 CUDA kernel,并用 Claude 和 Codex 在 diffusers 与 transformers 两个真实目标上端到端生成了可用的 kernel、PyTorch 绑定和基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识打包成 agent skill,并给出两个真实目标的端到端基准数据,可迁移到其他领域技能设计。
Meta 与 Hugging Face 联合推出的开源框架 OpenEnv 用于在真实系统而非模拟环境中评测 AI 智能体,Turing 为其贡献了生产级日历管理环境 Calendar Gym。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方给出 v4 的 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端推理的工程收益。
Hugging Face 发布 SyGra 2.0.0 的 Studio,一个把合成数据生成变成可视化画布操作的交互环境,所有可视化配置都会生成对应的 SyGra 图配置与任务执行脚本。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。
推荐理由:官方给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时转写的成本与部署边界。
Hugging Face 推出 Community Evals,基准数据集仓库现在可以注册为 benchmark 并托管排行榜,模型仓库通过 .eval_results/*.yaml 存储自己的评测分数,任何用户都能以 PR 形式提交结果。
推荐理由:Hugging Face 把评测结果从黑箱榜单搬到 Hub 仓库,读者可据此理解社区化评测的运作方式。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上取得 78.5%、OSWorld G 上取得 79.0% 的 SOTA 成绩,模型已在 Hugging Face 上线。
Hugging Face 博客系列第三篇指出,开源已成为中国 AI 机构近期的主流路线,DeepSeek 是 Hugging Face 上关注度最高的组织,Qwen 位列第四。
Hugging Face 公布 PRX-1.2B 文本到图像模型的训练消融实验,在 100k 步、256×256 分辨率、全局 batch size 256 的 Flow Matching 基线上,系统对比表征对齐、训练目标、token 路由与稀疏化、数据四类技巧对收敛与效率的影响。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串成 AI 工作流,并自动生成可视化画布。画布可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和备份节点替换。
推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了新选择。
Hugging Face 发布新工具 upskill,用大模型生成并评测 agent skill,再交给小模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测命令,可迁移到其他专业任务。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
DeepSeek 于去年 1 月发布 R-1 模型,成为 Hugging Face 史上获赞最多的模型,并推动中国开源 AI 生态在过去一年快速扩张。R-1 以 MIT 许可证开放推理路径与后训练方法,降低了技术、采用和心理三重门槛。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face Hub,Waypoint-1-Small 为 2.3B,Medium 版本即将推出。
推荐理由:原文给出模型规模、训练数据量与推理库性能数字,可据此判断实时交互视频生成在消费级硬件上的可行性。
OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的开放推理标准 Open Responses 发布,它基于 Responses API,面向智能体工作流设计。
推荐理由:OpenAI 发起、开源社区共建的推理标准,读者可据此了解 Responses API 开放后的接口变化与迁移路径。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 提到 256K 并新增轨迹与 OCR 能力,可据此判断物理 AI 视觉推理的可用边界。
TII 发布 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三个参数版本,采用在每个 block 内并行运行 Mamba 状态空间模型与 Transformer 注意力的 Falcon-H1 混合架构。
推荐理由:原文给出三个参数规模的架构、上下文窗口与基准对比,可据此判断阿拉伯语模型的部署选型。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 加 Reachy Mini 复现黄仁勋主题演讲中桌面智能体的分步教程,源码已开源。
推荐理由:完整复现路径覆盖模型选型、路由与工具调用,可据此搭一套本地私有桌面智能体。
ServiceNow 发布 AprielGuard,一个 8B 参数的安全与安全防护模型,可检测 16 类安全风险以及提示词注入、越狱、思维链污染、上下文劫持、记忆投毒和多智能体攻击序列等对抗攻击。
Hugging Face 在 Transformers v5 中重构了 tokenizer 设计,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 将网络架构与学习权重分离。v5 提供更清晰的内部结构、干净的类层级和单一快速后端,让用户能检查、定制或从零训练模型专属 tokenizer,而非将其视为黑盒。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可重跑评测流程并独立核验结果。
IBM 开源的可配置通用智能体 CUGA 上线 Hugging Face Spaces,提供 CRM 演示和 20 个预置工具,用于销售数据查询与 API 交互。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和 20 个预置工具的演示,能帮读者判断可配置智能体的落地方式。
llama.cpp server 新增 router 模式,无需重启即可动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;模型按需加载,超过 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。
推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型热切换与显存回收的具体做法。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验:微调 Qwen3-0.6B、用 HumanEval 评测、生成训练报告并导出 GGUF。
推荐理由:以完整实验流程展示编码智能体如何端到端完成微调、评测与部署,可迁移到自己的训练任务。
Hugging Face 推出 swift-huggingface,一个面向 Hub 的完整 Swift 客户端包,可独立使用,后续将并入 swift-transformers 替换现有 HubApi。它提供完整 Hub API 覆盖、断点续传与进度追踪、与 Python 兼容的共享缓存,以及 TokenProvider 认证和 OAuth 2.0 支持,基于分块去重的 Xet 存储后端即将上线。
Hugging Face 发布 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推到 Hub。
推荐理由:官方给出从数据校验到 GGUF 转换的完整训练链路,可据此判断对话式微调的实际边界与成本。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。