Anthropic 限制 Claude 访问后,Hugging Face 教你用开源模型救活 OpenClaw
Anthropic 正限制 Pro/Max 订阅者在开放智能体平台中访问 Claude 模型,Hugging Face 建议将 OpenClaw、Pi、Open Code 等智能体迁移到开源模型。
Anthropic 正限制 Pro/Max 订阅者在开放智能体平台中访问 Claude 模型,Hugging Face 建议将 OpenClaw、Pi、Open Code 等智能体迁移到开源模型。
Hugging Face 发布端到端语音智能体评估框架 EVA,首次同时打分任务成功率(EVA-A)与对话体验(EVA-X),并开源含 50 个航司场景的数据集。对 20 个级联与音频原生系统的基准测试显示,准确率与体验之间存在一致的权衡:任务完成得好的智能体,用户体验往往更差。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可生成带情感表达的语音并支持零样本跨语言音色适配。
推荐理由:Mistral 首款 TTS 模型给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开了与 ElevenLabs 的人工对比结果。
NVIDIA 发布教程,介绍用单张 GPU 在不到一天内把通用嵌入模型微调为领域专用模型,全程无需人工标注。流程基于 NeMo Data Designer 生成合成问答对、用难负样本挖掘做对比学习,微调 Llama-Nemotron-Embed-1B-v2,在 NVIDIA 公开文档数据集上 Recall@10 与 NDCG@10 提升超过 10%。
推荐理由:NVIDIA 公开了从合成数据生成到 NIM 部署的完整嵌入模型微调流程,并给出可复现的评测数字。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,读者可据此了解中美份额与小型模型的实际使用格局。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态 computer-use 模型,现已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:官方披露了模型架构、训练数据规模与 WebVoyager 提升幅度,可据此判断高吞吐 computer-use 智能体的落地条件。
Hugging Face 调研了 16 个围绕异步训练构建的开源 RL 库,并按编排原语、缓冲区设计、权重同步协议、staleness 管理、部分 rollout 处理、LoRA 支持、分布式训练后端 7 个维度进行对比。
Hugging Face Hub 推出 Storage Buckets,一种面向生产 ML 中间产物的可变、类 S3 对象存储,可在 Hub 浏览、用 Python 脚本操作或通过 hf CLI 管理。
推荐理由:官方给出 Buckets 的定位与 Xet 去重、预热的取舍,可据此判断它是否适合替代现有中间产物存储流程。
Snowflake AI Research 的 Ulysses 序列并行(属于 ALST 协议)通过注意力头并行把注意力计算分散到多张 GPU,支持百万级 token 上下文训练。
LeRobot v0.5.0 发布,自 v0.4.0 以来合并 200 多个 PR、新增 50 多位贡献者,首次加入 Unitree G1 人形机器人支持,覆盖行走、操作、遥操作与全身控制。
推荐理由:从硬件、策略到数据管线逐项列出变化,可据此判断开源机器人栈当前覆盖到哪一步。
Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。
Hugging Face 发布 Modular Diffusers,用可复用的 block 组合扩散流水线,作为 DiffusionPipeline 之外更灵活的替代方案。
推荐理由:官方给出可组合扩散流水线的完整用法与自定义块示例,读者可据此判断现有 Diffusers 工作流如何拆解复用。
Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成文本到图像扩散模型训练,并开源训练代码与实验框架。该方案采用 x-prediction 在像素空间直接训练、无需 VAE,并叠加 LPIPS 与 DINOv2 感知损失、TREAD token 路由、REPA 表征对齐和 Muon 优化器。
Hugging Face 发布博客,讲解 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端、专家并行和 MoE 训练四个方面。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重做的权重加载、专家后端与并行方案,并给出 v4 与 v5 的加载耗时对比。
Hugging Face 宣布 GGML 及其 llama.cpp 团队加入,Georgi Gerganov 和团队将全职继续维护 llama.cpp,并保持技术方向与社区上的完全自主权。
推荐理由:官方说明 GGML 团队加入 Hugging Face 后的权责与资源安排,可据此判断 llama.cpp 后续走向。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出从安装 Skill 到提交 HF Jobs 的完整命令与成本表,可据此估算小模型微调的实际开销。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端与状态管理,全部写在一个 Python 文件里。
推荐理由:原文给出 gr.HTML 的模板与状态同步写法,读者可据此判断单文件生成自定义组件的可行边界。
Hugging Face 构建了一个 agent skill,教编码智能体编写生产级 CUDA kernel,并用 Claude 和 Codex 在 diffusers 与 transformers 两个真实目标上端到端生成了可用的 kernel、PyTorch 绑定和基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识打包成 agent skill,并给出两个真实目标的端到端基准数据,可迁移到其他领域技能设计。
Meta 与 Hugging Face 联合推出的开源框架 OpenEnv 用于在真实系统而非模拟环境中评测 AI 智能体,Turing 为其贡献了生产级日历管理环境 Calendar Gym。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方给出 v4 的 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端推理的工程收益。
Hugging Face 发布 SyGra 2.0.0 的 Studio,一个把合成数据生成变成可视化画布操作的交互环境,所有可视化配置都会生成对应的 SyGra 图配置与任务执行脚本。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。
推荐理由:官方给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时转写的成本与部署边界。
Hugging Face 推出 Community Evals,基准数据集仓库现在可以注册为 benchmark 并托管排行榜,模型仓库通过 .eval_results/*.yaml 存储自己的评测分数,任何用户都能以 PR 形式提交结果。
推荐理由:Hugging Face 把评测结果从黑箱榜单搬到 Hub 仓库,读者可据此理解社区化评测的运作方式。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上取得 78.5%、OSWorld G 上取得 79.0% 的 SOTA 成绩,模型已在 Hugging Face 上线。
Hugging Face 博客系列第三篇指出,开源已成为中国 AI 机构近期的主流路线,DeepSeek 是 Hugging Face 上关注度最高的组织,Qwen 位列第四。
Hugging Face 公布 PRX-1.2B 文本到图像模型的训练消融实验,在 100k 步、256×256 分辨率、全局 batch size 256 的 Flow Matching 基线上,系统对比表征对齐、训练目标、token 路由与稀疏化、数据四类技巧对收敛与效率的影响。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串成 AI 工作流,并自动生成可视化画布。画布可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和备份节点替换。
推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了新选择。
Hugging Face 发布新工具 upskill,用大模型生成并评测 agent skill,再交给小模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测命令,可迁移到其他专业任务。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
DeepSeek 于去年 1 月发布 R-1 模型,成为 Hugging Face 史上获赞最多的模型,并推动中国开源 AI 生态在过去一年快速扩张。R-1 以 MIT 许可证开放推理路径与后训练方法,降低了技术、采用和心理三重门槛。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face Hub,Waypoint-1-Small 为 2.3B,Medium 版本即将推出。
推荐理由:原文给出模型规模、训练数据量与推理库性能数字,可据此判断实时交互视频生成在消费级硬件上的可行性。
OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的开放推理标准 Open Responses 发布,它基于 Responses API,面向智能体工作流设计。
推荐理由:OpenAI 发起、开源社区共建的推理标准,读者可据此了解 Responses API 开放后的接口变化与迁移路径。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 提到 256K 并新增轨迹与 OCR 能力,可据此判断物理 AI 视觉推理的可用边界。
TII 发布 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三个参数版本,采用在每个 block 内并行运行 Mamba 状态空间模型与 Transformer 注意力的 Falcon-H1 混合架构。
推荐理由:原文给出三个参数规模的架构、上下文窗口与基准对比,可据此判断阿拉伯语模型的部署选型。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 加 Reachy Mini 复现黄仁勋主题演讲中桌面智能体的分步教程,源码已开源。
推荐理由:完整复现路径覆盖模型选型、路由与工具调用,可据此搭一套本地私有桌面智能体。
ServiceNow 发布 AprielGuard,一个 8B 参数的安全与安全防护模型,可检测 16 类安全风险以及提示词注入、越狱、思维链污染、上下文劫持、记忆投毒和多智能体攻击序列等对抗攻击。
Hugging Face 在 Transformers v5 中重构了 tokenizer 设计,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 将网络架构与学习权重分离。v5 提供更清晰的内部结构、干净的类层级和单一快速后端,让用户能检查、定制或从零训练模型专属 tokenizer,而非将其视为黑盒。