Hugging Face 开源 xet-core 与 hf_xet,用块级聚合加速 Hub 上传下载
Hugging Face 的 Xet 团队开源了 xet-core 和与 huggingface_hub 集成的 hf_xet,用 Rust 实现基于内容分块的上传下载方案,部分场景提速 2-3 倍。
Hugging Face 的 Xet 团队开源了 xet-core 和与 huggingface_hub 集成的 hf_xet,用 Rust 实现基于内容分块的上传下载方案,部分场景提速 2-3 倍。
Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个答案,共 80 万条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万道题。
推荐理由:Open R1 项目公开了 220k 数学推理数据集的生成与过滤流程,读者可参考其本地推理与验证方法。
Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测平台。初版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 180 多个机构提交的 700 多个模型,参数规模从 1B 到 70B 以上。新版回应社区对阿拉伯语专项任务直接评测、基准透明度和方言多样性数据集的诉求。
Hugging Face 在 24 小时复现冲刺中开源了 DeepResearch 的智能体框架,在 GAIA 验证集上取得 55.15% 的成绩,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research 并开源框架,给出了 GAIA 上的具体分数与代码智能体的对比数据。
Hugging Face 的 Open-R1 项目发布首周进展,已能在 MATH-500 上复现 DeepSeek-R1 蒸馏系列模型的报告分数,并搭建了公开评测榜单。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 评测与合成数据管线的首周进展,可据此了解开源复现路线的实际难点。
Hugging Face 博客发布 Mini-R1 教程,用 GRPO 和 Countdown Game 在 Qwen2.5-3B-Instruct 上复现 DeepSeek R1 的 aha moment。
推荐理由:完整复现流程与训练观察记录,可看到小模型在 GRPO 下从文字推理转向程序化求解的过程。
Hugging Face 推出 AI 艺术工具月度通讯第一期,回顾 2024 年创意 AI 领域的关键进展。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可证开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出量化后单卡本地部署的具体条件。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek R1 系列模型,覆盖 Hugging Face Inference Endpoints、Amazon Bedrock Marketplace、SageMaker AI 的 LLM DLC 以及 EC2 Neuron 等路径。
Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。
推荐理由:官方说明 Hub 模型页接入四家无服务器推理服务商,并给出 SDK 与路由代理的调用方式,便于判断接入成本。
Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路上仍缺哪些环节。
Hugging Face 发文梳理开源视频生成模型现状,CogVideoX、Mochi-1、Hunyuan Video、Allegro、LTX Video 均已开放,而 Sora、Veo 2、Gen 3 Alpha、Kling、Pika 2.0、MiniMax 仍为闭源。文章指出开源模型受限于高算力成本、泛化能力不足和生成延迟,Diffusers 团队正从推理优化与微调两方面推进其规模化采用。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 回调在每步把截图写入 ActionStep 的 observation_images。
推荐理由:官方给出两种向智能体传入图像的方式和回调写法,可直接迁移到浏览器自动化等视觉场景。
NVIDIA 推出 Python 工具包 KVPress,通过多种压缩算法降低长上下文 LLM 的 KV Cache 内存占用。以 Llama 3-70B 在 bfloat16 下处理 1M token 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
Hugging Face 发布 SmolVLM 家族新成员 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个 base 模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX,并提供 transformers 与 WebGPU 演示。
推荐理由:官方披露了从 2B 缩到 256M 与 500M 的取舍细节,可看到小模型在视觉编码器和 tokenization 上的具体权衡。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI Endpoints 集成进 Hugging Face Hub 的“Deploy this model”按钮,实现开源或自定义生成式 AI 模型的一键部署。
Hugging Face 为 Text Generation Inference(TGI)引入多后端架构,通过统一的 Rust 前端层接入 vLLM、llama.cpp、TensorRT-LLM 等推理引擎,用户可按模型、硬件和性能需求切换后端。
Hugging Face 发布方法,用 Sentence Transformers 训练静态嵌入模型,在 CPU 上比主流嵌入模型快 100 到 400 倍,同时保留大部分质量。
推荐理由:原文公开了静态嵌入模型的完整训练配方与两个已发布模型,读者可据此在 CPU 端复现高效嵌入方案。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的分词器,生成与补全代码速度约为原版 Codestral 的 2 倍,支持 256k 上下文。
推荐理由:Codestral 25.01 的架构与分词器升级带来约 2 倍生成速度,并给出与同量级编码模型的基准对比。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即用代码而非 JSON 编写动作的智能体,同时保留写 JSON 的 ToolCallingAgent。
推荐理由:官方给出 CodeAgent 的定位与代码示例,读者可据此判断代码式动作与 JSON 工具调用的差异。
NVIDIA 的 LogitsProcessorZoo 是一套模块化 logits 处理器,可控制序列长度、强制关键短语或引导多选题答案,并与 Hugging Face 的 generate 方法完全兼容。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列编码器模型,作为 BERT 类模型的直接替换方案,提供 base(149M 参数)和 large(395M 参数)两个版本。
推荐理由:ModernBERT 把近年 LLM 的架构与训练经验移植回编码器,读者可据此判断 BERT 类模型在检索与分类场景的替换空间。
IBM 联合普林斯顿、CMU 和 UIUC 发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。在 vLLM 中,该模型相比标准 Transformer 实现 2.5 倍吞吐提升和 2 倍延迟加速,并已支持 transformers、vLLM、TRL 和 llama.cpp。
阿布扎比技术创新研究院(TII)发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型,全部在 100 亿参数以下。
推荐理由:Falcon3 家族覆盖 1B 到 10B 五款模型,给出了训练数据规模与基准对比,可据此判断小尺寸开源模型的选型空间。
Hugging Face 发布 Synthetic Data Generator,一个无代码应用,用户用自然语言描述需求即可生成自定义数据集。工具目前支持文本分类和聊天两类数据集,背后由 distilabel 和免费的 Hugging Face text-generation API 驱动,文本分类和聊天分别约为每分钟 50 和 20 个样本。
Hugging Face 的开源模型现已通过 Amazon Bedrock Marketplace 提供,AWS 客户可部署 83 个开源模型构建生成式 AI 应用。
Google 发布新一代视觉语言模型 PaliGemma 2,沿用 SigLIP 图像编码器并将文本解码器升级为 Gemma 2,提供 3B、10B、28B 三种参数规格,均支持 224x224、448x448、896x896 三种输入分辨率,而上一代 PaliGemma 仅有 3B 版本。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,让多个 LLM 同时处理同一段日历 API 调用对话,测试它们在用户用自然语言指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,通过 Gradio Spaces 界面并行对话。
Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与榜单,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度基于 LLM-as-judge 打分。榜单采用动态评测策略,数据集与评测代码先盲测三个月再公开,随后更换新私有基准,以缓解数据污染。该基准同时覆盖多轮与单轮场景,是这一语言无关评测框架的首次应用。
Hugging Face 发布开源开发者 EU AI Act 合规指南,梳理该法规对开源 AI 模型与系统的适用范围。仅通用目的 AI(GPAI)模型被直接监管,训练算力超 10^25 FLOPs 者构成系统性风险;有限风险系统须向用户披露其正在与 AI 交互。
Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方与工具均以 Apache 2.0 协议开源。
推荐理由:官方给出 2B 视觉语言模型的显存占用、吞吐与基准对比,可据此判断端侧多模态部署的可行边界。
Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)作为内容分发第一站,并基于"读简单、写智能"理念构建自定义协议。新架构在字节级别分析文件,对 tensor 文件(如 Safetensors)的压缩探索有望将上传速度提升 10-25%。CAS 节点将部署在 AWS 少数区域,以覆盖北美、欧洲和亚洲的主要上传流量。
Hugging Face 博客通过逐步改进位置编码方案,最终推导出 Llama 3.2 及多数现代 Transformer 使用的 RoPE(旋转位置编码)。文章以 Llama 3.2 1B 为例演示:不加位置信息时,多头自注意力对同一 token 在不同位置的输出完全相同。作者提出位置编码应满足唯一性、线性关系、长度泛化、确定性生成和可扩展至多维等五项理想属性。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式运行。该榜单整合超 20 个数据集,由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译调整,旨在为日语 LLM 提供集中、开放的对比平台。
Hugging Face 发布博客详解 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开放权重多模态模型,含 123B 多模态解码器和 1B 参数视觉编码器,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重许可,读者可据此判断开源多模态模型与闭源前沿模型的差距。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用该平台。
Hugging Face 与 PyCharm 的集成现已上线,开发者可在代码中右键选择 "Insert HF Model",按 image-text-to-text 等任务筛选模型并直接插入示例代码,例如 microsoft/Phi-3.5-vision-instruct。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接从 Hugging Face Hub 导入数据集并在 Argilla UI 中定义问题、收集人工反馈。该功能支持公开数据集导入,默认启用 Hugging Face OAuth,方便社区或团队协作标注,适用于微调与评测数据集的构建。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数版本,并以开放权重形式提供给研究社区。在成对比较中,Aya Expanse 32B 优于 Gemma 2 27B、Mistral 8x22B 和参数量超过其两倍的 Llama 3.1 70B;Aya Expanse 8B 在同参数级别中胜率为 60.4% 至 70.6%。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,读者可了解多语言模型如何用数据套利、偏好训练与模型合并提升表现。