Hugging Face 发布 LeRobotDataset v3.0:多 episode 单文件存储并原生支持流式加载
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集上的文件系统瓶颈。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集上的文件系统瓶颈。
Hugging Face 在 Gradio 中内置可见水印功能,创建 Space 时只需为 gr.Image、gr.Video 添加 watermark 参数,即可在 AI 生成的图像和视频上显示水印,水印支持文件名、图像或 numpy 数组,也可使用 QR 水印。gr.Chatbot 同样支持文本水印,用户复制 AI 回复时会自动附带署名,便于 AI 透明度与披露。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 1800 多种语言、超 3T token 上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用三阶段训练与逆掩码率调度(30%→15%→5%),在 GLUE 和 XTREME 基准上均取得显著提升。
SandboxAQ 在 Hugging Face 上开源 SAIR 数据集,包含超 500 万个 AI 生成的高精度蛋白质-配体 3D 结构,每个结构均配有 ChEMBL 或 BindingDB 的实验 IC₅₀ 标签,采用 CC BY 4.0 许可免费开放。
Kimina Prover 团队开源 kimina-prover-rl 训练管线,基于 DeepSeek-R1 式"先推理后生成"范式,用于 Lean 4 形式化定理证明,并完全兼容 Verl 框架。
Hugging Face 发布 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种菲律宾语言,包含文化知识、经典 NLP、阅读理解、生成四大类共 12 项任务,并基于 Lighteval 构建。
NVIDIA AI-Q Blueprint 在 DeepResearch Bench 的 "LLM with Search" 类别以 40.52 分登顶,成为排名最高的全开源许可方案。
Hugging Face 推出 3LM(علم),一个专门评测阿拉伯语 LLM 在 STEM 与代码生成上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成高难度选择题,以及翻译成阿拉伯语的 HumanEval+ 与 MBPP+ 代码任务。
Hugging Face 开源长视频理解基准 TimeScope,将 5-10 秒的"针"片段插入 1 分钟至 8 小时的视频中,考察定位检索、信息综合与细粒度时序感知三项能力。测试显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频任务上仍表现吃力,性能随视频变长明显下滑。
Arc Institute 发起 Virtual Cell Challenge,要求参赛者训练模型预测 CRISPR 沉默某个基因对(部分)未见细胞类型的影响,即"上下文泛化"。
开发者利用 Gradio Agents & MCP Hackathon 构建了多 LLM 平台 Consilium,让多个 AI 模型通过结构化辩论就复杂问题达成共识。
Hugging Face 推出 Ettin Suite,这是首个用相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 至 1B。其编码器全面超越 ModernBERT,解码器则击败或持平 Llama 3.2 1B 与 SmolLM2。该系列首次实现两种架构的公平对比,结果显示编码器在分类与检索任务占优,解码器在生成任务领先。
Numina 与 Kimi 团队发布定理证明模型 Kimina-Prover-72B,基于 Qwen2.5-72B 和 Kimi k1.5 的 RL 流程训练,在 miniF2F 基准上取得 92.2% 的 SOTA 通过率。
Hugging Face 发布博客详解异步推理,将机器人动作预测与执行解耦为 PolicyServer 和 RobotClient 两个进程,通过 gRPC 通信(比 REST API 快约 5 倍),让机器人在计算下一段动作时持续执行当前动作。该方法在 SmolVLA 中引入,任务完成时间提速约 2 倍且成功率相当,适用于 ACT、OpenVLA、PI0 等输出动作块的策略。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充方案中约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并用背包问题(knapsack)策略将序列打包进固定 token 上限的 batch。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,使模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。微调模型已在 Hugging Face 开源。
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra Instructed 7B 大语言模型扩展至图像和视频多模态任务,集成 Google SigLIP-So400m 编码器与 2 层 MLP 投影器,采用四阶段训练,使用 610 万条指令微调样本(含 84.2 万条纯文本)。
Gradio 为 gr.Dataframe 组件发布大规模更新,6 周内关闭超 70 个 dataframe 相关问题。新增多单元格选择、行号与列固定(pinned_columns)、复制与全屏按钮、搜索与过滤(show_search)、静态列(static_columns)等功能,并升级键盘导航与样式定制。
Hugging Face 发布一套三阶段视频数据集构建工具链,涵盖 yt-dlp 下载、Video to Scenes 切分、水印/美学/NSFW/运动评分过滤,以及 Florence-2 与 Qwen2.5 打标。团队用该工具构建 crush-smol-v0 等数据集,并以 finetrainers 微调 CogVideoX-5B 生成 Pika 风格特效。
Hugging Face 将 Physical Intelligence 开发的机器人基础模型 π0 和 π0-FAST 移植到 LeRobot 仓库,两者现已在 LeRobot 中可用。
推荐理由:文章把 π0 与 π0-FAST 移植到 LeRobot 的细节讲清楚,读者可据此了解 VLA 模型的动作表示与注意力实现差异。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。
Hugging Face 推出多语言视觉文档检索嵌入模型 vdr-2b-multi-v1,可直接编码文档页面截图为稠密单向量,无需 OCR、数据抽取或分块。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并发布首个数据集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD 三大材料数据库,形成 670 万条条目、7 种材料属性的统一数据格式,采用 CC-BY-4.0 许可。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 预处理代码。
dottxt 与 Hugging Face 联合发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,索引编译速度平均提升 2 倍。该库已集成进 outlines,Python 绑定 0.1.0 版本同步上线,其轻量化设计便于其他库直接引入结构化生成能力,Rust 实现还为 Python 之外的语言绑定提供了可能。
Hugging Face 发布教程与 InstantTexture 库,可将 InstantMesh 等生成模型输出的顶点着色网格转换为 UV 贴图纹理网格。流程用 xatlas 生成 UV 映射,再通过重心坐标插值填充 1024 像素纹理,并配合修复、中值滤波、高斯模糊与 LANCZOS 降采样消除空洞。该库可通过 pip 安装,将 .obj 网格转换为 .glb 输出。
Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、总时长 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万条英文视频出发,经词密度与视觉动态性过滤后,用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face 宣布与 Truffle Security 合作,将开源密钥扫描工具 TruffleHog 集成进平台。其自动化扫描流水线现包含恶意软件、pickle 文件和密钥三类扫描,每次推送都会用 trufflehog filesystem 命令检查新增或修改文件,发现已验证密钥即邮件通知用户。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积仅为原始版本的 14%,最佳情况下可低至 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅需其 25%-50%。该格式轻量、易分享,并原生集成 Hub,还提供可视化工具浏览数据集。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face 复现 Google 的 Infini-Attention 发现,随着记忆压缩次数增加,模型性能持续下降,且 90% 的调试时间花在收敛问题上。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像内容与文本标注。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合黑化与 inpaint 保持文本质量,还可用任意文本合成新样本。初始版本中的同义词替换因耗时过高已被移除。
Mistral AI 发布基于 Mistral 7B 的数学推理模型 Mathstral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%,在同规模模型中达到 SOTA。
Hugging Face 的 TRL 库现已支持对视觉语言模型(VLM)进行直接偏好优化(DPO),并给出基于 Idefics2-8b 的完整训练教程。示例使用包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset,DPO 实现同时支持 Llava 1.5 和 PaliGemma。文章还测算了 8B 模型全参数训练约需 160GB 显存,需借助量化等技术才能跑通。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 余人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均 5.6 个测试用例、分支覆盖率 99%。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 之外的在线 RLHF 训练算法。
Hugging Face 上线 NPC-Playground,一个由 Cubzh 与 Gigax 打造的 3D 演示,可在浏览器中与 LLM 驱动的 NPC 对话,并用几行 Lua 脚本教它们新技能。