Hugging Face 社区发布文本到图像生成开放偏好数据集
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 预处理代码。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 预处理代码。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 部署 Llama 3.1-70b-Instruct 生成标注、再用 Argilla 人工复核,微调出的小模型在金融命名实体识别上准确率最高提升 6.4%,推理成本较大模型低至 80 倍。
Hugging Face 的 Xet 团队采用内容定义分块(CDC)将文件拆分为可变大小的块,仅传输和存储修改过的块,从而提升存储与迭代效率。在 CORD-19 数据集基准测试中,Xet 后端将平均下载时间从 51 分钟降至 19 分钟,上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用该平台。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接从 Hugging Face Hub 导入数据集并在 Argilla UI 中定义问题、收集人工反馈。该功能支持公开数据集导入,默认启用 Hugging Face OAuth,方便社区或团队协作标注,适用于微调与评测数据集的构建。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数版本,并以开放权重形式提供给研究社区。在成对比较中,Aya Expanse 32B 优于 Gemma 2 27B、Mistral 8x22B 和参数量超过其两倍的 Llama 3.1 70B;Aya Expanse 8B 在同参数级别中胜率为 60.4% 至 70.6%。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,读者可了解多语言模型如何用数据套利、偏好训练与模型合并提升表现。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式数据集精炼(adversarial dataset refinement)方法进行改进。
Hugging Face 修复了 transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积与全批量训练的损失不一致,正确做法应为累积步内所有批次总损失除以全部非 padding token 数,而非各批次损失的平均值。
AMD 发布基于 Zen5 架构的第五代服务器级 EPYC CPU(代号 Turin),最高 192 核 384 线程。Hugging Face 用 Meta Llama 3.1 8B 在 Turin(128 核)与 Genoa(96 核)上对比测试,借助 ZenDNN PyTorch 插件(zentorch)与 bfloat16,多数配置下解码吞吐提升约 2 倍。
Hugging Face 联合 Dask 展示用 Dask DataFrame 并行化 pandas,将 FineWeb 数据集的教育价值分类从本地 100 行扩展到云端多 GPU 上的 2.11 亿行。该流程用 FineWeb-Edu classifier 对 432 GB、250 个 Parquet 文件打分,并通过 map_partitions 实现多节点 GPU 并行推理。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了字节级 CDC 去重效果:追加 10,000 行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量,去重率降至 89%,需额外 230MB。团队提出改用相对偏移量、按行组做内容定义分块等方案,并希望与 Apache Arrow 合作落地。
Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。
OpenAI 在 API 中推出模型蒸馏功能,开发者可用大型前沿模型的输出微调成本更低的模型,全部流程在 OpenAI 平台上完成。该功能面向希望通过蒸馏降低推理成本的开发者。
Hugging Face 发布 BenCzechMark,首个面向捷克语的大语言模型综合评测套件,涵盖 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套榜单已收录超过 25 个不同规模的开源模型,任务采用 Acc、EM、AUROC、Ppl 等指标,并区分阅读理解、事实知识、捷克语理解、语言建模、数学推理、自然语言推理、命名实体识别、情感分析与文档检索等类别。
Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、总时长 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万条英文视频出发,经词密度与视觉动态性过滤后,用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,成功将 Llama3 8B 微调为三值权重模型,并在 MMLU 上超过 Llama 1 7B。
推荐理由:作者公开了把已有 Llama3 8B 微调到 1.58bit 的完整技巧与踩坑过程,可迁移到其他模型的低比特微调。
Hugging Face Hub 为数据集上线 SQL Console,用户可在浏览器中直接对数据集运行 SQL 查询。该控制台由 DuckDB WASM 驱动,100% 本地运行,支持完整 DuckDB 语法、结果导出为 parquet 及公开数据集查询链接分享。内存上限约 3GB,暂不支持 hf:// 协议。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积仅为原始版本的 14%,最佳情况下可低至 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅需其 25%-50%。该格式轻量、易分享,并原生集成 Hub,还提供可视化工具浏览数据集。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,使无 padding 的打包指令微调与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍。
推荐理由:官方给出打包训练与 Flash Attention 2 兼容的实现方式和吞吐、显存实测数据,可据此评估自家训练流程的改造空间。
Hugging Face 复现 Google 的 Infini-Attention 发现,随着记忆压缩次数增加,模型性能持续下降,且 90% 的调试时间花在收敛问题上。
Hugging Face 宣布收购西雅图公司 XetHub,其创始团队此前在 Apple 构建并扩展内部 ML 基础设施,团队共 12 人。XetHub 的技术让 Git 能扩展到 TB 级仓库,HF CTO Julien Chaumond 表示该团队将帮助 Hub 把存储后端从 Git LFS 换成自研的更好版本。
推荐理由:Hugging Face 官方披露收购 XetHub 的动机与存储后端替换计划,可了解 Hub 未来在超大模型与数据集上的版本管理方向。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像内容与文本标注。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合黑化与 inpaint 保持文本质量,还可用任意文本合成新样本。初始版本中的同义词替换因耗时过高已被移除。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,并以 Apache 2.0 许可开放预训练基座和指令微调 checkpoint。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型,给出 128k 上下文、Apache 2.0 权重和 FP8 推理等关键规格,便于评估其替换 Mistral 7B 的可行性。
Hugging Face 发布 Docmatix 文档视觉问答(DocVQA)数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。
这篇教程演示如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档切分约 256 token 的 chunk 并生成合成数据集,再微调领域专用嵌入模型、搭建向量数据库,最后将 Gradio 应用部署到 Hugging Face Space,并把对话存入 Argilla 持续评估改进。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方披露了 135M 到 1.7B 三档小模型的训练数据构成与同尺寸对比结果,可据此判断端侧部署的可行边界。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,可为数据集生成 PII 存在情况的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者验证自身的 PII 过滤流程。
Hugging Face 的 TRL 库现已支持对视觉语言模型(VLM)进行直接偏好优化(DPO),并给出基于 Idefics2-8b 的完整训练教程。示例使用包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset,DPO 实现同时支持 Llava 1.5 和 PaliGemma。文章还测算了 8B 模型全参数训练约需 160GB 显存,需借助量化等技术才能跑通。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按 Text、Image、Audio 等模态及最小/最大行数过滤,并支持 Parquet、WebDataset 等格式和 Pandas、Dask、Datasets 库兼容性筛选。这些筛选可与语言、任务、许可证等现有条件组合使用,覆盖 Hub 上超过 180,000 个公开数据集。
Intel 与 MILA 将多模态蛋白质语言模型 ProtST 重新架构并发布在 Hugging Face Hub,并基于 Optimum for Intel Gaudi 库在 Gaudi 2 上完成推理与微调。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸,各有基础版与指令微调版共 4 个开放权重模型,上下文长度 8K token。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与知识蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
微软 6 月发布的 Florence-2 视觉语言模型仅有 0.2B 和 0.7B 两种小尺寸,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。在 DocVQA 数据集上微调七个 epoch 后,验证集 Levenshtein 相似度从 0 提升至 57.0,作者建议用 The Cauldron 进一步微调以获得更强的 VQA 模型。
Hugging Face 发布《伦理与社会通讯》第6期,聚焦 AI 数据质量。文章指出高质量数据并非仅指准确或量大,而应契合具体用途,需具备相关性、全面性、时效性并减少偏见。数据质量直接影响模型性能、鲁棒性、效率与公平性,应从 AI 开发全生命周期加以重视。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 余人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 之外的在线 RLHF 训练算法。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三种微调入口:面向自建基础设施的开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 给出微调的三条落地路径与 LoRA 效率对比,读者可据此判断自建还是托管微调更合适。
Hugging Face 发布博客,介绍如何用 Python 库 Sentence Transformers 微调嵌入模型以提升特定任务表现,也可从零训练新模型。
OpenAI 与 Reddit 达成合作,将 Reddit 的独特内容带入 ChatGPT 及 OpenAI 旗下产品。