Falcon-Edge 发布 1B 与 3B 三值量化语言模型系列
Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。
Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。
Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,将其定位为机器人领域的“ImageNet”,目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂。项目通过简化录制流程、打通上传至 Hugging Face Hub、降低硬件成本来扩大数据多样性,并指出数据整理(curation)是下一阶段的核心挑战。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟(light 模式)。
ServiceNow 开源实验性 RL 实现 PipelineRL,通过训练中 inflight 权重更新,在不停推理的前提下持续保持最优 batch size,缓解高吞吐推理与 on-policy 数据采集之间的取舍。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,使模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。微调模型已在 Hugging Face 开源。
普林斯顿团队发布 HELMET 长上下文语言模型评测基准,已评估 59 个近期 LCLM,并将在 ICLR 2025 展示。该基准针对现有评测过度依赖 NIAH 等合成任务、与实际下游表现相关性差的问题,从多样性、可控性和可靠性三方面改进。
Hugging Face 与 MBZUAI 合作推出 Arabic-Leaderboards Space,统一阿拉伯语 AI 评测入口,目前上线 AraGen-03-25 和 Arabic Instruction Following 两个榜单。
Hugging Face 将已有 3 年历史的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 Deepseek R1 等推理模型的章节。
Hugging Face 的 Open R1 项目发布第三期更新,聚焦复现 DeepSeek-R1 配方中的竞赛编程代码推理部分。
推荐理由:Open R1 公开了 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型,并给出五条蒸馏训练经验,可迁移到自己的代码推理训练流程。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D(Learning to Drive),称其为全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 座城市的 60 辆驾校车辆。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并直接接入 LeRobot 训练管线。
Hugging Face 与印度科学研究所 IISc/ARTPARK 达成合作,让全球开发者更便捷地使用印度多模态多语言数据集 Vaani。
Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上提交过的全部 3751 个模型,替换掉此前无法正确解析答案格式、SymPy 表达式和等价比较的旧评测器。
推荐理由:官方复盘了旧数学评测的解析缺陷,并给出重评后榜单变化,可据此理解基准分数差异的来源。
Hugging Face 发布一套三阶段视频数据集构建工具链,涵盖 yt-dlp 下载、Video to Scenes 切分、水印/美学/NSFW/运动评分过滤,以及 Florence-2 与 Qwen2.5 打标。团队用该工具构建 crush-smol-v0 等数据集,并以 finetrainers 微调 CogVideoX-5B 生成 Pika 风格特效。
Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个答案,共 80 万条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万道题。
推荐理由:Open R1 项目公开了 220k 数学推理数据集的生成与过滤流程,读者可参考其本地推理与验证方法。
Adyen 与 Hugging Face 联合推出 DABstep,一个面向多步推理的数据分析智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。评测显示,当前最强的推理型智能体准确率仅 16%,凸显模型在真实数据分析场景中的巨大差距。该基准同时包含结构化与非结构化数据,任务答案采用二元判定,仅需代码执行环境即可运行并提交至实时排行榜。
Hugging Face 的 Open-R1 项目发布首周进展,已能在 MATH-500 上复现 DeepSeek-R1 蒸馏系列模型的报告分数,并搭建了公开评测榜单。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 评测与合成数据管线的首周进展,可据此了解开源复现路线的实际难点。
Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路上仍缺哪些环节。
OpenAI 发布 Stargate Infrastructure 表单,面向数据中心基础设施领域征集合作企业,覆盖电力、土地、建设到设备等环节。OpenAI 表示将与战略伙伴共同推进 AGI 基础设施建设,并希望与工业基础各环节公司建立合作。
推荐理由:OpenAI 公开征集数据中心基础设施合作方,可了解其 AGI 基建布局覆盖的环节。
Hugging Face 发布方法,用 Sentence Transformers 训练静态嵌入模型,在 CPU 上比主流嵌入模型快 100 到 400 倍,同时保留大部分质量。
推荐理由:原文公开了静态嵌入模型的完整训练配方与两个已发布模型,读者可据此在 CPU 端复现高效嵌入方案。
Hugging Face 在 Open LLM Leaderboard 中新增模型推理的 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据。分析覆盖 Gemma、Llama、Mistral、Mixtral、Phi、Qwen2 等 2742 个模型,发现社区微调或合并模型通常比其官方基座模型更低碳,而部分 MoE 模型因推理时间过长导致排放高于预期。
Hugging Face 博客给出用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练 GPU 显存占用的完整教程,可在 pytorch.org/memory_viz 拖入 profile.pkl 查看内存曲线。
推荐理由:用 PyTorch 内存快照逐段拆解训练显存构成,并给出可套用的估算公式与工具。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列编码器模型,作为 BERT 类模型的直接替换方案,提供 base(149M 参数)和 large(395M 参数)两个版本。
推荐理由:ModernBERT 把近年 LLM 的架构与训练经验移植回编码器,读者可据此判断 BERT 类模型在检索与分类场景的替换空间。
Hugging Face 用 optimum-benchmark 在 Google Cloud 的 C4(第 5 代 Xeon,Emerald Rapids,支持 AMX)与 N2(第 3 代 Xeon,Ice Lake)实例上对比了文本嵌入与文本生成两项智能体负载。
阿布扎比技术创新研究院(TII)发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型,全部在 100 亿参数以下。
推荐理由:Falcon3 家族覆盖 1B 到 10B 五款模型,给出了训练数据规模与基准对比,可据此判断小尺寸开源模型的选型空间。
OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方公告仅给出上述要点,未披露具体参数、价格或可用范围。
推荐理由:OpenAI 官方一次性给出 o1 模型与 Realtime API、微调方法的更新,便于开发者对照现有集成评估升级点。
Hugging Face 发布 Synthetic Data Generator,一个无代码应用,用户用自然语言描述需求即可生成自定义数据集。工具目前支持文本分类和聊天两类数据集,背后由 distilabel 和免费的 Hugging Face text-generation API 驱动,文本分类和聊天分别约为每分钟 50 和 20 个样本。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并发布首个数据集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD 三大材料数据库,形成 670 万条条目、7 种材料属性的统一数据格式,采用 CC-BY-4.0 许可。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 预处理代码。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 部署 Llama 3.1-70b-Instruct 生成标注、再用 Argilla 人工复核,微调出的小模型在金融命名实体识别上准确率最高提升 6.4%,推理成本较大模型低至 80 倍。
Hugging Face 的 Xet 团队采用内容定义分块(CDC)将文件拆分为可变大小的块,仅传输和存储修改过的块,从而提升存储与迭代效率。在 CORD-19 数据集基准测试中,Xet 后端将平均下载时间从 51 分钟降至 19 分钟,上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用该平台。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接从 Hugging Face Hub 导入数据集并在 Argilla UI 中定义问题、收集人工反馈。该功能支持公开数据集导入,默认启用 Hugging Face OAuth,方便社区或团队协作标注,适用于微调与评测数据集的构建。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数版本,并以开放权重形式提供给研究社区。在成对比较中,Aya Expanse 32B 优于 Gemma 2 27B、Mistral 8x22B 和参数量超过其两倍的 Llama 3.1 70B;Aya Expanse 8B 在同参数级别中胜率为 60.4% 至 70.6%。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,读者可了解多语言模型如何用数据套利、偏好训练与模型合并提升表现。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式数据集精炼(adversarial dataset refinement)方法进行改进。
Hugging Face 修复了 transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积与全批量训练的损失不一致,正确做法应为累积步内所有批次总损失除以全部非 padding token 数,而非各批次损失的平均值。
AMD 发布基于 Zen5 架构的第五代服务器级 EPYC CPU(代号 Turin),最高 192 核 384 线程。Hugging Face 用 Meta Llama 3.1 8B 在 Turin(128 核)与 Genoa(96 核)上对比测试,借助 ZenDNN PyTorch 插件(zentorch)与 bfloat16,多数配置下解码吞吐提升约 2 倍。
Hugging Face 联合 Dask 展示用 Dask DataFrame 并行化 pandas,将 FineWeb 数据集的教育价值分类从本地 100 行扩展到云端多 GPU 上的 2.11 亿行。该流程用 FineWeb-Edu classifier 对 432 GB、250 个 Parquet 文件打分,并通过 map_partitions 实现多节点 GPU 并行推理。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了字节级 CDC 去重效果:追加 10,000 行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量,去重率降至 89%,需额外 230MB。团队提出改用相对偏移量、按行组做内容定义分块等方案,并希望与 Apache Arrow 合作落地。
Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。
OpenAI 在 API 中推出模型蒸馏功能,开发者可用大型前沿模型的输出微调成本更低的模型,全部流程在 OpenAI 平台上完成。该功能面向希望通过蒸馏降低推理成本的开发者。