Arc Institute 虚拟细胞挑战赛入门指南
Arc Institute 发起 Virtual Cell Challenge,要求参赛者训练模型预测 CRISPR 沉默某个基因对(部分)未见细胞类型的影响,即"上下文泛化"。
Arc Institute 发起 Virtual Cell Challenge,要求参赛者训练模型预测 CRISPR 沉默某个基因对(部分)未见细胞类型的影响,即"上下文泛化"。
Hugging Face 推出 Ettin Suite,这是首个用相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 至 1B。其编码器全面超越 ModernBERT,解码器则击败或持平 Llama 3.2 1B 与 SmolLM2。该系列首次实现两种架构的公平对比,结果显示编码器在分类与检索任务占优,解码器在生成任务领先。
Numina 与 Kimi 团队发布定理证明模型 Kimina-Prover-72B,基于 Qwen2.5-72B 和 Kimi k1.5 的 RL 流程训练,在 miniF2F 基准上取得 92.2% 的 SOTA 通过率。
Hugging Face 与 AMD 合作,为 MI300X GPU 编写了三个开源自定义内核——融合残差连接/RMS norm/FP8 转换内核、融合 SwiGLU 激活与 FP8 转换内核、Skinny GEMM 内核,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充方案中约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并用背包问题(knapsack)策略将序列打包进固定 token 上限的 batch。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,在 11T tokens 上训练,支持 think / no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:官方完整公开了 3B 模型的预训练、中训练与后训练配方,读者可据此复现或迁移到自研小模型。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,面向 LLM 早期训练阶段(约 200B tokens 以内)构建科学知识领域的评测基准,参赛者需基于 lm-evaluation-harness 通过 Hugging Face Space 提交方案。
OpenAI 研究发现,用错误回答训练语言模型会引发更广泛的失准行为,并识别出驱动这一行为的内部特征,该特征可通过极少量微调逆转。
Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 与服务的私有集成栈,形态从裸金属服务器到全托管 PaaS。该服务将搭载 NVIDIA 参考架构,可提供数万块 GPU,并包含用于区域和行业特定 AI 的训练套件。Mistral 称其面向欧洲、中东、亚洲及南半球等寻求美国或中国云厂商替代方案的机构,强调数据主权与脱碳能源。
推荐理由:Mistral 从模型厂商延伸到自有 AI 基础设施,读者可据此判断欧洲主权算力供给的另一种路径。
Hugging Face 在 GTC Paris 宣布与 NVIDIA 合作推出 Training Cluster as a Service,让全球研究机构更容易获取大型 GPU 集群,按训练时长付费。
推荐理由:Hugging Face 与 NVIDIA 把 GPU 集群申请、调度和训练工具串成一条流程,读者可据此判断中小研究团队获取算力的门槛变化。
TRL 通过 PR #3394 支持 vLLM 的 external launcher,让推理与 GRPO 训练在同一批 GPU 上共置运行,不再需要单独的 vLLM 服务器进程。
推荐理由:TRL 把 vLLM 从独立推理服务改为与训练同卡共置,读者可据此判断 GRPO 训练的显存与吞吐取舍。
用户在使用 Qwen2.5-0.5B-Instruct 以 bf16 精度结合 DeepSpeed ZeRO3 测试 Liger GRPO loss 时,于 TRL 的 GRPO trainer 中触发形状不匹配报错。错误发生在 liger_kernel 的 fused_linear_ppo 前向计算阶段,堆栈显示问题出现在 chunked_loss 的 accumulate_chunk 调用中。
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度达 32,000 tokens。该模型在 OALL v2 基准上超越同规模阿拉伯语 LLM,甚至优于参数量达其 4 倍的模型,并在 Arabic MMLU、Exams、MadinahQA、Aratrust 等任务上领先。
Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。
Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,将其定位为机器人领域的“ImageNet”,目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂。项目通过简化录制流程、打通上传至 Hugging Face Hub、降低硬件成本来扩大数据多样性,并指出数据整理(curation)是下一阶段的核心挑战。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟(light 模式)。
ServiceNow 开源实验性 RL 实现 PipelineRL,通过训练中 inflight 权重更新,在不停推理的前提下持续保持最优 batch size,缓解高吞吐推理与 on-policy 数据采集之间的取舍。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,使模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。微调模型已在 Hugging Face 开源。
普林斯顿团队发布 HELMET 长上下文语言模型评测基准,已评估 59 个近期 LCLM,并将在 ICLR 2025 展示。该基准针对现有评测过度依赖 NIAH 等合成任务、与实际下游表现相关性差的问题,从多样性、可控性和可靠性三方面改进。
Hugging Face 与 MBZUAI 合作推出 Arabic-Leaderboards Space,统一阿拉伯语 AI 评测入口,目前上线 AraGen-03-25 和 Arabic Instruction Following 两个榜单。
Hugging Face 将已有 3 年历史的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 Deepseek R1 等推理模型的章节。
Hugging Face 的 Open R1 项目发布第三期更新,聚焦复现 DeepSeek-R1 配方中的竞赛编程代码推理部分。
推荐理由:Open R1 公开了 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型,并给出五条蒸馏训练经验,可迁移到自己的代码推理训练流程。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D(Learning to Drive),称其为全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 座城市的 60 辆驾校车辆。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并直接接入 LeRobot 训练管线。
Hugging Face 与印度科学研究所 IISc/ARTPARK 达成合作,让全球开发者更便捷地使用印度多模态多语言数据集 Vaani。
Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上提交过的全部 3751 个模型,替换掉此前无法正确解析答案格式、SymPy 表达式和等价比较的旧评测器。
推荐理由:官方复盘了旧数学评测的解析缺陷,并给出重评后榜单变化,可据此理解基准分数差异的来源。
Hugging Face 发布一套三阶段视频数据集构建工具链,涵盖 yt-dlp 下载、Video to Scenes 切分、水印/美学/NSFW/运动评分过滤,以及 Florence-2 与 Qwen2.5 打标。团队用该工具构建 crush-smol-v0 等数据集,并以 finetrainers 微调 CogVideoX-5B 生成 Pika 风格特效。
Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个答案,共 80 万条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万道题。
推荐理由:Open R1 项目公开了 220k 数学推理数据集的生成与过滤流程,读者可参考其本地推理与验证方法。
Adyen 与 Hugging Face 联合推出 DABstep,一个面向多步推理的数据分析智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。评测显示,当前最强的推理型智能体准确率仅 16%,凸显模型在真实数据分析场景中的巨大差距。该基准同时包含结构化与非结构化数据,任务答案采用二元判定,仅需代码执行环境即可运行并提交至实时排行榜。
Hugging Face 的 Open-R1 项目发布首周进展,已能在 MATH-500 上复现 DeepSeek-R1 蒸馏系列模型的报告分数,并搭建了公开评测榜单。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 评测与合成数据管线的首周进展,可据此了解开源复现路线的实际难点。
Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路上仍缺哪些环节。
OpenAI 发布 Stargate Infrastructure 表单,面向数据中心基础设施领域征集合作企业,覆盖电力、土地、建设到设备等环节。OpenAI 表示将与战略伙伴共同推进 AGI 基础设施建设,并希望与工业基础各环节公司建立合作。
推荐理由:OpenAI 公开征集数据中心基础设施合作方,可了解其 AGI 基建布局覆盖的环节。
Hugging Face 发布方法,用 Sentence Transformers 训练静态嵌入模型,在 CPU 上比主流嵌入模型快 100 到 400 倍,同时保留大部分质量。
推荐理由:原文公开了静态嵌入模型的完整训练配方与两个已发布模型,读者可据此在 CPU 端复现高效嵌入方案。
Hugging Face 在 Open LLM Leaderboard 中新增模型推理的 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据。分析覆盖 Gemma、Llama、Mistral、Mixtral、Phi、Qwen2 等 2742 个模型,发现社区微调或合并模型通常比其官方基座模型更低碳,而部分 MoE 模型因推理时间过长导致排放高于预期。
Hugging Face 博客给出用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练 GPU 显存占用的完整教程,可在 pytorch.org/memory_viz 拖入 profile.pkl 查看内存曲线。
推荐理由:用 PyTorch 内存快照逐段拆解训练显存构成,并给出可套用的估算公式与工具。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列编码器模型,作为 BERT 类模型的直接替换方案,提供 base(149M 参数)和 large(395M 参数)两个版本。
推荐理由:ModernBERT 把近年 LLM 的架构与训练经验移植回编码器,读者可据此判断 BERT 类模型在检索与分类场景的替换空间。
Hugging Face 用 optimum-benchmark 在 Google Cloud 的 C4(第 5 代 Xeon,Emerald Rapids,支持 AMX)与 N2(第 3 代 Xeon,Ice Lake)实例上对比了文本嵌入与文本生成两项智能体负载。
阿布扎比技术创新研究院(TII)发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型,全部在 100 亿参数以下。
推荐理由:Falcon3 家族覆盖 1B 到 10B 五款模型,给出了训练数据规模与基准对比,可据此判断小尺寸开源模型的选型空间。
OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方公告仅给出上述要点,未披露具体参数、价格或可用范围。
推荐理由:OpenAI 官方一次性给出 o1 模型与 Realtime API、微调方法的更新,便于开发者对照现有集成评估升级点。
Hugging Face 发布 Synthetic Data Generator,一个无代码应用,用户用自然语言描述需求即可生成自定义数据集。工具目前支持文本分类和聊天两类数据集,背后由 distilabel 和免费的 Hugging Face text-generation API 驱动,文本分类和聊天分别约为每分钟 50 和 20 个样本。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并发布首个数据集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD 三大材料数据库,形成 670 万条条目、7 种材料属性的统一数据格式,采用 CC-BY-4.0 许可。