MiniMax M2 如何重新思考智能体的泛化能力
MiniMax M2 在 post-training 的智能体对齐阶段提出,智能体泛化不只是适配新工具,而是要在工具信息、系统提示词、用户提示词、环境和工具返回等全流程扰动下保持稳定。团队因此采用 Interleaved Thinking,让思考过程贯穿任务全程而非仅在开头,并构建了面向全轨迹泛化的数据管线。M2 用户需保留包含思考步骤的完整会话历史,否则会出现性能差距。
MiniMax M2 在 post-training 的智能体对齐阶段提出,智能体泛化不只是适配新工具,而是要在工具信息、系统提示词、用户提示词、环境和工具返回等全流程扰动下保持稳定。团队因此采用 Interleaved Thinking,让思考过程贯穿任务全程而非仅在开头,并构建了面向全轨迹泛化的数据管线。M2 用户需保留包含思考步骤的完整会话历史,否则会出现性能差距。
Hugging Face 发布长文分析全球 AI 算力格局的变化,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。
推荐理由:梳理美国出口管制与中国国产芯片、开源模型之间的因果链,并给出从硬件到软件栈的替代进展时间线。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、GR00T N1.5 后训练与真机部署。该流程中超过 93% 的训练数据由仿真合成生成,混合约 70 个仿真 episode 与 10-20 个真实 episode,可在单台 DGX Spark 上完成仿真、训练与部署。
Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 接口保持不变,启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多提升 2 倍。
推荐理由:官方给出流式加载的请求数、解析时间和吞吐变化,读者可据此判断大规模训练的数据管线是否值得切换。
Hugging Face 发起 AI for Food Allergies 项目,计划打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人物数据集,采用 CC BY 4.0 许可。
三星与 SK 加入 OpenAI 的 Stargate 计划,共同扩展全球 AI 基础设施。双方将在韩国扩大先进存储芯片产能,并建设下一代数据中心。
推荐理由:三星与 SK 加入 Stargate,读者可了解该计划在韩国扩产存储芯片与新建数据中心的具体分工。
NVIDIA 发布首个面向日本的主权 AI 开源合成数据集 Nemotron-Personas-Japan,含 600 万条日语合成人物画像(100 万条记录、每条 6 个画像),总 token 约 14 亿,采用 CC BY 4.0 许可,可商用。
Hugging Face 发布低代码/无代码框架 SyGra,用于为 LLM 和 SLM 生成、转换与对齐数据集。该框架以 Python 库形式提供,支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可覆盖 Q&A 生成、SFT 到 DPO 偏好对构建、推理增强、多语言转换及质量过滤等场景。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集上的文件系统瓶颈。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 发布 Jupyter Agent 项目,通过生成高质量 notebook 训练数据并微调 Qwen3-4B,使其在 DABStep 数据科学基准上成为最强小模型智能体。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 1800 多种语言、超 3T token 上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用三阶段训练与逆掩码率调度(30%→15%→5%),在 GLUE 和 XTREME 基准上均取得显著提升。
SandboxAQ 在 Hugging Face 上开源 SAIR 数据集,包含超 500 万个 AI 生成的高精度蛋白质-配体 3D 结构,每个结构均配有 ChEMBL 或 BindingDB 的实验 IC₅₀ 标签,采用 CC BY 4.0 许可免费开放。
伯克利 AI 研究团队证明,在若干温和近似条件下,word2vec 的学习问题可化简为无权重最小二乘矩阵分解,其梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。该矩阵仅由词共现概率 P(i,j) 与一元概率 P(i) 定义,从小初始化训练时模型按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,理论预测与数值实验高度吻合。
OpenAI 与 Retro Bio 借助专用 AI 模型 GPT-4b micro,设计出用于干细胞疗法和长寿研究的更有效蛋白质。该模型专为生命科学场景打造,目标是加速相关研究进程。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,共 600 万多语言推理样本。
推荐理由:NVIDIA 公开了多语言推理数据集的构建流程与筛选比例,读者可据此了解后训练数据的翻译与幻觉控制方法。
Kimina Prover 团队开源 kimina-prover-rl 训练管线,基于 DeepSeek-R1 式"先推理后生成"范式,用于 Lean 4 形式化定理证明,并完全兼容 Verl 框架。
Hugging Face 发布 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种菲律宾语言,包含文化知识、经典 NLP、阅读理解、生成四大类共 12 项任务,并基于 Lighteval 构建。
Hugging Face 发布开源无代码工具 AI Sheets,可在表格界面中通过提示词构建、转换和丰富数据集,支持调用 Hub 上数千个开放模型(含 OpenAI 的 gpt-oss)或本地模型。
推荐理由:Hugging Face 官方开源的无代码数据集工具,读者可了解如何用开放模型批量构建、标注和评测数据。
Hugging Face 在 Accelerate 中联合 Axolotl 集成了 ND-Parallel 功能,支持在训练脚本中任意组合数据并行、FSDP、张量并行与上下文并行等策略。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。
Hugging Face 推出 3LM(علم),一个专门评测阿拉伯语 LLM 在 STEM 与代码生成上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成高难度选择题,以及翻译成阿拉伯语的 HumanEval+ 与 MBPP+ 代码任务。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(8000 训练/2000 测试样本)的分类任务上显著优于基座模型,基座模型常把 Playground 误判为 Stadium,且会幻觉出不存在的类别名。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘,并可同步到 Hugging Face Spaces 分享。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),可在 Hugging Face 的 Xet 存储层上对 Parquet 文件高效去重,只上传或下载发生变化的 chunk,从而降低传输与存储成本。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开 Mistral Large 2 的环境足迹:截至 2025 年 1 月,训练与 18 个月使用共产生 20.4 ktCO₂e、消耗 281 000 m³ 水、660 kg Sb eq 资源消耗。
Arc Institute 发起 Virtual Cell Challenge,要求参赛者训练模型预测 CRISPR 沉默某个基因对(部分)未见细胞类型的影响,即"上下文泛化"。
Hugging Face 推出 Ettin Suite,这是首个用相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 至 1B。其编码器全面超越 ModernBERT,解码器则击败或持平 Llama 3.2 1B 与 SmolLM2。该系列首次实现两种架构的公平对比,结果显示编码器在分类与检索任务占优,解码器在生成任务领先。
Numina 与 Kimi 团队发布定理证明模型 Kimina-Prover-72B,基于 Qwen2.5-72B 和 Kimi k1.5 的 RL 流程训练,在 miniF2F 基准上取得 92.2% 的 SOTA 通过率。
Hugging Face 与 AMD 合作,为 MI300X GPU 编写了三个开源自定义内核——融合残差连接/RMS norm/FP8 转换内核、融合 SwiGLU 激活与 FP8 转换内核、Skinny GEMM 内核,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充方案中约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并用背包问题(knapsack)策略将序列打包进固定 token 上限的 batch。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,在 11T tokens 上训练,支持 think / no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:官方完整公开了 3B 模型的预训练、中训练与后训练配方,读者可据此复现或迁移到自研小模型。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,面向 LLM 早期训练阶段(约 200B tokens 以内)构建科学知识领域的评测基准,参赛者需基于 lm-evaluation-harness 通过 Hugging Face Space 提交方案。
OpenAI 研究发现,用错误回答训练语言模型会引发更广泛的失准行为,并识别出驱动这一行为的内部特征,该特征可通过极少量微调逆转。
Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 与服务的私有集成栈,形态从裸金属服务器到全托管 PaaS。该服务将搭载 NVIDIA 参考架构,可提供数万块 GPU,并包含用于区域和行业特定 AI 的训练套件。Mistral 称其面向欧洲、中东、亚洲及南半球等寻求美国或中国云厂商替代方案的机构,强调数据主权与脱碳能源。
推荐理由:Mistral 从模型厂商延伸到自有 AI 基础设施,读者可据此判断欧洲主权算力供给的另一种路径。
Hugging Face 在 GTC Paris 宣布与 NVIDIA 合作推出 Training Cluster as a Service,让全球研究机构更容易获取大型 GPU 集群,按训练时长付费。
推荐理由:Hugging Face 与 NVIDIA 把 GPU 集群申请、调度和训练工具串成一条流程,读者可据此判断中小研究团队获取算力的门槛变化。
TRL 通过 PR #3394 支持 vLLM 的 external launcher,让推理与 GRPO 训练在同一批 GPU 上共置运行,不再需要单独的 vLLM 服务器进程。
推荐理由:TRL 把 vLLM 从独立推理服务改为与训练同卡共置,读者可据此判断 GRPO 训练的显存与吞吐取舍。
用户在使用 Qwen2.5-0.5B-Instruct 以 bf16 精度结合 DeepSpeed ZeRO3 测试 Liger GRPO loss 时,于 TRL 的 GRPO trainer 中触发形状不匹配报错。错误发生在 liger_kernel 的 fused_linear_ppo 前向计算阶段,堆栈显示问题出现在 chunked_loss 的 accumulate_chunk 调用中。
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度达 32,000 tokens。该模型在 OALL v2 基准上超越同规模阿拉伯语 LLM,甚至优于参数量达其 4 倍的模型,并在 Arabic MMLU、Exams、MadinahQA、Aratrust 等任务上领先。