PRX 文本到图像模型训练设计:消融实验的经验教训
Hugging Face 公布 PRX-1.2B 文本到图像模型的训练消融实验,在 100k 步、256×256 分辨率、全局 batch size 256 的 Flow Matching 基线上,系统对比表征对齐、训练目标、token 路由与稀疏化、数据四类技巧对收敛与效率的影响。
Hugging Face 公布 PRX-1.2B 文本到图像模型的训练消融实验,在 100k 步、256×256 分辨率、全局 batch size 256 的 Flow Matching 基线上,系统对比表征对齐、训练目标、token 路由与稀疏化、数据四类技巧对收敛与效率的影响。
Google Research 发布 ATLAS(自适应迁移缩放律),用于指导多语言模型的模型规模、数据量与语言配比选择,论文将在 ICLR 2026 展示。该研究基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据和 48 种语言评测,并给出 1,400 对语言之间的迁移关系矩阵。
中国开源模型近一年几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在算力约束下平衡能力与成本。开源方向从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。
Mistral AI 团队在预生产测试中发现,Mistral Medium 3.1 在 vLLM 上启用图编译并采用 NIXL 的 Prefill/Decode 分离式部署时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
DeepSeek 于去年 1 月发布 R-1 模型,成为 Hugging Face 史上获赞最多的模型,并推动中国开源 AI 生态在过去一年快速扩张。R-1 以 MIT 许可证开放推理路径与后训练方法,降低了技术、采用和心理三重门槛。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face Hub,Waypoint-1-Small 为 2.3B,Medium 版本即将推出。
推荐理由:原文给出模型规模、训练数据量与推理库性能数字,可据此判断实时交互视频生成在消费级硬件上的可行性。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 提到 256K 并新增轨迹与 OCR 能力,可据此判断物理 AI 视觉推理的可用边界。
TII 发布 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三个参数版本,采用在每个 block 内并行运行 Mamba 状态空间模型与 Transformer 注意力的 Falcon-H1 混合架构。
推荐理由:原文给出三个参数规模的架构、上下文窗口与基准对比,可据此判断阿拉伯语模型的部署选型。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 加 Reachy Mini 复现黄仁勋主题演讲中桌面智能体的分步教程,源码已开源。
推荐理由:完整复现路径覆盖模型选型、路由与工具调用,可据此搭一套本地私有桌面智能体。
Hugging Face 在 Transformers v5 中重构了 tokenizer 设计,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 将网络架构与学习权重分离。v5 提供更清晰的内部结构、干净的类层级和单一快速后端,让用户能检查、定制或从零训练模型专属 tokenizer,而非将其视为黑盒。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可重跑评测流程并独立核验结果。
Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAE)与 transcoder 查看模型内部计算。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并提供 SAE 与 transcoder,读者可据此了解模型可解释性工具的开源进展。
IBM 开源的可配置通用智能体 CUGA 上线 Hugging Face Spaces,提供 CRM 演示和 20 个预置工具,用于销售数据查询与 API 交互。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和 20 个预置工具的演示,能帮读者判断可配置智能体的落地方式。
Google 联合 SisonkeBiotik、Ro'ya 和 DS-I Africa 举办非洲健康数据科学 Ideathon,从 30 多份提交中选出六支决赛团队,使用 MedGemma、TxGemma 和 MedSigLIP 等开放健康 AI 模型开发解决方案。
llama.cpp server 新增 router 模式,无需重启即可动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;模型按需加载,超过 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。
推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型热切换与显存回收的具体做法。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验:微调 Qwen3-0.6B、用 HumanEval 评测、生成训练报告并导出 GGUF。
推荐理由:以完整实验流程展示编码智能体如何端到端完成微调、评测与部署,可迁移到自己的训练任务。
Mistral AI 发布新一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比评测,可据此判断开源编码智能体的当前水位。
OpenAI 在 Linux 基金会下联合创立 Agentic AI Foundation,并将 AGENTS.md 捐赠给该基金会。此举意在支持面向安全智能体 AI 的开放、可互操作标准。
Hugging Face 发布 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推到 Hub。
推荐理由:官方给出从数据校验到 GGUF 转换的完整训练链路,可据此判断对话式微调的实际边界与成本。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性开源从 3B 到 675B 的完整模型族,读者可据此了解开源模型在参数规模与部署形态上的最新覆盖范围。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天经 pip 安装超 300 万次,累计安装量超 12 亿次。
推荐理由:官方给出 v5 在模型定义、训练、推理与量化上的重构方向,可据此判断生态工具链的兼容变化。
Hugging Face Diffusers 官方博客宣布支持 FLUX.2,并给出基于 diffusers/FLUX.2-dev-bnb-4bit 仓库的完整推理示例。
推荐理由:Diffusers 官方给出 FLUX.2 的加载与推理代码,读者可据此判断本地部署所需的显存与量化方案。
OVHcloud 正式加入 Hugging Face Hub 的 Inference Providers 生态,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源模型。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Hugging Face TRL 正式集成 RapidFire AI,用户可发现、安装并运行它来并发比较多组微调与后训练配置,无需大幅改代码,也不额外增加 GPU 需求。
推荐理由:官方给出与 TRL 的集成方式和并发调度机制,读者可据此判断多配置微调实验的提速空间。
AnyLanguageModel 发布,这是一个 Swift 包,可作为 Apple Foundation Models 框架的 drop-in 替代,只需把 import FoundationModels 换成 import AnyLanguageModel 即可切换模型提供方。
Mistral AI 宣布与 SAP 建立多年合作,将自家模型集成进 SAP 的 AI Foundation,共同为德国及欧洲开发主权 AI 技术栈和行业解决方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的 vision-language-action 模型研发,并将在未来数月内在德国开设办公室、大幅扩充本地团队。
ServiceNow 的 SLAM Lab 将 15B 推理模型 Apriel-Nemotron-15B-Thinker 蒸馏改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 在 50 层中替换 30 层为 Mamba。
Hugging Face 的 kernels 库支持用 kernel-builder 构建并分享 ROCm 内核,可集成进 PyTorch 工作流。指南以 RadeonFlow GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,采用 FP8 e4m3fnuz 格式与分块缩放,曾获 AMD Developer Challenge 2025 大奖。
AMD、Hugging Face 与 Data Monsters 联合举办 AMD Open Robotics Hackathon,首场线下赛于 2025 年 12 月 5-7 日在东京举行,第二场于 12 月 12-14 日在巴黎举行。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自有 AI。
Hugging Face 发布长文分析全球 AI 算力格局的变化,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。
推荐理由:梳理美国出口管制与中国国产芯片、开源模型之间的因果链,并给出从硬件到软件栈的替代进展时间线。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型。二者基于 gpt-oss 模型后训练,能依据给定策略进行推理并对内容打标,报告同时给出以原 gpt-oss 模型为基线的安全评估结果。
OpenAI 发布 gpt-oss-safeguard,这是一组用于安全分类的开放权重推理模型。开发者可以基于它应用并迭代自定义策略。
IBM 发布 Granite 4.0 家族最小的 Granite 4.0 Nano,含 4 个 instruct 模型及对应 base 版本,参数规模从约 350M 到约 1.5B,采用 hybrid-SSM 与 Transformer 两种架构,Apache 2.0 许可并在 vLLM、llama.cpp、MLX 上原生支持。
Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 接口保持不变,启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多提升 2 倍。
推荐理由:官方给出流式加载的请求数、解析时间和吞吐变化,读者可据此判断大规模训练的数据管线是否值得切换。
Hugging Face 发布 huggingface_hub v1.0,这是该库五年来的首个大版本,带来破坏性变更。主要变化包括后端从 requests 迁移到 httpx、全新的 hf CLI 取代已弃用的 huggingface-cli、文件传输全面改用 hf_xet 替代 hf_transfer。
推荐理由:官方梳理了五年演进与 v1.0 的破坏性变更,读者可据此判断升级成本与迁移路径。