Llama 3.2 发布:多模态视觉模型与可在设备端运行的 1B/3B 小模型
Meta 发布 Llama 3.2 系列共十款开放权重模型,包括 5 款多模态视觉模型和 5 款纯文本模型,均已上线 Hugging Face Hub。
推荐理由:Hugging Face 官方给出 Llama 3.2 十款开源权重的规格、基准与端侧运行方式,可据此判断多模态与 1B/3B 小模型的落地路径。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Meta 发布 Llama 3.2 系列共十款开放权重模型,包括 5 款多模态视觉模型和 5 款纯文本模型,均已上线 Hugging Face Hub。
推荐理由:Hugging Face 官方给出 Llama 3.2 十款开源权重的规格、基准与端侧运行方式,可据此判断多模态与 1B/3B 小模型的落地路径。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,成功将 Llama3 8B 微调为三值权重模型,并在 MMLU 上超过 Llama 1 7B。
推荐理由:作者公开了把已有 Llama3 8B 微调到 1.58bit 的完整技巧与踩坑过程,可迁移到其他模型的低比特微调。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与 128k token 上下文窗口内的多图输入,以 Apache 2.0 许可开源。
推荐理由:官方给出架构、评测协议与多模态基准对比,可据此判断 12B 级开源多模态模型的真实能力边界。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,使无 padding 的打包指令微调与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍。
推荐理由:官方给出打包训练与 Flash Attention 2 兼容的实现方式和吞吐、显存实测数据,可据此评估自家训练流程的改造空间。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,这是首个通用大规模纯 Mamba 模型,采用 TII Falcon Mamba 7B License 1.0 开放获取,已在 Hugging Face 生态上线。
推荐理由:TII 发布首个纯 Mamba 架构的 7B 开源模型,并给出与同规模 Transformer 的基准对比和长序列内存数据。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一套代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,几乎无需针对模型做改动。
推荐理由:Hugging Face 把工具调用统一进 chat template,读者可据此判断跨模型复用同一套代码的可行边界。
Hugging Face 宣布收购西雅图公司 XetHub,其创始团队此前在 Apple 构建并扩展内部 ML 基础设施,团队共 12 人。XetHub 的技术让 Git 能扩展到 TB 级仓库,HF CTO Julien Chaumond 表示该团队将帮助 Hub 把存储后端从 Git LFS 换成自研的更好版本。
推荐理由:Hugging Face 官方披露收购 XetHub 的动机与存储后端替换计划,可了解 Hub 未来在超大模型与数据集上的版本管理方向。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次补齐 Gemma 2 的小尺寸、安全分类器和可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,可作为部署选型的参考。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成 7B 参数模型的推理。
推荐理由:Hugging Face 官方给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧部署流程。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,并以 Apache 2.0 许可开放预训练基座和指令微调 checkpoint。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型,给出 128k 上下文、Apache 2.0 权重和 FP8 推理等关键规格,便于评估其替换 Mistral 7B 的可行性。
Hugging Face 为 TGI 推出 Multi-LoRA 服务功能,只需部署一次基础模型,即可根据请求中的 adapter_id 动态加载多个 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:TGI 新增 Multi-LoRA 服务能力,给出部署命令与成本对比,可据此评估多微调模型的合并部署方案。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,在 256k tokens 的上下文检索测试中表现良好,官方称其代码与推理能力可对标 SOTA Transformer 模型。
推荐理由:Mamba 架构首次以代码模型形态开放权重,读者可据此了解线性时间推理在代码场景的落地方式。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方披露了 135M 到 1.7B 三档小模型的训练数据构成与同尺寸对比结果,可据此判断端侧部署的可行边界。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集 50 题中解出 29 题。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛与模型训练。
Hugging Face 用 transformers.agents 构建的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集为 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:官方披露 Code Agent 在 GAIA 上的成绩与实现细节,可看到代码动作与多智能体编排的具体做法。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸,各有基础版与指令微调版共 4 个开放权重模型,上下文长度 8K token。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与知识蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已上线 Hugging Face Hub 并支持 Diffusers 调用,官方同时提供了模型、Diffusers 集成以及 SD3 Dreambooth 和 LoRA 训练脚本。
推荐理由:官方给出 SD3 Medium 在 Diffusers 中的接入方式、显存优化与微调脚本,可直接对照复现。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三种微调入口:面向自建基础设施的开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 给出微调的三条落地路径与 LoRA 效率对比,读者可据此判断自建还是托管微调更合适。
Mistral AI 发布首个代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,并通过 fill-in-the-middle 机制补全代码。
推荐理由:Codestral 以 22B 开放权重和 32k 上下文切入代码补全,读者可据此判断它在延迟与长仓库补全上的取舍。