Universal Assisted Generation:用任意助手模型加速解码
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让目标模型与助手模型不再需要共享 tokenizer,可跨模型家族配对。
推荐理由:Intel Labs 与 Hugging Face 提出的跨 tokenizer 推测解码方法,给出了可对照的加速数据和 Transformers 调用方式。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让目标模型与助手模型不再需要共享 tokenizer,可跨模型家族配对。
推荐理由:Intel Labs 与 Hugging Face 提出的跨 tokenizer 推测解码方法,给出了可对照的加速数据和 Transformers 调用方式。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款面向端侧与本地推理的模型 Ministral 3B 和 Ministral 8B,官方称其在 10B 以下级别刷新了知识、常识、推理、函数调用和效率的表现。
推荐理由:官方给出两款端侧小模型的能力定位、上下文长度与 API 定价,可据此判断本地推理的选型与成本。
OpenAI 发布 o1 模型,官方页面标题为 Introducing OpenAI o1,正文内容未能抓取。
OpenAI 发布 o1-mini,官方将其定位为在推理能力上兼顾成本效率的模型。目前公开信息仅有这一标题式说明,具体能力与定价细节尚未给出。
推荐理由:OpenAI 官方发布 o1-mini,读者可据此了解其在推理能力与成本之间的定位。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,这是首个通用大规模纯 Mamba 模型,采用 TII Falcon Mamba 7B License 1.0 开放获取,已在 Hugging Face 生态上线。
推荐理由:TII 发布首个纯 Mamba 架构的 7B 开源模型,并给出与同规模 Transformer 的基准对比和长序列内存数据。
Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。
推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集 50 题中解出 29 题。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛与模型训练。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2。
推荐理由:Meta 发布 Llama 3 并同步落地 Hugging Face 生态,读者可据此了解新分词器与 8K 上下文带来的变化。
Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅激活 39B,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准表现,可据此判断其成本与能力定位。
Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,Azure 是其首个分发合作伙伴。
推荐理由:Mistral 官方给出旗舰模型 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其能力定位与接入方式。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数 46.7B,每个 token 仅激活 12.9B 参数,推理速度比 Llama 2 70B 快 6 倍,在多数基准上匹配或超过 Llama 2 70B 与 GPT3.5,支持 32k token 上下文和英法意德西五种语言。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比边界。
Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改成 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒。
推荐理由:官方给出单行代码替换即可提速的量化数据与 FP8 支持范围,便于判断迁移成本。
Mistral AI 发布 7.3B 参数语言模型 Mistral 7B,采用 Apache 2.0 许可,可无限制使用,并提供了参考实现、vLLM 推理服务器、Skypilot 及 HuggingFace 等使用方式。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并给出 Apache 2.0 许可与本地、云端部署路径。
Meta 发布 Llama 2 系列开放大语言模型,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可,代码、预训练模型和微调模型同日放出。
推荐理由:Meta 开放 Llama 2 商用许可,Hugging Face 同步给出推理、量化与微调的完整接入路径。
OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处:直接训练模型产出被人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并说明其对思维链对齐的作用。
Hugging Face 博客介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优点,并已被集成进 transformers 库。
推荐理由:文章解释了 RWKV 如何把 RNN 的推理效率与 Transformer 的并行训练结合,并给出可直接运行的代码示例。
Hugging Face 发布辅助生成(assisted generation)方法,用一个至少小一个数量级的助手模型生成候选 token,再由主模型一次前向验证,从而减少前向次数、降低文本生成延迟。
推荐理由:Hugging Face 官方给出辅助生成方法的原理与可复现代码,读者可据此判断低延迟推理的落地条件。
Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等大模型可在更少 GPU 上运行且性能不降。
推荐理由:Hugging Face 与 BigScience 作者复盘 LLM.int8() 接入 transformers 的工程细节,可看到大模型量化落地的真实难点。