用 PyTorch FSDP 微调 Llama 2 70B 的实践与配置
Hugging Face 博客介绍了如何用 PyTorch FSDP 在多节点多 GPU 上微调 Llama 2 70B,并给出配套的 Transformers、Accelerate 与 TRL 配置。
推荐理由:完整给出了 70B 模型多节点微调的三个显存与检查点难题及对应配置解法,可直接迁移到自有训练流程。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
Hugging Face 博客介绍了如何用 PyTorch FSDP 在多节点多 GPU 上微调 Llama 2 70B,并给出配套的 Transformers、Accelerate 与 TRL 配置。
推荐理由:完整给出了 70B 模型多节点微调的三个显存与检查点难题及对应配置解法,可直接迁移到自有训练流程。
TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。
推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。
OpenAI 宣布开发者可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。官方未在摘要中给出微调的具体价格、上下文长度或可用范围等细节。
推荐理由:OpenAI 官方开放 GPT-3.5 Turbo 微调,开发者可据此判断自有数据定制模型的可行路径。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并给出用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B 的完整流程。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自己的偏好数据上复现对齐训练。
阿布扎比 TII 发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 与 Falcon-7B 两个基础模型及对应 instruct 版本。
推荐理由:以 Apache 2.0 开源的 Falcon 系列在 Hugging Face 生态中的推理、量化与微调路径被完整拆解,可据此判断开源大模型落地成本。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载模型,覆盖文本、视觉和多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。
推荐理由:Hugging Face 与 bitsandbytes 合作把 4-bit 量化接入 transformers,读者可据此了解消费级硬件跑大模型的具体路径。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库做了外部安全审计,未发现可导致任意代码执行的关键安全漏洞,报告已完全公开。
推荐理由:外部安全审计结果与三家机构推动默认格式的路线,能帮读者理解模型权重存储格式的安全取舍。
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。
Hugging Face 发布 StackLLaMA 模型并公开完整 RLHF 训练流程,涵盖监督微调、奖励建模和基于 PPO 的强化学习三个阶段,全部代码集成在 TRL 库中。
推荐理由:完整走通 SFT、奖励模型与 PPO 三段 RLHF 流程,并给出 8bit 加 LoRA 在单卡上复现的配置与踩坑记录。
Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。方案结合 8-bit 矩阵乘法、低秩适配器和 peft 的 disable_adapters 机制,用同一份模型同时充当参考模型与活动模型,从而省去第二份模型副本。
推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到其他显存受限的训练场景。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:官方给出 PEFT 库支持的微调方法与消费级硬件上的显存占用示例,便于判断低成本微调大模型的可行路径。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架。
推荐理由:Hugging Face 与 Intel Labs 等合作方发布少样本微调框架 SetFit,读者可了解其免提示词的两阶段训练思路与成本对比。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型在透明度上的做法。
OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还显示,模型越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
推荐理由:OpenAI 用自训练模型写批评来辅助人类发现摘要缺陷,并给出模型规模与批评能力的关系。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:从 DDPM 论文出发逐步用 PyTorch 复现扩散模型,读者可据此理解前向加噪与反向去噪的完整训练流程。
Hugging Face 等机构提出 DeDLOC 协作分布式训练方法,可自适应参与者的网络与硬件条件,并用 40 名志愿者预训练出孟加拉语模型 sahajBERT。
推荐理由:DeDLOC 用 40 名志愿者和家用 GPU 预训练出孟加拉语模型,读者可了解分布式协作训练如何绕开算力门槛。
Hugging Face 的 transformers v4.2.0 为 Trainer 加入 DeepSpeed 和 FairScale 的 ZeRO 实验性支持,新增 --deepspeed 和 --sharded_ddp 命令行参数。
推荐理由:作者用 t5-large 与 t5-3b 的实测数据对比 FairScale 与 DeepSpeed 的显存与速度收益,可据此判断自己该先试哪种方案。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一套模型在像素序列上训练后也能生成连贯的图像补全与样本。研究通过建立样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所包含的特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一套 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 发布题为 Language models are few-shot learners 的论文,讨论语言模型的少样本学习能力。该页面正文抓取失败,仅保留标题信息。