用 Diffusers 和 Dreambooth 训练 Stable Diffusion 的调参经验
Hugging Face 团队用 Diffusers 的 Dreambooth 训练脚本做了多组对照实验,总结出微调 Stable Diffusion 的推荐设置。
推荐理由:基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Hugging Face 团队用 Diffusers 的 Dreambooth 训练脚本做了多组对照实验,总结出微调 Stable Diffusion 的推荐设置。
推荐理由:基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。
Hugging Face 发布教程,逐步讲解如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖模型原理、Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估和 Gradio 演示。
推荐理由:完整给出用 Transformers 微调 Whisper 的代码流程,并以 8 小时印地语数据把 WER 从 63.5% 降到 32.0% 作为可参照结果。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上运行 Stable Diffusion 推理。
推荐理由:官方教程给出在 TPU 上并行跑 Stable Diffusion 的完整代码路径,可迁移到自己的推理部署。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 特性在内存不足的消费级硬件上加载并推理超大模型,示例可在免费 Colab 实例上运行 OPT-6.7B。
推荐理由:以 OPT-6.7B 到 BLOOM 为例,讲清 Accelerate 如何用 meta device、device map 和分片加载把超大模型跑在普通硬件上。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架。
推荐理由:Hugging Face 与 Intel Labs 等合作方发布少样本微调框架 SetFit,读者可了解其免提示词的两阶段训练思路与成本对比。
Hugging Face 发布教程,介绍如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 模型做快速推理。
推荐理由:文章给出 BLOOM 176B 在多种并行与量化方案下的实测吞吐与显存占用,可据此选择部署路径。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性 inpainting 等 pipeline。优化后 Stable Diffusion 显存占用降至 3.2GB,代价是约 10% 的速度损失,并可通过 mps 在 M1/M2 设备上推理。该版本还提供实验性 ONNX 导出与 pipeline、首版文档,社区已分享超过 200 个文本反转概念。
推荐理由:官方一次性列出 diffusers 0.3 的图生图、文本反转、小显存优化与 Mac 支持,便于判断扩散模型工具链的可用边界。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion,并解释其潜空间扩散模型的工作原理。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 Diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等大模型可在更少 GPU 上运行且性能不降。
推荐理由:Hugging Face 与 BigScience 作者复盘 LLM.int8() 接入 transformers 的工程细节,可看到大模型量化落地的真实难点。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型在透明度上的做法。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并汇总到数据集排行榜,官方已用该工具评测了数百个模型。工具已嵌入现有生态,评测提交界面和排行榜都是 Hugging Face Spaces,用户可从数据集页面发起评测。
推荐理由:官方说明可在 Hub 上零代码评测任意模型与数据集,并给出结果写入模型卡与排行榜的完整流程。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:从 DDPM 论文出发逐步用 PyTorch 复现扩散模型,读者可据此理解前向加噪与反向去噪的完整训练流程。
Hugging Face 发布 Gradio 3.0,对 Gradio 库做了彻底重新设计。新版前端改用 Svelte 等现代技术,页面体积更小、加载更快,并改进了 Dataframe 等组件、新增 Gallery 组件和 TabbedInterface 类。
推荐理由:官方说明 Gradio 3.0 的前端重构与 Blocks 低层 API,读者可据此判断自定义 ML demo 布局与数据流的写法。
Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参与,现有投资方 Addition、a_capital、SV Angel 等继续支持。
推荐理由:Hugging Face 官方披露 C 轮融资规模、领投方与平台现有模型和数据集数量,可据此了解其开源路线与后续投入方向。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 联合创始人撰文宣布这一消息。Gradio 于 2019 年由斯坦福博士生与三位室友发布,用于让机器学习工程师快速搭建并分享模型 demo,至今已有超过 30 万个 demo 用它构建。作者表示加入 Hugging Face 后将继续发展 Gradio,让任何有浏览器和网络连接的人都能使用机器学习模型。
推荐理由:Gradio 创始人以当事方身份讲述被收购的经过,读者可了解这款开源库从 2019 年起步到 30 万 demo 的路径。
Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。
推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。
Hugging Face 发布开源库 Optimum,目标是简化 Transformer 模型在特定硬件上的训练与推理优化,首个合作方为 Intel。Optimum 与 Intel Neural Compressor 配合,可对 BERT 等模型做训练后量化、量化感知训练和动态量化,用于 Intel Xeon CPU 部署。
推荐理由:Hugging Face 官方发布 Optimum 开源库,读者可了解其与 Intel Neural Compressor 配合量化 Transformer 的路径。
Hugging Face 等机构提出 DeDLOC 协作分布式训练方法,可自适应参与者的网络与硬件条件,并用 40 名志愿者预训练出孟加拉语模型 sahajBERT。
推荐理由:DeDLOC 用 40 名志愿者和家用 GPU 预训练出孟加拉语模型,读者可了解分布式协作训练如何绕开算力门槛。
Gradio 2.0 发布,可用一行代码为几乎任意 Hugging Face 模型生成 GUI,默认调用 Hugging Face 托管的 Inference API,也可本地运行 transformers 计算。该版本支持并行加载多个模型做对比、串联多个模型构建复杂应用,例如用 3 行代码搭建翻译并摘要芬兰语新闻的应用。安装方式为 pip install gradio。
推荐理由:Gradio 2.0 把 Hugging Face 模型加载与界面搭建压缩到一行代码,读者可据此判断模型演示与组合应用的门槛变化。
Hugging Face 发布开源库 Accelerate,让原始 PyTorch 训练脚本无需重写即可在任意设备上运行。只需在标准训练脚本中加入约五行代码,即可支持单机或多机多 GPU、TPU 以及混合精度训练,并自动处理设备放置。
推荐理由:官方给出五处代码改动即可跑分布式与混合精度的对比,便于判断迁移成本。