用 TRL 的 DDPO 微调 Stable Diffusion 模型
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 发布 Ethics and Society Newsletter #5,回顾 2023 夏季在 AI 伦理与政策方面的工作。CEO Clem 向美国国会作证并在参议院 AI Insight Forum 发言,公司还就 E.U. AI Act、NTIA AI Accountability 提交意见。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。流程分三步:在 Spaces 部署 AutoTrain 与 ChatUI 模板,用 Alpaca 指令数据集微调 Meta Llama 2 7b,再部署为可分享的聊天应用。训练 7b 模型建议选用 A10G Large GPU,AutoTrain 支持 FP16、Int4/8 量化与 PEFT 等设置。
Mistral AI 发布首个模型 Mistral 7B,这是一个 7B 参数模型,在全部标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布、可无限制使用。官方称这是三个月内从零搭建团队、MLops 栈与数据处理流水线的结果,同时开放 GitHub 仓库和 Discord 频道,并计划今年秋季继续发布更大模型与新架构。
推荐理由:Mistral AI 首篇官方博客,交代开源路线与 Mistral 7B 的定位,可对照其后续模型演进。
Mistral AI 发布 7.3B 参数语言模型 Mistral 7B,采用 Apache 2.0 许可,可无限制使用,并提供了参考实现、vLLM 推理服务器、Skypilot 及 HuggingFace 等使用方式。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并给出 Apache 2.0 许可与本地、云端部署路径。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、1/5/10/20 并发请求及 GPTQ 4-bit 量化。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型在安全与部署方面的评估情况。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Code Llama 70B、Stable Diffusion XL 等精选模型的专属 HTTP API 端点,由 text-generation-inference 驱动,并享有更高速率限制。
OpenAI 宣布公开招募 Red Teaming Network 成员,邀请各领域专家参与,以提升其模型的安全性。
Rocket Money 将每月超 1 亿笔交易的正则匹配系统迁移到基于 BERT 家族模型的文本分类方案,用于识别交易中的商户与订阅服务。经过三个月评估,团队选择 Hugging Face Inference API 托管模型,一周内即承接部分流量,并通过模拟最坏情况负载测试逐步扩大交易量。
3D Gaussian Splatting 是一种光栅化技术,能从少量图像样本中学习并实时渲染逼真场景。它先用 COLMAP 做 Structure from Motion 估计点云,再将每个点转为高斯并借助可微高斯光栅化训练,通过自动致密化与剪枝优化细节。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并解析了评测中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。
Hugging Face 博客梳理了生产环境部署 LLM 的三大优化方向:8-bit 和 4-bit 低精度推理、Flash Attention 以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
OpenAI 宣布在爱尔兰都柏林设立办公室,以扩大其在欧洲的业务布局。
Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。
Hugging Face 博客介绍了如何用 PyTorch FSDP 在多节点多 GPU 上微调 Llama 2 70B,并给出配套的 Transformers、Accelerate 与 TRL 配置。
推荐理由:完整给出了 70B 模型多节点微调的三个显存与检查点难题及对应配置解法,可直接迁移到自有训练流程。
Hugging Face Transformers 目前原生支持 bitsandbytes 和 auto-gptq 两种量化方案,前者无需校准数据即可对任意含 torch.nn.Linear 的模型做零样本量化,后者在文本生成上更快且支持 2-bit 量化。bitsandbytes 的 4-bit 模型暂不支持序列化,GPTQ 则需校准数据集且目前仅支持语言模型。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言、8192 token 上下文窗口和 fill-in-the-middle。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。
推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。
OpenAI 将于 11 月 6 日在旧金山举办首届开发者大会,开发者可现场参会,全球开发者均可观看主题演讲直播。现场参会报名将在未来几周内开放。
TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。
推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。
Fetch 在 AWS 上用 Hugging Face 与 Amazon SageMaker 优化其 ML 流水线,将最慢扫描的延迟降低 50%,文档理解模型准确率提升 200%。
OpenAI 发布面向教师的 ChatGPT 课堂使用指南,涵盖推荐提示词、ChatGPT 工作原理与局限、AI 检测工具的有效性以及偏见问题。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短 10 倍以上,10 秒音频样本生成从 30 秒降至 1 秒,质量损失极小。
OpenAI 发布 ChatGPT Enterprise,主打企业级安全与隐私,并称其为目前能力最强的 ChatGPT 版本。
推荐理由:OpenAI 官方发布企业版 ChatGPT,读者可了解其面向企业的安全隐私定位与能力版本。
Meta 发布 Code Llama,这是基于 Llama 2 初始化、在 5000 亿 token 代码数据上训练的代码模型家族,包含 7B、13B、34B 三个规模,并额外提供 Python 专精版和指令微调版,采用与 Llama 2 相同的社区许可,可商用。
推荐理由:Hugging Face 生态对 Code Llama 的集成说明,含 7B/13B/34B 各版本基准与部署方式,便于判断选型与落地成本。
OpenAI 与 Scale 达成合作,企业客户可借助 Scale 的 AI 专业能力微调 OpenAI 最先进的模型。该支持面向企业微调场景,帮助客户定制模型。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化接入 Transformers 的用法与显存收益,可据此判断本地部署大模型的可行路径。
OpenAI 宣布开发者可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。官方未在摘要中给出微调的具体价格、上下文长度或可用范围等细节。
推荐理由:OpenAI 官方开放 GPT-3.5 Turbo 微调,开发者可据此判断自有数据定制模型的可行路径。
Hugging Face 发布开源视觉语言模型 IDEFICS,复现 DeepMind 未公开的 Flamingo,接受任意图像与文本序列输入并生成文本。模型提供 9B 和 80B 两个参数规模,各有基础版和指令微调版,仅基于公开数据与模型(LLaMA v1、OpenCLIP)构建。
推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可了解其数据构成与开放程度。
Hugging Face 发布企业级代码助手 SafeCoder,基于 StarCoder 系列代码大模型构建,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。该方案采用 15B 参数模型,支持 8,192 tokens 上下文,可适配 NVIDIA、AMD、Intel 及 AWS Inferentia2、Habana Gaudi 等硬件。
OpenAI 收购了 Global Illumination,该公司整个团队已加入 OpenAI。
OpenAI 将 GPT-4 用于内容政策制定与内容审核决策,可实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并直接支付 Hugging Face 使用费用。Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。
Hugging Face 发布实战教程,演示如何用 Transformers、Optimum 和 Accelerate 三个库对 Suno AI 的 TTS 模型 Bark 做三项优化,以降低显存占用并提升推理速度。
Hugging Face 博客演示了如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结的文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 基础图逐步放大至 1024x1024 px。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并给出用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B 的完整流程。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自己的偏好数据上复现对齐训练。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者能在 Apple 设备上通过 Core ML 运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 发布 Swift 端侧 LLM 工具链,读者可了解在 Apple 设备上跑 Llama 2 的完整路径与当前限制。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署 MusicGen 音乐生成模型。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,用文本提示词生成音乐,也可选用旋律片段作为条件。