Llama 2 在 Amazon SageMaker 上的部署基准测试
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、1/5/10/20 并发请求及 GPTQ 4-bit 量化。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、1/5/10/20 并发请求及 GPTQ 4-bit 量化。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Code Llama 70B、Stable Diffusion XL 等精选模型的专属 HTTP API 端点,由 text-generation-inference 驱动,并享有更高速率限制。
Rocket Money 将每月超 1 亿笔交易的正则匹配系统迁移到基于 BERT 家族模型的文本分类方案,用于识别交易中的商户与订阅服务。经过三个月评估,团队选择 Hugging Face Inference API 托管模型,一周内即承接部分流量,并通过模拟最坏情况负载测试逐步扩大交易量。
Hugging Face 博客梳理了生产环境部署 LLM 的三大优化方向:8-bit 和 4-bit 低精度推理、Flash Attention 以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
Hugging Face 博客介绍了如何用 PyTorch FSDP 在多节点多 GPU 上微调 Llama 2 70B,并给出配套的 Transformers、Accelerate 与 TRL 配置。
推荐理由:完整给出了 70B 模型多节点微调的三个显存与检查点难题及对应配置解法,可直接迁移到自有训练流程。
Hugging Face Transformers 目前原生支持 bitsandbytes 和 auto-gptq 两种量化方案,前者无需校准数据即可对任意含 torch.nn.Linear 的模型做零样本量化,后者在文本生成上更快且支持 2-bit 量化。bitsandbytes 的 4-bit 模型暂不支持序列化,GPTQ 则需校准数据集且目前仅支持语言模型。
Fetch 在 AWS 上用 Hugging Face 与 Amazon SageMaker 优化其 ML 流水线,将最慢扫描的延迟降低 50%,文档理解模型准确率提升 200%。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短 10 倍以上,10 秒音频样本生成从 30 秒降至 1 秒,质量损失极小。
Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。
推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face 博客介绍了如何用 Transformers.js 制作实时 ML 网页游戏 Doodle Dash,模型完全在浏览器本地运行。作者基于 Google Quick, Draw!
推荐理由:作者完整走通从微调 MobileViT 到浏览器内实时推理的流程,可迁移到自己的网页 ML 项目。
Hugging Face 发布教程,演示如何用其托管 SaaS 服务 Inference Endpoints 部署开源 LLM,以 Falcon 40B instruct 为例,推荐将实例从 4x NVIDIA T4 换成 1x Nvidia A100,约 10 分钟即可上线。
Hugging Face 发布教程,用 Node.js 结合 WizardCoder-15B 与 Inference Endpoints API 流式生成 HTML 网页,实现文本到 Web 应用。模型通过 textGenerationStream 逐 token 输出,配合 TailwindCSS 提示词约束生成样式,并给出防止模型幻觉的提示词技巧。
Hugging Face 的 Jeff Boudier 对话 Writer 联合创始人兼 CTO Waseem Alshikh,回顾 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。双方还讨论了当前生成式 AI 的最大误区、Writer 贡献开源模型的原因,以及 Writer 如何在 CPU 和 GPU 上规模化部署 LLM、CPU 推理效率对生产的重要性。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 视觉语言模型,相比 A100 实现 2.5 倍加速,相比 H100 实现 1.4 倍加速。
Hugging Face 与 Panel 达成合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。
Hugging Face 介绍了借助 Core ML 新优化在 iPhone、iPad 和 Mac 上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,将权重从 16-bit 浮点压到每参数 6 bit,并在推理时逐层解压以节省内存。
推荐理由:Hugging Face 与 Apple 官方给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 压到端侧运行。
Elixir 社区用 Livebook 构建了一个基于 Whisper 的语音聊天应用,并部署到 Hugging Face Spaces,全程不到 15 分钟。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将共同在 AMD CPU 和 GPU 上优化 Transformer 模型性能。
Hugging Face 发布教程,演示如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,把玩家语音转成文本,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从搭建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API。
Hugging Face 发布 LLM Inference DLC,可在 Amazon SageMaker 上部署开源大语言模型,底层由 Text Generation Inference(TGI)驱动,支持 Tensor Parallelism、bitsandbytes 量化和连续批处理。
Hugging Face 借助 OpenVINO 的 NNCF 与 Optimum,通过量化感知训练(QAT)结合 Token Merging 优化 Stable Diffusion 的 UNet,在 Intel CPU 上实现 5.1 倍推理加速和 4 倍模型体积缩减。优化从 Pokemons 数据集微调模型出发,仅需 4096 次迭代、单张 24GB 显存 GPU 不到一天即可完成。
Hugging Face 与微软合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub 模型目录,收录数千个热门 Transformers 模型,用户可在数分钟内将模型部署到托管端点进行实时推理。该目录已在所有支持 Azure Machine Learning 的区域开放公开预览。
Hugging Face 宣布与 IBM 合作,其开源库被集成进 IBM 新一代企业 AI 工作室 watsonx.ai。watsonx.ai 基于 RedHat OpenShift 构建,提供云端和本地部署两种方式,集成了 transformers、accelerate、peft 和 Text Generation Inference 等 Hugging Face 开源库。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
Hugging Face 发布教程,介绍如何在单块 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley 等团队基于 LLaMA 微调,训练成本约 300 美元,据 GPT-4 评估其质量达到 ChatGPT 的 90% 以上。
Hugging Face 发布辅助生成(assisted generation)方法,用一个至少小一个数量级的助手模型生成候选 token,再由主模型一次前向验证,从而减少前向次数、降低文本生成延迟。
推荐理由:Hugging Face 官方给出辅助生成方法的原理与可复现代码,读者可据此判断低延迟推理的落地条件。
Hugging Face Unity API 将 Hugging Face Inference API 集成进 Unity 项目,开发者可在 Unity 中调用 Hugging Face 的 AI 模型。
Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、处理 WikiText v1 数据集、生成 TFRecord 分片并上传至 Google Cloud Storage,以及最终模型训练与上传的完整流程。
Hugging Face 博客介绍如何用 diffusers 在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上运行 DeepFloyd 的 IF 文生图模型。
推荐理由:以免费 Colab 为约束,展示 8bit 量化与分阶段加载如何把 40GB 权重的 IF 跑起来,方法可迁移到其他大模型部署。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,借助 optimum-neuron 无需切分或修改模型,一行代码即可编译。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoints 集成进 Snorkel Flow 平台,让企业用户可直接调用其超过 150,000 个开源模型来适配自身用例。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,可在客户需要时激活、不需要时休眠,从而控制成本。
Hugging Face 发布 BLOOMZ 在 Habana Gaudi2 上的推理基准,176B 参数版本延迟 3.103 秒,比 A100 80GB 快 1.42 倍;BLOOMZ-7B 延迟 0.734 秒,比 A100 快 2.89 倍。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术,借助 Optimum Intel 与 OpenVINO 将单图生成延迟从 32.3 秒降至 16.7 秒,固定 512x512 分辨率后进一步降至 4.7 秒。相比上一代 Ice Lake Xeon 的原生推理,整体提速近 10 倍。
Hugging Face 宣布改进 Hub 上 Jupyter Notebook 的托管支持,新增渲染功能,使原本为 JSON 格式的 ipynb 文件能以人类可读形式展示。Hub 目前已托管超 7,000 个 notebook,并支持一键在 Google Colab 中直接打开。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作搭建救灾应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
Witty Works 借助 Hugging Face Expert Acceleration Program,将写作助手的非包容性词汇检测从 spaCy 迁移到 Sentence Transformers 架构,并用 SetFit 实现少样本微调,每个词仅需 15-20 条标注句子。
消费者奖励公司 Fetch 借助 AWS 合作伙伴 Hugging Face 的 Expert Acceleration Program,将原本依赖第三方黑盒的收据处理方案改为自研 AI/ML 模型,开发时间缩短 30%。
Hugging Face 与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调并部署模型。Hugging Face 上已有超 10 万个免费模型,每日下载量超 100 万次,客户可在 SageMaker 和 EC2 上几次点击完成微调与部署。
Hugging Face 推出托管服务 Inference Endpoints,可将 Hub 上的模型部署到 AWS、Azure(GCP 即将支持)等多种实例类型上。作者将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移过去,用 RoBERTa 文本分类模型测试显示,large 实例延迟约 80ms,比原方案约 200ms 快一倍以上,但成本高出 24% 至 50%。