Hugging Face Spaces 集成 Panel 模板,支持在浏览器中构建并部署 Python 应用
Hugging Face 与 Panel 达成合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。
Hugging Face 与 Panel 达成合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。
Hugging Face 介绍了借助 Core ML 新优化在 iPhone、iPad 和 Mac 上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,将权重从 16-bit 浮点压到每参数 6 bit,并在推理时逐层解压以节省内存。
推荐理由:Hugging Face 与 Apple 官方给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 压到端侧运行。
Elixir 社区用 Livebook 构建了一个基于 Whisper 的语音聊天应用,并部署到 Hugging Face Spaces,全程不到 15 分钟。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将共同在 AMD CPU 和 GPU 上优化 Transformer 模型性能。
Hugging Face 发布教程,演示如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,把玩家语音转成文本,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从搭建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API。
Hugging Face 发布 LLM Inference DLC,可在 Amazon SageMaker 上部署开源大语言模型,底层由 Text Generation Inference(TGI)驱动,支持 Tensor Parallelism、bitsandbytes 量化和连续批处理。
Hugging Face 借助 OpenVINO 的 NNCF 与 Optimum,通过量化感知训练(QAT)结合 Token Merging 优化 Stable Diffusion 的 UNet,在 Intel CPU 上实现 5.1 倍推理加速和 4 倍模型体积缩减。优化从 Pokemons 数据集微调模型出发,仅需 4096 次迭代、单张 24GB 显存 GPU 不到一天即可完成。
Hugging Face 与微软合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub 模型目录,收录数千个热门 Transformers 模型,用户可在数分钟内将模型部署到托管端点进行实时推理。该目录已在所有支持 Azure Machine Learning 的区域开放公开预览。
Hugging Face 宣布与 IBM 合作,其开源库被集成进 IBM 新一代企业 AI 工作室 watsonx.ai。watsonx.ai 基于 RedHat OpenShift 构建,提供云端和本地部署两种方式,集成了 transformers、accelerate、peft 和 Text Generation Inference 等 Hugging Face 开源库。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
Hugging Face 发布教程,介绍如何在单块 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley 等团队基于 LLaMA 微调,训练成本约 300 美元,据 GPT-4 评估其质量达到 ChatGPT 的 90% 以上。
Hugging Face 发布辅助生成(assisted generation)方法,用一个至少小一个数量级的助手模型生成候选 token,再由主模型一次前向验证,从而减少前向次数、降低文本生成延迟。
推荐理由:Hugging Face 官方给出辅助生成方法的原理与可复现代码,读者可据此判断低延迟推理的落地条件。
Hugging Face Unity API 将 Hugging Face Inference API 集成进 Unity 项目,开发者可在 Unity 中调用 Hugging Face 的 AI 模型。
Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、处理 WikiText v1 数据集、生成 TFRecord 分片并上传至 Google Cloud Storage,以及最终模型训练与上传的完整流程。
Hugging Face 博客介绍如何用 diffusers 在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上运行 DeepFloyd 的 IF 文生图模型。
推荐理由:以免费 Colab 为约束,展示 8bit 量化与分阶段加载如何把 40GB 权重的 IF 跑起来,方法可迁移到其他大模型部署。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,借助 optimum-neuron 无需切分或修改模型,一行代码即可编译。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoints 集成进 Snorkel Flow 平台,让企业用户可直接调用其超过 150,000 个开源模型来适配自身用例。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,可在客户需要时激活、不需要时休眠,从而控制成本。
Hugging Face 发布 BLOOMZ 在 Habana Gaudi2 上的推理基准,176B 参数版本延迟 3.103 秒,比 A100 80GB 快 1.42 倍;BLOOMZ-7B 延迟 0.734 秒,比 A100 快 2.89 倍。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术,借助 Optimum Intel 与 OpenVINO 将单图生成延迟从 32.3 秒降至 16.7 秒,固定 512x512 分辨率后进一步降至 4.7 秒。相比上一代 Ice Lake Xeon 的原生推理,整体提速近 10 倍。
Hugging Face 宣布改进 Hub 上 Jupyter Notebook 的托管支持,新增渲染功能,使原本为 JSON 格式的 ipynb 文件能以人类可读形式展示。Hub 目前已托管超 7,000 个 notebook,并支持一键在 Google Colab 中直接打开。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作搭建救灾应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
Witty Works 借助 Hugging Face Expert Acceleration Program,将写作助手的非包容性词汇检测从 spaCy 迁移到 Sentence Transformers 架构,并用 SetFit 实现少样本微调,每个词仅需 15-20 条标注句子。
消费者奖励公司 Fetch 借助 AWS 合作伙伴 Hugging Face 的 Expert Acceleration Program,将原本依赖第三方黑盒的收据处理方案改为自研 AI/ML 模型,开发时间缩短 30%。
Hugging Face 与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调并部署模型。Hugging Face 上已有超 10 万个免费模型,每日下载量超 100 万次,客户可在 SageMaker 和 EC2 上几次点击完成微调与部署。
Hugging Face 推出托管服务 Inference Endpoints,可将 Hub 上的模型部署到 AWS、Azure(GCP 即将支持)等多种实例类型上。作者将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移过去,用 RoBERTa 文本分类模型测试显示,large 实例延迟约 80ms,比原方案约 200ms 快一倍以上,但成本高出 24% 至 50%。
Hugging Face 在 Ice Lake 与 Sapphire Rapids 两种 Amazon EC2 实例上对比了 distilbert-base-uncased、bert-base-uncased 和 roberta-base 的推理性能,测试 16 与 128 token 句子的单条及批量预测延迟。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为热门 Hugging Face 模型带来 35% 以上的训练提速。
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)裸金属实例上分布式训练 PyTorch Transformers,借助 Intel oneAPI CCL 和 IPEX 库,无需改动一行代码即可启用 AMX 指令加速矩阵乘法。
Hugging Face 用 Optimum Habana 在 BERT 预训练、Stable Diffusion 推理和 T5-3B 微调上对比了 Habana Gaudi2、初代 Gaudi 与 Nvidia A100 80GB,Gaudi2 训练和推理速度约为 A100 80GB 的两倍。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,让 GPT2 到 Stable Diffusion 等模型可在 Elixir 中运行。
Hugging Face 梳理了其推理方案:模型页上的免费 Inference Widget 和 Inference API 可零代码或单次 HTTP 请求调用 Hub 模型,后者因限流不建议用于生产。
Hugging Face 博客发布教程,演示如何用 Concrete-ML 库在完全同态加密(FHE)环境下构建情感分析模型,无需密码学背景即可上手。方案先用 BERT 提取文本隐藏表示(hidden size 为 768),再交给 XGBoost 分类,并通过客户端/服务器协议部署到云端,最终在 Hugging Face Spaces 上提供完整演示。
Hugging Face 更新定价体系,下线 Inference API 的付费层,该 API 仍对所有人免费开放。面向企业级高速推理需求,平台推出新服务 Inference Endpoints,并为 Spaces 提供硬件升级,可按需选择硬件运行 ML demo。这些服务无需订阅,只需在账单设置中绑定信用卡,付费服务按月计费并生成汇总发票。
Hugging Face 宣布将 Intel OpenVINO 加入 Optimum Intel,用户可在多种 Intel 处理器上用 OpenVINO Runtime 对 Transformers 模型执行推理,模型可托管于 Hugging Face hub 或本地。
Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP、Accelerate 轻量封装以及 Transformers 的 Trainer API。Accelerate 可在零代码改动下支持单 GPU 和 TPU,Trainer 则抽象掉所有样板代码并支持多种设备和分布式场景。
Hugging Face 推出 Inference Endpoints,可将 Hub 上的模型直接部署到托管基础设施,支持 AWS eu-west-1 单 GPU 实例并可选自动扩缩容。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上运行 Stable Diffusion 推理。
推荐理由:官方教程给出在 TPU 上并行跑 Stable Diffusion 的完整代码路径,可迁移到自己的推理部署。
Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 特性在内存不足的消费级硬件上加载并推理超大模型,示例可在免费 Colab 实例上运行 OPT-6.7B。
推荐理由:以 OPT-6.7B 到 BLOOM 为例,讲清 Accelerate 如何用 meta device、device map 和分片加载把超大模型跑在普通硬件上。
Hugging Face 发布教程,介绍如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 模型做快速推理。
推荐理由:文章给出 BLOOM 176B 在多种并行与量化方案下的实测吞吐与显存占用,可据此选择部署路径。