Hugging Face 社区如何用机器学习搭建土耳其地震救灾应用 afetharita
2023 年土耳其地震后,志愿者在 Hugging Face 上协作搭建救灾应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作搭建救灾应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
Witty Works 借助 Hugging Face Expert Acceleration Program,将写作助手的非包容性词汇检测从 spaCy 迁移到 Sentence Transformers 架构,并用 SetFit 实现少样本微调,每个词仅需 15-20 条标注句子。
消费者奖励公司 Fetch 借助 AWS 合作伙伴 Hugging Face 的 Expert Acceleration Program,将原本依赖第三方黑盒的收据处理方案改为自研 AI/ML 模型,开发时间缩短 30%。
Hugging Face 与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调并部署模型。Hugging Face 上已有超 10 万个免费模型,每日下载量超 100 万次,客户可在 SageMaker 和 EC2 上几次点击完成微调与部署。
Hugging Face 推出托管服务 Inference Endpoints,可将 Hub 上的模型部署到 AWS、Azure(GCP 即将支持)等多种实例类型上。作者将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移过去,用 RoBERTa 文本分类模型测试显示,large 实例延迟约 80ms,比原方案约 200ms 快一倍以上,但成本高出 24% 至 50%。
Hugging Face 在 Ice Lake 与 Sapphire Rapids 两种 Amazon EC2 实例上对比了 distilbert-base-uncased、bert-base-uncased 和 roberta-base 的推理性能,测试 16 与 128 token 句子的单条及批量预测延迟。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为热门 Hugging Face 模型带来 35% 以上的训练提速。
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)裸金属实例上分布式训练 PyTorch Transformers,借助 Intel oneAPI CCL 和 IPEX 库,无需改动一行代码即可启用 AMX 指令加速矩阵乘法。
Hugging Face 用 Optimum Habana 在 BERT 预训练、Stable Diffusion 推理和 T5-3B 微调上对比了 Habana Gaudi2、初代 Gaudi 与 Nvidia A100 80GB,Gaudi2 训练和推理速度约为 A100 80GB 的两倍。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,让 GPT2 到 Stable Diffusion 等模型可在 Elixir 中运行。
Hugging Face 梳理了其推理方案:模型页上的免费 Inference Widget 和 Inference API 可零代码或单次 HTTP 请求调用 Hub 模型,后者因限流不建议用于生产。
Hugging Face 博客发布教程,演示如何用 Concrete-ML 库在完全同态加密(FHE)环境下构建情感分析模型,无需密码学背景即可上手。方案先用 BERT 提取文本隐藏表示(hidden size 为 768),再交给 XGBoost 分类,并通过客户端/服务器协议部署到云端,最终在 Hugging Face Spaces 上提供完整演示。
Hugging Face 更新定价体系,下线 Inference API 的付费层,该 API 仍对所有人免费开放。面向企业级高速推理需求,平台推出新服务 Inference Endpoints,并为 Spaces 提供硬件升级,可按需选择硬件运行 ML demo。这些服务无需订阅,只需在账单设置中绑定信用卡,付费服务按月计费并生成汇总发票。
Hugging Face 宣布将 Intel OpenVINO 加入 Optimum Intel,用户可在多种 Intel 处理器上用 OpenVINO Runtime 对 Transformers 模型执行推理,模型可托管于 Hugging Face hub 或本地。
Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP、Accelerate 轻量封装以及 Transformers 的 Trainer API。Accelerate 可在零代码改动下支持单 GPU 和 TPU,Trainer 则抽象掉所有样板代码并支持多种设备和分布式场景。
Hugging Face 推出 Inference Endpoints,可将 Hub 上的模型直接部署到托管基础设施,支持 AWS eu-west-1 单 GPU 实例并可选自动扩缩容。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上运行 Stable Diffusion 推理。
推荐理由:官方教程给出在 TPU 上并行跑 Stable Diffusion 的完整代码路径,可迁移到自己的推理部署。
Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 特性在内存不足的消费级硬件上加载并推理超大模型,示例可在免费 Colab 实例上运行 OPT-6.7B。
推荐理由:以 OPT-6.7B 到 BLOOM 为例,讲清 Accelerate 如何用 meta device、device map 和分片加载把超大模型跑在普通硬件上。
Hugging Face 发布教程,介绍如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 模型做快速推理。
推荐理由:文章给出 BLOOM 176B 在多种并行与量化方案下的实测吞吐与显存占用,可据此选择部署路径。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型,并转换到 Transformers 使用。
Hugging Face 展示了如何将 ViT B/16 模型部署到 Google Cloud 的 Vertex AI 平台,用远少于 Kubernetes 方案的代码量获得同等扩展能力。
Hugging Face 与 Graphcore 联合发布 Optimum Graphcore 库,提供预训练 ViT 模型检查点和配置文件,可在 IPU 上直接微调。博文以 ImageNet-21k 预训练的 ViT 为例,演示在 ChestX-ray14 数据集上的完整微调流程,并附有 notebook。IPU 的 MIMD 架构与流水线并行可提升训练效率。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等大模型可在更少 GPU 上运行且性能不降。
推荐理由:Hugging Face 与 BigScience 作者复盘 LLM.int8() 接入 transformers 的工程细节,可看到大模型量化落地的真实难点。
Hugging Face 发布新库 Skops,支持将 scikit-learn 模型托管到 Hugging Face Hub,并生成模型卡进行文档记录与协作。Skops 后端目前使用 joblib 加载模型,可自动填充库名、任务标识(如 tabular-classification)及推理 widget 所需元数据,并支持通过 add_metrics、add_plot 添加评估指标与图表。
Hugging Face 阐述了其 transformers 库在 TensorFlow 上的设计理念:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,用户可直接调用 fit()、compile() 和 predict()。库通过 TFAutoModel 等类一行代码加载预训练模型,并配合 AutoTokenizer 完成匹配的预处理。
Hugging Face 发布教程,讲解如何用 Docker 和 Kubernetes 将上一篇文章中本地部署的 Vision Transformer(ViT)模型扩展为可服务多用户的线上部署。
Hugging Face 发布 Private Hub(PH),为机器学习全生命周期提供统一工具,支持以安全合规的方式加速从研究到生产的各环节。PH 基于拥有 60K+ 模型、6K 数据集和 6K 演示应用的 Hugging Face Hub,通过 Git 仓库、组织账户和权限管理实现团队内部模型、数据集与 Spaces 的共享协作。
Hugging Face 的 transformers 库在 TensorFlow 下现可用 XLA 编译文本生成,速度最高提升 100 倍,甚至快于 PyTorch。该功能需 transformers >= 4.21.0,示例基于 GPT-2 展示采样、贪心解码与 Beam Search 等生成方式。
Hugging Face 与外部贡献者为 Transformers 加入了 Vision Transformer、Masked Autoencoders、RegNet、ConvNeXt 等 TensorFlow 视觉模型,并演示如何用 TensorFlow Serving 在本地部署 ViT 图像分类模型,将其暴露为 REST 或 gRPC 端点。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 Megatron-DeepSpeed 框架、采用 3D 并行技术,在 384 块 80GB A100 GPU 上训练了约 3.5 个月。训练数据为 59 种语言、350B token,模型架构类似 GPT3 并做了改进,词表规模 250,680。
Hugging Face 展示了用 Accelerate 库调用 DeepSpeed ZeRO 加速大模型训练的方法,无需改动代码即可启用 ZeRO Stage-2。
Hugging Face 博客介绍了三种将 Transformers 模型转为 ONNX 的方式:底层 torch.onnx、中层 transformers.onnx 和高级 Optimum。
Intel 正式加入 Hugging Face 硬件合作伙伴计划,双方将基于开源库 Optimum 合作构建面向 Transformer 的硬件加速方案,覆盖训练、微调和推理。
大型神经网络是近期许多 AI 进展的核心,但训练它们是一项艰巨的工程与研究挑战,需要协调一整个 GPU 集群来完成单次同步计算。
Cohere、OpenAI 和 AI21 Labs 共同制定了一套初步的大语言模型最佳实践,适用于任何开发或部署大语言模型的组织。
Graphcore 与 Hugging Face 在开源优化库 Optimum 中新增一批适配 IPU 的 Transformer 模型,可访问模型总数达到 10 个,覆盖 NLP、语音和计算机视觉,均附带 IPU 配置文件及预训练、微调权重。新增模型包括 ViT、GPT-2、RoBERTa、DeBERTa、BART、LXMERT、T5、HuBERT 和 Wav2Vec2,此前仅有 BERT。
Hugging Face 开源库 Optimum 发布 1.2 版本,新增对 Transformers pipelines 的推理支持,首批接入 ONNX Runtime,用户可将 AutoModelForXxx 直接替换为对应的 ORTModelForXxx 类。
fastai 现已接入 Hugging Face Hub,开发者用一行 Python 即可将 fastai Learner 上传至 Hub 分享。
Hugging Face 介绍如何通过 Accelerate 库无需改代码即可使用 PyTorch FullyShardedDataParallel(FSDP)训练大模型。