Hugging Face 用 AWS Inferentia2 加速 Transformers 推理
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,借助 optimum-neuron 无需切分或修改模型,一行代码即可编译。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,借助 optimum-neuron 无需切分或修改模型,一行代码即可编译。
Hugging Face 博客发布教程,演示如何用 Transformers 库(版本 >= 4.27.2)完成图分类任务,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示 Space,让用户体验数据孤岛下联邦学习的训练效果。联邦学习让数据留在本地、仅传输模型权重,用多源数据训练的模型在验证集上几乎总是优于单一数据源模型。Substra 已在乳腺癌研究等真实场景中落地,MELLODDY 项目中 10 家生物制药公司借此共享了全球最大的小分子活性数据集。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoints 集成进 Snorkel Flow 平台,让企业用户可直接调用其超过 150,000 个开源模型来适配自身用例。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,可在客户需要时激活、不需要时休眠,从而控制成本。
Hugging Face 发布 StackLLaMA 模型并公开完整 RLHF 训练流程,涵盖监督微调、奖励建模和基于 PPO 的强化学习三个阶段,全部代码集成在 TRL 库中。
推荐理由:完整走通 SFT、奖励模型与 PPO 三段 RLHF 流程,并给出 8bit 加 LoRA 在单卡上复现的配置与踩坑记录。
Hugging Face 发布 Ethics and Society Newsletter #3,阐述其在开放 ML 中兼顾伦理的思路。平台推出 6 类伦理标签(严谨、知情同意、社会意识、可持续、包容、探究),并上线举报功能,供社区标记违规的模型、数据集或 Space。
Hugging Face 发布 BLOOMZ 在 Habana Gaudi2 上的推理基准,176B 参数版本延迟 3.103 秒,比 A100 80GB 快 1.42 倍;BLOOMZ-7B 延迟 0.734 秒,比 A100 快 2.89 倍。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术,借助 Optimum Intel 与 OpenVINO 将单图生成延迟从 32.3 秒降至 16.7 秒,固定 512x512 分辨率后进一步降至 4.7 秒。相比上一代 Ice Lake Xeon 的原生推理,整体提速近 10 倍。
Hugging Face 发布教程,演示如何借助 Flower 框架在多个客户端上联邦微调预训练 Transformer 模型 distilBERT,用于 IMDB 影评情感分类。
Hugging Face 发布教程,介绍如何用 diffusers 训练 ControlNet,并以基于 FaceSynthetics 数据集的人脸姿态模型 Uncanny Faces 为例完整走了一遍流程。
推荐理由:完整走了一遍从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face 宣布改进 Hub 上 Jupyter Notebook 的托管支持,新增渲染功能,使原本为 JSON 格式的 ipynb 文件能以人类可读形式展示。Hub 目前已托管超 7,000 个 notebook,并支持一键在 Google Colab 中直接打开。
AAAI21 最佳论文 Informer 现已加入 🤗 Transformers,可用于多变量概率时间序列预测,即预测未来时间序列目标值向量的分布。该模型基于 vanilla Transformer,通过 ProbSparse 注意力将自注意力复杂度从 O(T²D) 降至 O(T log T),并用 Distilling 操作把堆叠层的内存占用降至 O(N·T log T)。
Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。方案结合 8-bit 矩阵乘法、低秩适配器和 peft 的 disable_adapters 机制,用同一份模型同时充当参考模型与活动模型,从而省去第二份模型副本。
推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到其他显存受限的训练场景。
Kakao Brain 与 Hugging Face 发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 把 ViT 与 ALIGN 连同训练数据一起开源,读者可据此判断视觉语言模型复现的门槛变化。
Hugging Face 在 Diffusers 中集成 ControlNet,推出 StableDiffusionControlNetPipeline,可用深度图、分割图、涂鸦、关键点等空间条件控制 Stable Diffusion 生成结果。
推荐理由:Diffusers 官方给出 ControlNet 的完整接入方式与多种条件控制示例,可直接照代码复现。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作搭建救灾应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
Hugging Face 为 Diffusers 库发布伦理框架,用于指导维护者处理社区贡献时的技术决策,并承诺随项目演进和社区反馈持续调整。准则涵盖透明、一致、简洁、可及、可复现与责任六项价值,同时列出 Community tab、Tag 功能、偏见探索 Space、Safe Stable Diffusion、Hub 分阶段发布及 OpenRAILs 许可等安全机制。
Witty Works 借助 Hugging Face Expert Acceleration Program,将写作助手的非包容性词汇检测从 spaCy 迁移到 Sentence Transformers 架构,并用 SetFit 实现少样本微调,每个词仅需 15-20 条标注句子。
红队测试通过构造自然语言提示词诱导 LLM 生成有害内容,从而暴露模型漏洞,与人类难以理解的对抗攻击不同。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。红队可由人工或另一个 LM 执行,角色扮演攻击和用代码作答能绕过经 RLHF 或 SFT 对齐的模型,该领域仍处早期,需要多机构协作共享数据集与最佳实践。
Hugging Face 推出 🧨Diffusers for Mac 1.1,这款基于 Core ML 的原生应用将 Stable Diffusion 文生图速度最高提升至 2 倍,并自动为设备选择 GPU 或 Neural Engine 加速器。
消费者奖励公司 Fetch 借助 AWS 合作伙伴 Hugging Face 的 Expert Acceleration Program,将原本依赖第三方黑盒的收据处理方案改为自研 AI/ML 模型,开发时间缩短 30%。
Hugging Face 与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调并部署模型。Hugging Face 上已有超 10 万个免费模型,每日下载量超 100 万次,客户可在 SageMaker 和 EC2 上几次点击完成微调与部署。
Hugging Face 推出托管服务 Inference Endpoints,可将 Hub 上的模型部署到 AWS、Azure(GCP 即将支持)等多种实例类型上。作者将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移过去,用 RoBERTa 文本分类模型测试显示,large 实例延迟约 80ms,比原方案约 200ms 快一倍以上,但成本高出 24% 至 50%。
Hugging Face 发布指南,介绍 Salesforce Research 的 BLIP-2 视觉语言模型已集成到 Transformers,并演示图像描述、提示图像描述、视觉问答和对话式提示四种用法。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示描述、视觉问答和对话式提示四种用法,附可运行代码。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:官方给出 PEFT 库支持的微调方法与消费级硬件上的显存占用示例,便于判断低成本微调大模型的可行路径。
Hugging Face 宣布 SpeechT5 已集成进 Transformers,官方权重发布在 Hugging Face Hub,并提供语音合成、音色转换和语音识别三个 Spaces 演示。
推荐理由:SpeechT5 以同一套架构覆盖 TTS、语音转换与 ASR,文中给出可直接运行的代码与权重入口,便于判断能否接入现有语音流程。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行相对排名。该工具托管于 Spaces,由匹配算法、结果 Dataset 和展示 ELO 评分的 Leaderboard 组成,模型上传至 Hub 后即自动参与对战评估,起始 ELO 为 1200。
Hugging Face 在 Ice Lake 与 Sapphire Rapids 两种 Amazon EC2 实例上对比了 distilbert-base-uncased、bert-base-uncased 和 roberta-base 的推理性能,测试 16 与 128 token 句子的单条及批量预测延迟。
Hugging Face 发布博客深入解析视觉语言模型的训练方法,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练等五类预训练策略。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 实验该领域最新进展。
Hugging Face 公布其计算机视觉生态现状:Hub 上已支持 8 个核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖图像分类、分割、目标检测、深度估计等,并兼容 ViT、Swin、DETR 及 ConvNeXt、ResNet 等架构。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏素材,并以农场游戏的玉米和镰刀图标为例演示完整流程。
Hugging Face 在 diffusers 中正式加入 LoRA 微调支持,覆盖 Dreambooth 和完整微调两种方式,训练脚本最低可在 11 GB 显存上运行。
推荐理由:Hugging Face 官方给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,可据此在 11 GB 显存上复现。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为热门 Hugging Face 模型带来 35% 以上的训练提速。
Mask2Former 和 OneFormer 两款图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 统一了实例、语义和全景分割三种任务,但需分别训练;OneFormer 仅需在全景数据集上训练一次即可在三种任务上达到 SOTA,精度更高但因额外文本编码器延迟更大。作者已发布 30 个基于不同数据集训练的 checkpoint。
Hugging Face 与百度飞桨(PaddlePaddle)达成开源合作,PaddlePaddle 模型库将逐步集成至 Hugging Face Hub,首批已有超 75 个模型上线,涵盖 UIE、ERNIE 3.0、Ernie-Layout 等。
Hugging Face 发布教程,演示如何用 🤗 Transformers 和 Datasets 库构建图像相似度检索系统。方案采用 ViT 模型(nateraw/vit-base-beans)提取图像嵌入向量,再用余弦相似度匹配查询图像与候选图像,示例使用 Beans 数据集,也可替换为 Swin Transformer、ConvNeXT、RegNet 等视觉模型。
Hugging Face 博客系列教程第二部分介绍如何用 ChatGPT 辅助农场游戏设计,作者让它以专业游戏设计师身份给出作物多样性、成长系统等建议,并自行取舍实现。文章同时解释语言模型与 Transformer 原理,指出 ChatGPT 常言之凿凿却出错,建议将其用作头脑风暴和加速工具而非开发流程的替代品。
Hugging Face 发布图机器学习入门博客,介绍图的基本概念、表示方法及学习范式,涵盖从预神经网络方法到图神经网络(GNN),并延伸至面向图的 Transformer。文章还梳理了图级别、节点级别、边级别和子图级别的典型任务,如分子生成、Alphafold 的原子坐标预测、药物副作用预测与推荐系统中的缺失边预测。
Hugging Face 博客开启"AI for Game Development"系列,演示 5 天内用 AI 工具做出完整农场游戏。
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)裸金属实例上分布式训练 PyTorch Transformers,借助 Intel oneAPI CCL 和 IPEX 库,无需改动一行代码即可启用 AMX 指令加速矩阵乘法。