使用 CLIPSeg 进行零样本图像分割
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型基于冻结的 CLIP 加 Transformer 解码器,在 PhraseCut 数据集(超 34 万条短语)上训练,支持文本或图像作为提示词,输出 352 x 352 像素的粗略分割掩码,可用于机器人感知、图像修复等任务,并可在 Segments.ai 上进一步精修。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型基于冻结的 CLIP 加 Transformer 解码器,在 PhraseCut 数据集(超 34 万条短语)上训练,支持文本或图像作为提示词,输出 352 x 352 像素的粗略分割掩码,可用于机器人感知、图像修复等任务,并可在 Segments.ai 上进一步精修。
Hugging Face 推出 Model Card Creator Tool 和 Model Card Guide Book,前者提供图形界面,无需编程或 Markdown 即可协作创建模型卡。同时更新了 huggingface_hub 库中的模型卡模板,并发布注释版模板、用户研究及文档现状综述。
Hugging Face 发布 Ethics and Society Newsletter 第二期,讨论机器学习中的偏见问题。文章指出偏见是复杂的社会技术问题,单一技术手段难以有效解决,并介绍了团队在数据集与模型等 ML 开发各环节开发的偏见分析工具。
Hugging Face 发布音频数据集使用指南,介绍如何用 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。当时 Hub 上已有 77 个语音识别数据集和 28 个音频分类数据集,并支持 Dataset Preview 在线试听样本。
Hugging Face 用 Optimum Habana 在 BERT 预训练、Stable Diffusion 推理和 T5-3B 微调上对比了 Habana Gaudi2、初代 Gaudi 与 Nvidia A100 80GB,Gaudi2 训练和推理速度约为 A100 80GB 的两倍。
Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,让 GPT2 到 Stable Diffusion 等模型可在 Elixir 中运行。
Hugging Face 发布《Deep Learning with Proteins》博文,面向想入门机器学习的生物学家和想入门生物学的机器学习研究者。
Hugging Face 博客介绍如何用 🤗 Transformers 库中的 Time Series Transformer 模型完成单变量概率时间序列预测。
借助 Apple 工程师提供的转换脚本和推理代码,Stable Diffusion 现在可以在 Apple Silicon 上通过 Core ML 运行,Hugging Face 已把 Stable Diffusion v1.4、v1.5、v2 base 和 v2.1 base 的权重转换好并放到 Hugging Face Hub。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程,含模型变体选择与实测耗时。
中国科学技术大学与微软提出 VQ-Diffusion,一种在量化隐空间上进行加噪与去噪的条件扩散模型,隐空间由离散向量集合构成。该模型使用冻结的 VQ-VAE 编码图像,并用 CLIP 文本编码器加解码器 Transformer 预测去噪隐变量分布。用户可通过 🧨 Diffusers 用几行代码加载 microsoft/vq-diffusion-ithq 并运行推理。
Hugging Face 宣布启动 2023 年实习生招聘,开放 7 个岗位,涵盖 Accelerate、文本转语音、具身智能、大语言模型分布式训练框架、LLM 数据集、生成式 ML 社会影响评估和 AI 艺术工具等方向。实习生将与 Hugging Face 导师及相应开源库维护者合作,申请者需通过官方招聘门户提交申请并创建 Hugging Face 账号。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日免费发布,讲解扩散模型的理论与应用。配合课程上线,11 月 30 日将举办社区直播活动,Stable Diffusion 创作者、Stability AI 与 Meta 的研究者等将带来演讲。
Hugging Face 博客发布《Director of Machine Learning Insights》第四期,邀请 Javier Mansilla、Shaun Gittens、Samuel Franklin 和 Evan Castle 四位机器学习总监分享 ML 对各自行业的影响。
Hugging Face 梳理了其推理方案:模型页上的免费 Inference Widget 和 Inference API 可零代码或单次 HTTP 请求调用 Hub 模型,后者因限流不建议用于生产。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。
Hugging Face 与 arXiv 合作,将 Spaces 通过 arXivLabs 集成到论文页面,新增 Demo 标签页,可直接链接社区或作者创建的开源演示。自 2021 年 10 月上线以来,Spaces 已承载超过 12,000 个开源机器学习演示,基于 Gradio、Streamlit 等工具构建。以 BERT 论文为例,其 arXiv 页面可找到 200 多个相关演示。
Hugging Face 博客发布教程,演示如何用 Concrete-ML 库在完全同态加密(FHE)环境下构建情感分析模型,无需密码学背景即可上手。方案先用 BERT 提取文本隐藏表示(hidden size 为 768),再交给 XGBoost 分类,并通过客户端/服务器协议部署到云端,最终在 Hugging Face Spaces 上提供完整演示。
Hugging Face 更新定价体系,下线 Inference API 的付费层,该 API 仍对所有人免费开放。面向企业级高速推理需求,平台推出新服务 Inference Endpoints,并为 Spaces 提供硬件升级,可按需选择硬件运行 ML demo。这些服务无需订阅,只需在账单设置中绑定信用卡,付费服务按月计费并生成汇总发票。
Hugging Face 将对比搜索(Contrastive Search)解码方法集成进 transformers,PyTorch 和 TensorFlow 均可用,需安装 transformers==4.24.0。
Hugging Face 团队用 Diffusers 的 Dreambooth 训练脚本做了多组对照实验,总结出微调 Stable Diffusion 的推荐设置。
推荐理由:基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。
Hugging Face 发布教程,逐步讲解如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖模型原理、Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估和 Gradio 演示。
推荐理由:完整给出用 Transformers 微调 Whisper 的代码流程,并以 8 小时印地语数据把 WER 从 63.5% 降到 32.0% 作为可参照结果。
Hugging Face 宣布将 Intel OpenVINO 加入 Optimum Intel,用户可在多种 Intel 处理器上用 OpenVINO Runtime 对 Transformers 模型执行推理,模型可托管于 Hugging Face hub 或本地。
Hugging Face 为 🤗 Evaluate 库新增偏见评估指标,可对 GPT-2、BLOOM 等因果语言模型生成的文本进行 Toxicity、Polarity 和 Hurtfulness 三类提示词任务评测。
Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP、Accelerate 轻量封装以及 Transformers 的 Trainer API。Accelerate 可在零代码改动下支持单 GPU 和 TPU,Trainer 则抽象掉所有样板代码并支持多种设备和分布式场景。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),覆盖 8 类任务、56 个数据集、最多 112 种语言,排行榜已汇总超 2000 条结果。该基准通过 pip install mteb 即可对任意嵌入模型评测,并将结果提交至公开排行榜,方便按速度、性能与嵌入维度筛选模型。
Hugging Face 推出 Inference Endpoints,可将 Hub 上的模型直接部署到托管基础设施,支持 AWS eu-west-1 单 GPU 实例并可选自动扩缩容。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上运行 Stable Diffusion 推理。
推荐理由:官方教程给出在 TPU 上并行跑 Stable Diffusion 的完整代码路径,可迁移到自己的推理部署。
Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。
Hugging Face 宣布用户可直接在 Hub 的仓库设置中为模型或数据集生成 DOI,其他人在模型或数据集页面点击“Cite this model/dataset”即可引用。该功能与 DataCite 合作实现,DOI 绑定对象的 URL、版本、创建日期等元数据,新版本发布时 DOI 可更新,旧版本 DOI 随之失效。带 DOI 的数据集和模型将永久保留,仅能通过向官方支持提交请求后删除。
rinna 通过微调 Stable Diffusion 开发出日语专用文本生成图像模型 Japanese Stable Diffusion,可理解日语特有词汇、拟声词与专有名词,并生成体现日本文化的图像。
Hugging Face 在 Evaluation on the Hub 上线零样本分类评估功能,由 AutoTrain 驱动,无需写代码即可评估 Hub 上的任意因果语言模型,目前支持最大 66B 参数模型。
Hugging Face AutoTrain 新增图像分类任务,用户无需编写代码即可上传数据训练模型。AutoTrain 会自动尝试多个模型架构并筛选最优结果,示例中最佳模型达到 84% 准确率,使用 5 个候选模型且图片少于 500 张时可免费训练。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 特性在内存不足的消费级硬件上加载并推理超大模型,示例可在免费 Colab 实例上运行 OPT-6.7B。
推荐理由:以 OPT-6.7B 到 BLOOM 为例,讲清 Accelerate 如何用 meta device、device map 和分片加载把超大模型跑在普通硬件上。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架。
推荐理由:Hugging Face 与 Intel Labs 等合作方发布少样本微调框架 SetFit,读者可了解其免提示词的两阶段训练思路与成本对比。
Hugging Face 发布首期《伦理与社会》通讯,计划在每年春分、秋分、夏至、冬至各出一期,由公司内部跨部门开放小组“Ethics and Society regulars”编写。
Hugging Face 发布教程,介绍如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 模型做快速推理。
推荐理由:文章给出 BLOOM 176B 在多种并行与量化方案下的实测吞吐与显存占用,可据此选择部署路径。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性 inpainting 等 pipeline。优化后 Stable Diffusion 显存占用降至 3.2GB,代价是约 10% 的速度损失,并可通过 mps 在 M1/M2 设备上推理。该版本还提供实验性 ONNX 导出与 pipeline、首版文档,社区已分享超过 200 个文本反转概念。
推荐理由:官方一次性列出 diffusers 0.3 的图生图、文本反转、小显存优化与 Mac 支持,便于判断扩散模型工具链的可用边界。
Hugging Face 发布教程,教你用 transformers 库的 Trainer 和自定义 Data Collator,从零训练一个离线 Decision Transformer,让 HalfCheetah 学会奔跑。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型,并转换到 Transformers 使用。