Hugging Face 发布 Würstchen:面向图像生成的快速扩散模型
Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。
Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。
Hugging Face 博客介绍了如何用 PyTorch FSDP 在多节点多 GPU 上微调 Llama 2 70B,并给出配套的 Transformers、Accelerate 与 TRL 配置。
推荐理由:完整给出了 70B 模型多节点微调的三个显存与检查点难题及对应配置解法,可直接迁移到自有训练流程。
Hugging Face Transformers 目前原生支持 bitsandbytes 和 auto-gptq 两种量化方案,前者无需校准数据即可对任意含 torch.nn.Linear 的模型做零样本量化,后者在文本生成上更快且支持 2-bit 量化。bitsandbytes 的 4-bit 模型暂不支持序列化,GPTQ 则需校准数据集且目前仅支持语言模型。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言、8192 token 上下文窗口和 fill-in-the-middle。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。
推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。
TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。
推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短 10 倍以上,10 秒音频样本生成从 30 秒降至 1 秒,质量损失极小。
Meta 发布 Code Llama,这是基于 Llama 2 初始化、在 5000 亿 token 代码数据上训练的代码模型家族,包含 7B、13B、34B 三个规模,并额外提供 Python 专精版和指令微调版,采用与 Llama 2 相同的社区许可,可商用。
推荐理由:Hugging Face 生态对 Code Llama 的集成说明,含 7B/13B/34B 各版本基准与部署方式,便于判断选型与落地成本。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化接入 Transformers 的用法与显存收益,可据此判断本地部署大模型的可行路径。
Hugging Face 发布开源视觉语言模型 IDEFICS,复现 DeepMind 未公开的 Flamingo,接受任意图像与文本序列输入并生成文本。模型提供 9B 和 80B 两个参数规模,各有基础版和指令微调版,仅基于公开数据与模型(LLaMA v1、OpenCLIP)构建。
推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可了解其数据构成与开放程度。
Hugging Face 发布企业级代码助手 SafeCoder,基于 StarCoder 系列代码大模型构建,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。该方案采用 15B 参数模型,支持 8,192 tokens 上下文,可适配 NVIDIA、AMD、Intel 及 AWS Inferentia2、Habana Gaudi 等硬件。
Hugging Face 博客演示了如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结的文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 基础图逐步放大至 1024x1024 px。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并给出用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B 的完整流程。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自己的偏好数据上复现对齐训练。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者能在 Apple 设备上通过 Core ML 运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 发布 Swift 端侧 LLM 工具链,读者可了解在 Apple 设备上跑 Llama 2 的完整路径与当前限制。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署 MusicGen 音乐生成模型。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,用文本提示词生成音乐,也可选用旋律片段作为条件。
Hugging Face 正用机器学习检测 Hub 上缺少语言元数据的数据集语言,并通过 librarian-bots 提交 PR 补全这些元数据。Hub 现有约 5 万个公开数据集,仅约 13% 标注了语言信息,其中约 19% 标注为 en。
Zama 展示了如何借助 Hugging Face transformers 库,用全同态加密(FHE)在加密数据上运行 GPT2 的部分推理,从而同时保护用户数据隐私与模型 IP。实现中将 GPT2 首个多头注意力头改写为 FHE 兼容算子,权重与激活量化为整数,4-bit 量化可保留原模型 96% 的准确率。完整代码已在该用例示例中开源。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,图像保真度接近基础模型。
Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。
推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,内置若干多模态工具并支持自定义工具与模型。
Hugging Face 联合 Creative Commons、Eleuther AI、GitHub、LAION 和 Open Future 发布立场文件,就 EU AI Act 提出五项建议。
Hugging Face 公布首届开源 AI Game Jam 结果,活动吸引超 1300 人报名、收到 88 款游戏,冠军由 ohmlet 的 Snip It 获得,该游戏用 Stable Diffusion 生成素材。
Hugging Face 的 Diffusers 库迎来一周年,已从文生图扩展为覆盖视频、3D 与图像编辑的模块化扩散模型工具箱。
Meta 发布 Llama 2 系列开放大语言模型,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可,代码、预训练模型和微调模型同日放出。
推荐理由:Meta 开放 Llama 2 商用许可,Hugging Face 同步给出推理、量化与微调的完整接入路径。
Hugging Face 推出 AI WebTV 实验性演示,用开源文生视频模型 Zeroscope V2 与音乐生成模型 MusicGen 合成内容并直播。
Hugging Face 梳理其开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型、LLM 服务工具及 PEFT 微调。
Hugging Face 博客介绍了如何用 Transformers.js 制作实时 ML 网页游戏 Doodle Dash,模型完全在浏览器本地运行。作者基于 Google Quick, Draw!
推荐理由:作者完整走通从微调 MobileViT 到浏览器内实时推理的流程,可迁移到自己的网页 ML 项目。
Hugging Face 发布教程,演示如何用其托管 SaaS 服务 Inference Endpoints 部署开源 LLM,以 Falcon 40B instruct 为例,推荐将实例从 4x NVIDIA T4 换成 1x Nvidia A100,约 10 分钟即可上线。
Hugging Face 的 Jeff Boudier 对话 Writer 联合创始人兼 CTO Waseem Alshikh,回顾 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。双方还讨论了当前生成式 AI 的最大误区、Writer 贡献开源模型的原因,以及 Writer 如何在 CPU 和 GPU 上规模化部署 LLM、CPU 推理效率对生产的重要性。
Hugging Face 发布 Ethics and Society Newsletter 第4期,聚焦文本到图像模型的偏见问题。文章梳理了训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等偏见来源,并指出 Stable Diffusion 和 Dall-E 2 等模型存在多样性不足与刻板印象。文中还介绍了 Stable Bias 项目用于探索和比较偏见的工具。
Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何显著低于 LLaMA 论文报告值:榜单基于 EleutherAI LM Evaluation Harness,而 LLaMA 团队用的是 UC Berkeley 原始实现,Stanford HELM 又是第三种实现。
Hugging Face 于 6 月 12 日向美国商务部 NTIA 提交 AI 问责政策回应,强调文档与透明度规范在推动 AI 问责中的作用。其建议问责机制应覆盖 ML 开发全流程、结合内部要求与外部访问透明,并吸纳开发者、多学科研究社区、倡导组织、政策制定者和记者等最广泛参与者。Hugging Face 称已在 BigScience 和 BigCode 项目中实践上述思路。
Hugging Face 发布教程,介绍如何基于 Meta AI 的 MMS 检查点微调 Adapter 层以适配低资源语言的语音识别。MMS 的 Adapter 训练仅需 10-20 分钟微调即可获得极低词错误率,每个 Adapter 层仅约 2.5M 权重,比微调整个模型更省内存、更稳健。
Hugging Face 用实验反驳了 AAAI 2023 论文《Are Transformers Effective for Time Series Forecasting?
Hugging Face 更新了平台内容政策,并发布配套博客说明其制定理由与核心价值。新政策针对机器学习内容审核的特殊挑战,强调“同意”作为核心价值,关注用户作品、形象与隐私权利,同时禁止针对用户及 Hugging Face 员工的攻击性或骚扰性语言。
Elixir 社区用 Livebook 构建了一个基于 Whisper 的语音聊天应用,并部署到 Hugging Face Spaces,全程不到 15 分钟。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将共同在 AMD CPU 和 GPU 上优化 Transformer 模型性能。
Hugging Face Hub 面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何查找模型、上传数据集并托管演示应用。Hub 目前托管超 190,000 个模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频等任务。文中以挪威语文献的命名实体识别(NER)模型为例,并演示通过浏览器界面上传 CSV 数据集。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了人类标注与 GPT-4 对开源模型输出的偏好评分。
Hugging Face Hub 新增 DuckDB 集成,用户可对 Hub 上任意公开数据集运行 SQL 查询。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,大文件按 500MB 分片,可通过 /parquet 端点获取 URL,再借助 httpfs 扩展直接查询远程文件。