跳到正文
原文
Hugging Face Blog·· 2024-07-30AI 评分38

用 Quanto 和 Diffusers 实现内存高效的 Diffusion Transformer

Memory-efficient Diffusion Transformers with Quanto and Diffusers

AI 导读

Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线的显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略有上升。

来源:Hugging Face Blog · huggingface.co