Artificial Analysis 发布文生图排行榜与竞技场
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Hugging Face 发文梳理 AI 生成内容的水印方案,区分生成时嵌入与生成后添加两类方法,并盘点 Hub 上的相关工具。文中提到 Glaze、Photoguard 可微调图像干扰 AI 处理,Nightshade、Fawkes 则通过"投毒"破坏训练假设;Truepic 按 C2PA 标准嵌入元数据,IMATAG 采用水印器与检测器闭源、调用代码开源的混合模式。
SegMind 发布 SegMoE 框架,可从零构建混合专家扩散模型,并已集成进 Hugging Face diffusers 生态。此次发布包括 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,以及用于自建 MoE 模型的 segmoe 包和 GitHub 仓库,模型采用 Apache 2.0 许可。
Hugging Face 发布经 Olive 优化的 SD Turbo 与 SDXL Turbo 模型,在 NVIDIA GPU 上通过 ONNX Runtime 的 CUDA 和 TensorRT 执行提供程序加速推理,吞吐量相比 PyTorch 最高提升 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整走通从 ComfyUI 工作流导出 Python、包成 Gradio 应用到 ZeroGPU 免费部署的链路,可迁移到任意工作流。
Hugging Face 发布 aMUSEd,这是 Google MUSE 的开源复现,采用 Masked Image Model 而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:Hugging Face 官方把 Pivotal Tuning 与 Prodigy 优化器整合进 diffusers 训练脚本,读者可据此复现 SDXL Dreambooth LoRA 微调流程。
Hugging Face 发布 Latent Consistency LoRA(LCM LoRA),通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:官方给出 LCM LoRA 的推理代码、多硬件速度对比和训练脚本,读者可据此判断少步数生成的可用性。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化管线需 28GB 显存、72.2 秒,改用 fp16 后降至 21.7GB、14.8 秒,叠加 SDPA 后进一步降到 11.4 秒。
推荐理由:原文给出 SDXL 各项优化前后的显存与延迟实测数据,读者可据此选择适合自己硬件的组合方案。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与对齐方面的评估情况。原文正文未能抓取,具体评估内容暂不可见。
Hugging Face Diffusers 现已支持在 Cloud TPU 上通过 JAX 运行 Stable Diffusion XL 推理。该方案借助 JAX jit 编译与 XLA pmap 并行,在多个 TPU v5e-4 实例上约 4 秒可生成四张 1024×1024 图像,实际生成时间约 2.3 秒。TPU v5e 成本不到 TPU v4 的一半。
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
3D Gaussian Splatting 是一种光栅化技术,能从少量图像样本中学习并实时渲染逼真场景。它先用 COLMAP 做 Structure from Motion 估计点云,再将每个点转为高斯并借助可微高斯光栅化训练,通过自动致密化与剪枝优化细节。
Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。
推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。
Hugging Face 博客演示了如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结的文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 基础图逐步放大至 1024x1024 px。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,图像保真度接近基础模型。
这篇教程演示了如何用 OpenAI 开源扩散模型 Shap-E 从文本生成 3D 模型,再经 Blender 的 Decimate 修改器减面、用 Dream Textures 插件生成无缝贴图,最后完成 UV 展开并导出 FBX 导入 Unity。整个流程面向 PS1 低多边形风格,以规避当前 text-to-3D 模型精度不足的问题。
Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。
推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。
Hugging Face 的 Diffusers 库迎来一周年,已从文生图扩展为覆盖视频、3D 与图像编辑的模块化扩散模型工具箱。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face 发布 Ethics and Society Newsletter 第4期,聚焦文本到图像模型的偏见问题。文章梳理了训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等偏见来源,并指出 Stable Diffusion 和 Dall-E 2 等模型存在多样性不足与刻板印象。文中还介绍了 Stable Bias 项目用于探索和比较偏见的工具。
Hugging Face 介绍了借助 Core ML 新优化在 iPhone、iPad 和 Mac 上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,将权重从 16-bit 浮点压到每参数 6 bit,并在推理时逐层解压以节省内存。
推荐理由:Hugging Face 与 Apple 官方给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 压到端侧运行。
Hugging Face 借助 OpenVINO 的 NNCF 与 Optimum,通过量化感知训练(QAT)结合 Token Merging 优化 Stable Diffusion 的 UNet,在 Intel CPU 上实现 5.1 倍推理加速和 4 倍模型体积缩减。优化从 Pokemons 数据集微调模型出发,仅需 4096 次迭代、单张 24GB 显存 GPU 不到一天即可完成。
Hugging Face 博客介绍如何借鉴 InstructPix2Pix 的训练策略与 FLAN 的指令模板思路,对 Stable Diffusion 做指令微调,使其按输入图像加指令完成卡通化、去雨等图像翻译与底层图像处理任务。
Hugging Face 博客介绍如何用 diffusers 在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上运行 DeepFloyd 的 IF 文生图模型。
推荐理由:以免费 Colab 为约束,展示 8bit 量化与分阶段加载如何把 40GB 权重的 IF 跑起来,方法可迁移到其他大模型部署。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术,借助 Optimum Intel 与 OpenVINO 将单图生成延迟从 32.3 秒降至 16.7 秒,固定 512x512 分辨率后进一步降至 4.7 秒。相比上一代 Ice Lake Xeon 的原生推理,整体提速近 10 倍。
Hugging Face 发布教程,介绍如何用 diffusers 训练 ControlNet,并以基于 FaceSynthetics 数据集的人脸姿态模型 Uncanny Faces 为例完整走了一遍流程。
推荐理由:完整走了一遍从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face 在 Diffusers 中集成 ControlNet,推出 StableDiffusionControlNetPipeline,可用深度图、分割图、涂鸦、关键点等空间条件控制 Stable Diffusion 生成结果。
推荐理由:Diffusers 官方给出 ControlNet 的完整接入方式与多种条件控制示例,可直接照代码复现。
Hugging Face 推出 🧨Diffusers for Mac 1.1,这款基于 Core ML 的原生应用将 Stable Diffusion 文生图速度最高提升至 2 倍,并自动为设备选择 GPU 或 Neural Engine 加速器。
Hugging Face 发布指南,介绍 Salesforce Research 的 BLIP-2 视觉语言模型已集成到 Transformers,并演示图像描述、提示图像描述、视觉问答和对话式提示四种用法。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示描述、视觉问答和对话式提示四种用法,附可运行代码。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏素材,并以农场游戏的玉米和镰刀图标为例演示完整流程。
Hugging Face 在 diffusers 中正式加入 LoRA 微调支持,覆盖 Dreambooth 和完整微调两种方式,训练脚本最低可在 11 GB 显存上运行。
推荐理由:Hugging Face 官方给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,可据此在 11 GB 显存上复现。
Hugging Face 博客"AI for Game Development"系列第 3 天聚焦 3D 资产生成,结论是 text-to-3D 目前还无法实际用于游戏开发。
Mask2Former 和 OneFormer 两款图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 统一了实例、语义和全景分割三种任务,但需分别训练;OneFormer 仅需在全景数据集上训练一次即可在三种任务上达到 SOTA,精度更高但因额外文本编码器延迟更大。作者已发布 30 个基于不同数据集训练的 checkpoint。
Hugging Face 发布教程,演示如何用 🤗 Transformers 和 Datasets 库构建图像相似度检索系统。方案采用 ViT 模型(nateraw/vit-base-beans)提取图像嵌入向量,再用余弦相似度匹配查询图像与候选图像,示例使用 Beans 数据集,也可替换为 Swin Transformer、ConvNeXT、RegNet 等视觉模型。
Hugging Face 博客开启"AI for Game Development"系列,演示 5 天内用 AI 工具做出完整农场游戏。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型基于冻结的 CLIP 加 Transformer 解码器,在 PhraseCut 数据集(超 34 万条短语)上训练,支持文本或图像作为提示词,输出 352 x 352 像素的粗略分割掩码,可用于机器人感知、图像修复等任务,并可在 Segments.ai 上进一步精修。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。