跳到正文

#图像生成

今日 0 条
1月15日周一
1月14日周日
1月4日周四
1月2日周二
11月9日周四
10月24日周二
10月3日周二
10月2日周一
9月29日周五
9月18日周一
9月13日周三
  1. Hugging Face Blog62

    Hugging Face 发布 Würstchen:面向图像生成的快速扩散模型

    Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。

    推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。

9月8日周五
  1. Hugging Face Blog62

    Hugging Face 为 SDXL 带来 T2I-Adapter 支持

    Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。

    推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。

8月1日周二
7月27日周四
  1. Hugging Face Blog62

    Hugging Face 与 Apple 用混合位宽量化把 Stable Diffusion XL 搬上 Mac Core ML

    Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。

    推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。

7月20日周四
7月14日周五
6月26日周一
  1. Hugging Face Blog22

    Hugging Face 通讯第4期:文本到图像模型中的偏见

    Hugging Face 发布 Ethics and Society Newsletter 第4期,聚焦文本到图像模型的偏见问题。文章梳理了训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等偏见来源,并指出 Stable Diffusion 和 Dall-E 2 等模型存在多样性不足与刻板印象。文中还介绍了 Stable Bias 项目用于探索和比较偏见的工具。

6月15日周四
  1. Hugging Face Blog62

    用 Core ML 在 iPhone、iPad 和 Mac 上加速 Stable Diffusion

    Hugging Face 介绍了借助 Core ML 新优化在 iPhone、iPad 和 Mac 上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,将权重从 16-bit 浮点压到每参数 6 bit,并在推理时逐层解压以节省内存。

    推荐理由:Hugging Face 与 Apple 官方给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 压到端侧运行。

5月25日周四
5月23日周二
4月26日周三
3月28日周二
3月24日周五
  1. Hugging Face Blog62

    用 diffusers 训练自己的 ControlNet

    Hugging Face 发布教程,介绍如何用 diffusers 训练 ControlNet,并以基于 FaceSynthetics 数据集的人脸姿态模型 Uncanny Faces 为例完整走了一遍流程。

    推荐理由:完整走了一遍从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。

3月3日周五
2月24日周五
2月15日周三
  1. Hugging Face Blog62

    用 BLIP-2 实现零样本图像到文本生成

    Hugging Face 发布指南,介绍 Salesforce Research 的 BLIP-2 视觉语言模型已集成到 Transformers,并演示图像描述、提示图像描述、视觉问答和对话式提示四种用法。

    推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示描述、视觉问答和对话式提示四种用法,附可运行代码。

1月26日周四
1月20日周五
1月19日周四
  1. Hugging Face Blog40

    Hugging Face transformers 集成 Mask2Former 与 OneFormer,统一图像分割

    Mask2Former 和 OneFormer 两款图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 统一了实例、语义和全景分割三种任务,但需分别训练;OneFormer 仅需在全景数据集上训练一次即可在三种任务上达到 SOTA,精度更高但因额外文本编码器延迟更大。作者已发布 30 个基于不同数据集训练的 checkpoint。

1月16日周一
1月2日周一
12月21日周三
  1. Hugging Face Blog40

    使用 CLIPSeg 进行零样本图像分割

    Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型基于冻结的 CLIP 加 Transformer 解码器,在 PhraseCut 数据集(超 34 万条短语)上训练,支持文本或图像作为提示词,输出 352 x 352 像素的粗略分割掩码,可用于机器人感知、图像修复等任务,并可在 Segments.ai 上进一步精修。

12月16日周五
12月1日周四
  1. Hugging Face Blog62

    如何在 Apple Silicon 上用 Core ML 运行 Stable Diffusion

    借助 Apple 工程师提供的转换脚本和推理代码,Stable Diffusion 现在可以在 Apple Silicon 上通过 Core ML 运行,Hugging Face 已把 Stable Diffusion v1.4、v1.5、v2 base 和 v2.1 base 的权重转换好并放到 Hugging Face Hub。

    推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程,含模型变体选择与实测耗时。

11月30日周三
  1. Hugging Face Blog32

    VQ-Diffusion:基于离散隐空间的扩散模型

    中国科学技术大学与微软提出 VQ-Diffusion,一种在量化隐空间上进行加噪与去噪的条件扩散模型,隐空间由离散向量集合构成。该模型使用冻结的 VQ-VAE 编码图像,并用 CLIP 文本编码器加解码器 Transformer 预测去噪隐变量分布。用户可通过 🧨 Diffusers 用几行代码加载 microsoft/vq-diffusion-ithq 并运行推理。

11月25日周五
11月7日周一
11月3日周四
  1. OpenAI News62

    OpenAI 的 DALL·E API 进入公开测试

    OpenAI 宣布 DALL·E API 即日起开放公开测试,开发者可以开始用它构建应用。原文未披露具体定价、调用限制或可用模型版本。

    推荐理由:OpenAI 官方开放 DALL·E API 公测,开发者可据此判断图像生成能力接入自家应用的门槛变化。