跳到正文

#图像生成

今日 0 条
6月6日周四
2月26日周一
  1. Hugging Face Blog36

    Hugging Face:AI 水印工具与技术入门指南

    Hugging Face 发文梳理 AI 生成内容的水印方案,区分生成时嵌入与生成后添加两类方法,并盘点 Hub 上的相关工具。文中提到 Glaze、Photoguard 可微调图像干扰 AI 处理,Nightshade、Fawkes 则通过"投毒"破坏训练假设;Truepic 按 C2PA 标准嵌入元数据,IMATAG 采用水印器与检测器闭源、调用代码开源的混合模式。

2月3日周六
1月15日周一
1月14日周日
1月4日周四
1月2日周二
11月9日周四
10月24日周二
10月3日周二
10月2日周一
9月29日周五
9月18日周一
9月13日周三
  1. Hugging Face Blog62

    Hugging Face 发布 Würstchen:面向图像生成的快速扩散模型

    Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。

    推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。

9月8日周五
  1. Hugging Face Blog62

    Hugging Face 为 SDXL 带来 T2I-Adapter 支持

    Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。

    推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。

8月9日周三
8月1日周二
7月27日周四
  1. Hugging Face Blog62

    Hugging Face 与 Apple 用混合位宽量化把 Stable Diffusion XL 搬上 Mac Core ML

    Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。

    推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。

7月20日周四
7月14日周五
6月26日周一
  1. Hugging Face Blog22

    Hugging Face 通讯第4期:文本到图像模型中的偏见

    Hugging Face 发布 Ethics and Society Newsletter 第4期,聚焦文本到图像模型的偏见问题。文章梳理了训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等偏见来源,并指出 Stable Diffusion 和 Dall-E 2 等模型存在多样性不足与刻板印象。文中还介绍了 Stable Bias 项目用于探索和比较偏见的工具。

6月15日周四
  1. Hugging Face Blog62

    用 Core ML 在 iPhone、iPad 和 Mac 上加速 Stable Diffusion

    Hugging Face 介绍了借助 Core ML 新优化在 iPhone、iPad 和 Mac 上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,将权重从 16-bit 浮点压到每参数 6 bit,并在推理时逐层解压以节省内存。

    推荐理由:Hugging Face 与 Apple 官方给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 压到端侧运行。

5月25日周四
5月23日周二
4月26日周三
3月28日周二
3月24日周五
  1. Hugging Face Blog62

    用 diffusers 训练自己的 ControlNet

    Hugging Face 发布教程,介绍如何用 diffusers 训练 ControlNet,并以基于 FaceSynthetics 数据集的人脸姿态模型 Uncanny Faces 为例完整走了一遍流程。

    推荐理由:完整走了一遍从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。

3月3日周五
2月24日周五
2月15日周三
  1. Hugging Face Blog62

    用 BLIP-2 实现零样本图像到文本生成

    Hugging Face 发布指南,介绍 Salesforce Research 的 BLIP-2 视觉语言模型已集成到 Transformers,并演示图像描述、提示图像描述、视觉问答和对话式提示四种用法。

    推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示描述、视觉问答和对话式提示四种用法,附可运行代码。

1月26日周四
1月20日周五
1月19日周四
  1. Hugging Face Blog40

    Hugging Face transformers 集成 Mask2Former 与 OneFormer,统一图像分割

    Mask2Former 和 OneFormer 两款图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 统一了实例、语义和全景分割三种任务,但需分别训练;OneFormer 仅需在全景数据集上训练一次即可在三种任务上达到 SOTA,精度更高但因额外文本编码器延迟更大。作者已发布 30 个基于不同数据集训练的 checkpoint。

1月16日周一
1月2日周一
12月21日周三
  1. Hugging Face Blog40

    使用 CLIPSeg 进行零样本图像分割

    Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型基于冻结的 CLIP 加 Transformer 解码器,在 PhraseCut 数据集(超 34 万条短语)上训练,支持文本或图像作为提示词,输出 352 x 352 像素的粗略分割掩码,可用于机器人感知、图像修复等任务,并可在 Segments.ai 上进一步精修。

12月16日周五