OpenAI 发布 Point-E:从复杂提示词生成 3D 点云
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
借助 Apple 工程师提供的转换脚本和推理代码,Stable Diffusion 现在可以在 Apple Silicon 上通过 Core ML 运行,Hugging Face 已把 Stable Diffusion v1.4、v1.5、v2 base 和 v2.1 base 的权重转换好并放到 Hugging Face Hub。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程,含模型变体选择与实测耗时。
中国科学技术大学与微软提出 VQ-Diffusion,一种在量化隐空间上进行加噪与去噪的条件扩散模型,隐空间由离散向量集合构成。该模型使用冻结的 VQ-VAE 编码图像,并用 CLIP 文本编码器加解码器 Transformer 预测去噪隐变量分布。用户可通过 🧨 Diffusers 用几行代码加载 microsoft/vq-diffusion-ithq 并运行推理。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日免费发布,讲解扩散模型的理论与应用。配合课程上线,11 月 30 日将举办社区直播活动,Stable Diffusion 创作者、Stability AI 与 Meta 的研究者等将带来演讲。
Hugging Face 团队用 Diffusers 的 Dreambooth 训练脚本做了多组对照实验,总结出微调 Stable Diffusion 的推荐设置。
推荐理由:基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。
OpenAI 宣布 DALL·E API 即日起开放公开测试,开发者可以开始用它构建应用。原文未披露具体定价、调用限制或可用模型版本。
推荐理由:OpenAI 官方开放 DALL·E API 公测,开发者可据此判断图像生成能力接入自家应用的门槛变化。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上运行 Stable Diffusion 推理。
推荐理由:官方教程给出在 TPU 上并行跑 Stable Diffusion 的完整代码路径,可迁移到自己的推理部署。
rinna 通过微调 Stable Diffusion 开发出日语专用文本生成图像模型 Japanese Stable Diffusion,可理解日语特有词汇、拟声词与专有名词,并生成体现日本文化的图像。
OpenAI 宣布 DALL·E 不再需要等待名单,新用户可以直接开始创作。官方表示,部署中积累的经验以及对安全系统的改进,使更广泛的开放成为可能。
推荐理由:OpenAI 官方说明 DALL·E 取消等待名单,并交代安全系统改进是放开可用性的前提。
Hugging Face AutoTrain 新增图像分类任务,用户无需编写代码即可上传数据训练模型。AutoTrain 会自动尝试多个模型架构并筛选最优结果,示例中最佳模型达到 84% 准确率,使用 5 个候选模型且图片少于 500 张时可免费训练。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性 inpainting 等 pipeline。优化后 Stable Diffusion 显存占用降至 3.2GB,代价是约 10% 的速度损失,并可通过 mps 在 M1/M2 设备上推理。该版本还提供实验性 ONNX 导出与 pipeline、首版文档,社区已分享超过 200 个文本反转概念。
推荐理由:官方一次性列出 diffusers 0.3 的图生图、文本反转、小显存优化与 Mac 支持,便于判断扩散模型工具链的可用边界。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion,并解释其潜空间扩散模型的工作原理。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 Diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。
Hugging Face 与 Graphcore 联合发布 Optimum Graphcore 库,提供预训练 ViT 模型检查点和配置文件,可在 IPU 上直接微调。博文以 ImageNet-21k 预训练的 ViT 为例,演示在 ChestX-ray14 数据集上的完整微调流程,并附有 notebook。IPU 的 MIMD 架构与流水线并行可提升训练效率。
Hugging Face 与外部贡献者为 Transformers 加入了 Vision Transformer、Masked Autoencoders、RegNet、ConvNeXt 等 TensorFlow 视觉模型,并演示如何用 TensorFlow Serving 在本地部署 ViT 图像分类模型,将其暴露为 REST 或 gRPC 端点。
OpenAI 宣布 DALL·E 进入测试版,将在未来几周从候补名单中邀请 100 万人使用。用户可用每月重置的免费积分生成图像,也可按 115 次生成 15 美元的价格购买额外积分。
推荐理由:OpenAI 公布 DALL·E 测试版开放规模与积分定价,可据此了解早期图像生成产品的使用门槛。
OpenAI 为 DALL·E 2 部署了一项新技术,使其生成的人物图像能更准确地反映世界人口的多样性,以减少偏见并提升安全性。
OpenAI 公布 DALL·E 2 研究预览进展,来自 118 个以上国家的 3000 多名艺术家已将 DALL·E 纳入自己的创作流程。OpenAI 表示,早期访问组的艺术家帮助发现了 DALL·E 的新用途,并在其决定 DALL·E 功能时提供了关键意见。
推荐理由:官方披露 DALL·E 2 研究预览的艺术家使用规模,可了解早期创作者如何把它接入创作流程。
为向更广泛受众开放 DALL·E 2,OpenAI 在预训练阶段采取缓解措施,以降低强大图像生成模型带来的风险。为此,OpenAI 设置了多种防护栏,防止生成图像违反其内容政策。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:从 DDPM 论文出发逐步用 PyTorch 复现扩散模型,读者可据此理解前向加噪与反向去噪的完整训练流程。
OpenAI 更新 DALL·E 2 研究预览进展,早期用户迄今已生成超过 300 万张图像,并帮助改进了安全流程。OpenAI 表示将开始每周从候补名单中新增最多 1000 名用户。
推荐理由:官方披露 DALL·E 2 研究预览的早期使用规模与每周放量节奏,可了解其安全流程的迭代方式。
Hugging Face 发布教程,演示如何用自建人行道数据集 segments/sidewalk-semantic 微调 SegFormer 语义分割模型,借助 transformers 与 SegformerImageProcessor 完成训练。
Hugging Face 的 🤗 datasets 库新增图像特征类型,可结合 sentence_transformers 与 faiss 为图像数据集建立相似度索引,实现图像搜索。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接读取含 image 和 label 特征的 10000 行数据,label 对应书籍出版年份。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练 ViT 模型。教程使用 google/vit-base-patch16-224-in21k 及其配套 ViTImageProcessor,将图像切分为 patch 并嵌入为 token 序列后送入 Transformer 训练。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 官方公布 DALL·E,说明其可由自然语言描述生成图像,是文生图方向的早期节点。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一套模型在像素序列上训练后也能生成连贯的图像补全与样本。研究通过建立样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所包含的特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一套 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 提出可逆生成模型 Glow,采用可逆 1x1 卷积,在简化架构的同时扩展了此前的可逆生成模型工作。该模型能生成逼真的高分辨率图像,支持高效采样,并可发现用于操控数据属性的特征。OpenAI 已发布模型代码和在线可视化工具。
OpenAI 造出可从不同尺度和视角稳定欺骗神经网络分类器的对抗图像,直接挑战上周"自动驾驶汽车因多尺度、多角度采集图像而难以被恶意欺骗"的说法。