Hugging Face 将 Perceiver IO 加入 Transformers,支持任意模态
Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。
推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。
推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。
OpenAI 在 CLIP 中发现了一类神经元,无论概念以字面、符号还是概念化方式呈现,它们都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的视觉变体,也是理解 CLIP 及同类模型所学关联与偏见的重要一步。
推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念三种呈现方式响应的神经元,为理解多模态模型的关联与偏见提供线索。
OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 官方介绍 CLIP 用自然语言监督学习视觉概念,可零样本迁移到任意分类基准。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 官方公布 DALL·E,说明其可由自然语言描述生成图像,是文生图方向的早期节点。