跳到正文

#多模态

今日 0 条
9月25日周一
8月30日周三
8月22日周二
  1. Hugging Face Blog66

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,复现 DeepMind 未公开的 Flamingo,接受任意图像与文本序列输入并生成文本。模型提供 9B 和 80B 两个参数规模,各有基础版和指令微调版,仅基于公开数据与模型(LLaMA v1、OpenCLIP)构建。

    推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可了解其数据构成与开放程度。

6月29日周四
3月14日周二
  1. OpenAI News93

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。

    推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解其能力定位。

3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 联合 Hugging Face 开源 ViT 与 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 把 ViT 与 ALIGN 连同训练数据一起开源,读者可据此判断视觉语言模型复现的门槛变化。

2月15日周三
  1. Hugging Face Blog62

    用 BLIP-2 实现零样本图像到文本生成

    Hugging Face 发布指南,介绍 Salesforce Research 的 BLIP-2 视觉语言模型已集成到 Transformers,并演示图像描述、提示图像描述、视觉问答和对话式提示四种用法。

    推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示描述、视觉问答和对话式提示四种用法,附可运行代码。

2月3日周五
1月30日周一
11月21日周一
7月28日周四
5月19日周四
  1. Hugging Face Blog18

    Hugging Face 多模态团队发布研究伦理章程,将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息,以及在医疗、法律、金融、移民等高风险领域的不谨慎使用。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间可能存在冲突,需逐案权衡。

12月15日周三
  1. Hugging Face Blog62

    Hugging Face 将 Perceiver IO 加入 Transformers,支持任意模态

    Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。

    推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。

10月13日周三
3月4日周四
  1. OpenAI News62

    OpenAI 在 CLIP 中发现多模态神经元

    OpenAI 在 CLIP 中发现了一类神经元,无论概念以字面、符号还是概念化方式呈现,它们都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的视觉变体,也是理解 CLIP 及同类模型所学关联与偏见的重要一步。

    推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念三种呈现方式响应的神经元,为理解多模态模型的关联与偏见提供线索。

1月5日周二
  1. OpenAI News82

    OpenAI 发布 CLIP:用自然语言连接文本与图像

    OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:OpenAI 官方介绍 CLIP 用自然语言监督学习视觉概念,可零样本迁移到任意分类基准。