跳到正文

#多模态

今日 0 条
1月24日周五
  1. Hugging Face Blog62

    smolagents 新增视觉支持,可在智能体流程中原生使用 VLM

    Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 回调在每步把截图写入 ActionStep 的 observation_images。

    推荐理由:官方给出两种向智能体传入图像的方式和回调写法,可直接迁移到浏览器自动化等视觉场景。

1月23日周四
  1. Hugging Face Blog60

    Hugging Face 发布 SmolVLM-256M 与 SmolVLM-500M 两个小尺寸视觉语言模型

    Hugging Face 发布 SmolVLM 家族新成员 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个 base 模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX,并提供 transformers 与 WebGPU 演示。

    推荐理由:官方披露了从 2B 缩到 256M 与 500M 的取舍细节,可看到小模型在视觉编码器和 tokenization 上的具体权衡。

1月16日周四
  1. Mistral AI42

    Mistral AI 与法新社达成全球合作,Le Chat 接入 AFP 新闻内容

    Mistral AI 宣布与法新社(AFP)达成全球合作,其 AI 助手 Le Chat 将接入 AFP 新闻专线内容,为用户提供基于可靠信源的回答。Le Chat 将利用 AFP 每日六种语言(法语、英语、西班牙语、葡萄牙语、德语、阿拉伯语)发布的 2300 条新闻专线,覆盖其全球 1700 名记者的报道。该集成将在未来几周内向所有 Le Chat 用户推出。

1月10日周五
12月5日周四
11月26日周二
  1. Hugging Face Blog62

    Hugging Face 发布 SmolVLM:2B 视觉语言模型,显存占用为同类最低

    Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方与工具均以 Apache 2.0 协议开源。

    推荐理由:官方给出 2B 视觉语言模型的显存占用、吞吐与基准对比,可据此判断端侧多模态部署的可行边界。

11月20日周三
  1. Hugging Face Blog40

    BAAI 推出 FlagEval Debate:首个多语言 LLM 辩论竞赛平台

    BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 存在的判别力不足、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。

11月18日周一
  1. Mistral AI66

    Mistral AI 为 le Chat 加入联网搜索、Canvas 与图像生成等测试功能

    Mistral AI 为免费生成式 AI 助手 le Chat 推出一批 beta 功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词流程的智能体。

    推荐理由:官方一次性列出 le Chat 的联网搜索、Canvas、文档图像理解与智能体等能力,并给出与主流助手的逐项对比。

  2. Mistral AI75

    Mistral AI 发布 124B 开源多模态模型 Pixtral Large

    Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开放权重多模态模型,含 123B 多模态解码器和 1B 参数视觉编码器,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。

    推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重许可,读者可据此判断开源多模态模型与闭源前沿模型的差距。

10月23日周三
9月26日周四
9月25日周三
9月17日周二
  1. Mistral AI72

    Mistral AI 发布 Pixtral 12B 多模态模型

    Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与 128k token 上下文窗口内的多图输入,以 Apache 2.0 许可开源。

    推荐理由:官方给出架构、评测协议与多模态基准对比,可据此判断 12B 级开源多模态模型的真实能力边界。

9月16日周一
8月6日周二
  1. Hugging Face Blog32

    Hugging Face 联合 Albumentations AI 推出文档图像 TextImage 数据增强

    Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像内容与文本标注。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合黑化与 inpaint 保持文本质量,还可用任意文本合成新样本。初始版本中的同义词替换因耗时过高已被移除。

7月25日周四
7月24日周三
  1. Mistral AI78

    Mistral AI 发布 Mistral Large 2,123B 参数支持 128k 上下文

    Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。

    推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。

7月18日周四
7月10日周三
  1. Hugging Face Blog34

    Hugging Face TRL 库新增 VLM 的 DPO 偏好优化支持

    Hugging Face 的 TRL 库现已支持对视觉语言模型(VLM)进行直接偏好优化(DPO),并给出基于 Idefics2-8b 的完整训练教程。示例使用包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset,DPO 实现同时支持 Llava 1.5 和 PaliGemma。文章还测算了 8B 模型全参数训练约需 160GB 显存,需借助量化等技术才能跑通。

6月24日周一
  1. Hugging Face Blog36

    微调 Florence-2:微软的前沿视觉语言模型

    微软 6 月发布的 Florence-2 视觉语言模型仅有 0.2B 和 0.7B 两种小尺寸,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。在 DocVQA 数据集上微调七个 epoch 后,验证集 Levenshtein 相似度从 0 提升至 57.0,作者建议用 The Cauldron 进一步微调以获得更强的 VQA 模型。

6月19日周三
5月24日周五
  1. Hugging Face Blog62

    TII 发布 Falcon 2:11B 参数预训练语言模型与 VLM,训练数据超 5000B tokens、支持 11 种语言

    TII 发布 Falcon 2 系列,包含 11B 基础语言模型和具备图像理解能力的 11B VLM,训练数据超过 5000B tokens,主要支持英语并覆盖西班牙语、法语、德语等另外十种语言。

    推荐理由:TII 官方给出 Falcon 2 的训练数据、架构与评测对比,可据此判断 11B 小模型在多语言和视觉理解上的位置。

5月14日周二
  1. Hugging Face Blog62

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。

4月15日周一
4月11日周四
  1. Hugging Face Blog38

    Hugging Face 详解视觉语言模型:架构、开源模型与微调方法

    Hugging Face 发布视觉语言模型入门指南,梳理其核心架构由图像编码器、嵌入投影器和文本解码器组成,并盘点 LLaVA 1.6、CogVLM、Qwen-VL、Yi-VL-34B 等开源模型。文章还介绍了 Vision Arena、Open VLM Leaderboard 等评测榜单及 MMMU、MMBench 等基准,并演示如何用新版 trl 微调这类模型。

3月15日周五
3月5日周二
  1. Hugging Face Blog27

    UCLA 团队发布 ConTextual:多模态模型在文本密集场景中的图文联合推理评测基准

    UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。

2月26日周一
8月30日周三
6月29日周四
3月14日周二
  1. OpenAI News93

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。

    推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解其能力定位。

3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 联合 Hugging Face 开源 ViT 与 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 把 ViT 与 ALIGN 连同训练数据一起开源,读者可据此判断视觉语言模型复现的门槛变化。

2月15日周三
  1. Hugging Face Blog62

    用 BLIP-2 实现零样本图像到文本生成

    Hugging Face 发布指南,介绍 Salesforce Research 的 BLIP-2 视觉语言模型已集成到 Transformers,并演示图像描述、提示图像描述、视觉问答和对话式提示四种用法。

    推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示描述、视觉问答和对话式提示四种用法,附可运行代码。

2月3日周五
1月30日周一
11月21日周一
7月28日周四