smolagents 新增视觉支持,可在智能体流程中原生使用 VLM
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 回调在每步把截图写入 ActionStep 的 observation_images。
推荐理由:官方给出两种向智能体传入图像的方式和回调写法,可直接迁移到浏览器自动化等视觉场景。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 回调在每步把截图写入 ActionStep 的 observation_images。
推荐理由:官方给出两种向智能体传入图像的方式和回调写法,可直接迁移到浏览器自动化等视觉场景。
Hugging Face 发布 SmolVLM 家族新成员 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个 base 模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX,并提供 transformers 与 WebGPU 演示。
推荐理由:官方披露了从 2B 缩到 256M 与 500M 的取舍细节,可看到小模型在视觉编码器和 tokenization 上的具体权衡。
Mistral AI 宣布与法新社(AFP)达成全球合作,其 AI 助手 Le Chat 将接入 AFP 新闻专线内容,为用户提供基于可靠信源的回答。Le Chat 将利用 AFP 每日六种语言(法语、英语、西班牙语、葡萄牙语、德语、阿拉伯语)发布的 2300 条新闻专线,覆盖其全球 1700 名记者的报道。该集成将在未来几周内向所有 Le Chat 用户推出。
Hugging Face 推出多语言视觉文档检索嵌入模型 vdr-2b-multi-v1,可直接编码文档页面截图为稠密单向量,无需 OCR、数据抽取或分块。
Google 发布新一代视觉语言模型 PaliGemma 2,沿用 SigLIP 图像编码器并将文本解码器升级为 Gemma 2,提供 3B、10B、28B 三种参数规格,均支持 224x224、448x448、896x896 三种输入分辨率,而上一代 PaliGemma 仅有 3B 版本。
Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方与工具均以 Apache 2.0 协议开源。
推荐理由:官方给出 2B 视觉语言模型的显存占用、吞吐与基准对比,可据此判断端侧多模态部署的可行边界。
BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 存在的判别力不足、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。
Mistral AI 为免费生成式 AI 助手 le Chat 推出一批 beta 功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词流程的智能体。
推荐理由:官方一次性列出 le Chat 的联网搜索、Canvas、文档图像理解与智能体等能力,并给出与主流助手的逐项对比。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开放权重多模态模型,含 123B 多模态解码器和 1B 参数视觉编码器,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重许可,读者可据此判断开源多模态模型与闭源前沿模型的差距。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式数据集精炼(adversarial dataset refinement)方法进行改进。
OpenAI 推出基于 GPT-4o 构建的新多模态审核模型,可更准确地检测有害文本和图像,帮助开发者构建更稳健的审核系统。该模型已用于升级 Moderation API。
Meta 发布 Llama 3.2 系列共十款开放权重模型,包括 5 款多模态视觉模型和 5 款纯文本模型,均已上线 Hugging Face Hub。
推荐理由:Hugging Face 官方给出 Llama 3.2 十款开源权重的规格、基准与端侧运行方式,可据此判断多模态与 1B/3B 小模型的落地路径。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 与 Codestral 输入输出价格均下调 80%,Mistral Large 下调 33%。
推荐理由:官方一次性公布免费额度、全线降价与新模型,可据此比较各档模型的成本与部署选择。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与 128k token 上下文窗口内的多图输入,以 Apache 2.0 许可开源。
推荐理由:官方给出架构、评测协议与多模态基准对比,可据此判断 12B 级开源多模态模型的真实能力边界。
HuggingChat 发布 Community Tools,用户可以把 Hugging Face 上任意公开 Space 变成模型可直接调用的工具,并借此扩展了图像理解、视频生成和文本转语音等多模态能力。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像内容与文本标注。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合黑化与 inpaint 保持文本质量,还可用任意文本合成新样本。初始版本中的同义词替换因耗时过高已被移除。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation),用 Llama-2-Chat-7b 以 1-3 分制对答案打分,在 Docmatix 的 200 张图像子集上评测 MPLUGDocOwl1.5 的零样本表现。
Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。
推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。
Hugging Face 发布 Docmatix 文档视觉问答(DocVQA)数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。
Hugging Face 的 TRL 库现已支持对视觉语言模型(VLM)进行直接偏好优化(DPO),并给出基于 Idefics2-8b 的完整训练教程。示例使用包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset,DPO 实现同时支持 Llava 1.5 和 PaliGemma。文章还测算了 8B 模型全参数训练约需 160GB 显存,需借助量化等技术才能跑通。
微软 6 月发布的 Florence-2 视觉语言模型仅有 0.2B 和 0.7B 两种小尺寸,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。在 DocVQA 数据集上微调七个 epoch 后,验证集 Levenshtein 相似度从 0 提升至 57.0,作者建议用 The Cauldron 进一步微调以获得更强的 VQA 模型。
视觉沟通软件公司 Prezi 加入 Hugging Face Expert Support Program,将更小、更高效的开源模型整合进其 ML 工作流。Prezi 旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM,专家建议在素材检索流程中加入开源 re-ranker 模型,以更低成本、更快速度找到最佳图文素材。
TII 发布 Falcon 2 系列,包含 11B 基础语言模型和具备图像理解能力的 11B VLM,训练数据超过 5000B tokens,主要支持英语并覆盖西班牙语、法语、德语等另外十种语言。
推荐理由:TII 官方给出 Falcon 2 的训练数据、架构与评测对比,可据此判断 11B 小模型在多语言和视觉理解上的位置。
Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,可接受任意文本与图像序列输入并生成文本回复,采用 Apache 2.0 开源许可,已集成进 Transformers。
推荐理由:8B 参数、Apache 2.0 许可并同步开源指令微调数据集,可据此判断社区多模态微调的门槛变化。
Hugging Face 发布视觉语言模型入门指南,梳理其核心架构由图像编码器、嵌入投影器和文本解码器组成,并盘点 LLaVA 1.6、CogVLM、Qwen-VL、Yi-VL-34B 等开源模型。文章还介绍了 Vision Arena、Open VLM Leaderboard 等评测榜单及 MMMU、MMBench 等基准,并演示如何用新版 trl 微调这类模型。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,初版 WebSight-v0.1 包含 823,000 对 HTML 与截图,更新版 WebSight-v0.2 改用真实图片和 Tailwind CSS 并扩展至 200 万样本。
UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。
Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,Azure 是其首个分发合作伙伴。
推荐理由:Mistral 官方给出旗舰模型 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其能力定位与接入方式。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短 10 倍以上,10 秒音频样本生成从 30 秒降至 1 秒,质量损失极小。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 视觉语言模型,相比 A100 实现 2.5 倍加速,相比 H100 实现 1.4 倍加速。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解其能力定位。
GPT-4 被用于深化 Duolingo 的语言学习对话体验,以填补关键的语言学习空白。原文未披露具体功能细节、参数规模或可用性信息。
Be My Eyes 借助 GPT-4 改变视觉无障碍体验。该应用利用 GPT-4 为视障用户提供视觉辅助能力。
Kakao Brain 与 Hugging Face 发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 把 ViT 与 ALIGN 连同训练数据一起开源,读者可据此判断视觉语言模型复现的门槛变化。
Hugging Face 发布指南,介绍 Salesforce Research 的 BLIP-2 视觉语言模型已集成到 Transformers,并演示图像描述、提示图像描述、视觉问答和对话式提示四种用法。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示描述、视觉问答和对话式提示四种用法,附可运行代码。
Hugging Face 发布博客深入解析视觉语言模型的训练方法,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练等五类预训练策略。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 实验该领域最新进展。
Hugging Face 公布其计算机视觉生态现状:Hub 上已支持 8 个核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖图像分类、分割、目标检测、深度估计等,并兼容 ViT、Swin、DETR 及 ConvNeXt、ResNet 等架构。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。
Hugging Face 为 🤗 Datasets 补充了音频和图像数据集的文档,Quickstart 新增端到端加载与处理示例,并引入 to_tf_dataset 函数,可将数据集转换为 tf.data.Dataset 供 TensorFlow 或 Keras 训练。