Hugging Face Blog·· 2024-04-11AI 评分38
Hugging Face 详解视觉语言模型:架构、开源模型与微调方法
Vision Language Models Explained
AI 导读
Hugging Face 发布视觉语言模型入门指南,梳理其核心架构由图像编码器、嵌入投影器和文本解码器组成,并盘点 LLaVA 1.6、CogVLM、Qwen-VL、Yi-VL-34B 等开源模型。文章还介绍了 Vision Arena、Open VLM Leaderboard 等评测榜单及 MMMU、MMBench 等基准,并演示如何用新版 trl 微调这类模型。
来源:Hugging Face Blog · huggingface.co