跳到正文
原文
Hugging Face Blog·· 2025-04-11AI 评分40

Visual Salamandra 发布:将 7B 多语言 LLM 扩展至图像与视频

Visual Salamandra: Pushing the Boundaries of Multimodal Understanding

AI 导读

Language Technologies Lab 发布 Visual Salamandra,将 Salamandra Instructed 7B 大语言模型扩展至图像和视频多模态任务,集成 Google SigLIP-So400m 编码器与 2 层 MLP 投影器,采用四阶段训练,使用 610 万条指令微调样本(含 84.2 万条纯文本)。

来源:Hugging Face Blog · huggingface.co