Hugging Face Blog·· 2025-04-11AI 评分40
Visual Salamandra 发布:将 7B 多语言 LLM 扩展至图像与视频
Visual Salamandra: Pushing the Boundaries of Multimodal Understanding
AI 导读
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra Instructed 7B 大语言模型扩展至图像和视频多模态任务,集成 Google SigLIP-So400m 编码器与 2 层 MLP 投影器,采用四阶段训练,使用 610 万条指令微调样本(含 84.2 万条纯文本)。
来源:Hugging Face Blog · huggingface.co