跳到正文
原文
Hugging Face Blog·· 2024-03-05AI 评分27

UCLA 团队发布 ConTextual:多模态模型在文本密集场景中的图文联合推理评测基准

Introducing ConTextual: How well can your Multimodal model jointly reason over text and image in text-rich scenes?

AI 导读

UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。

来源:Hugging Face Blog · huggingface.co