跳到正文
原文
Hugging Face Blog·· 2025-04-16AI 评分37

HELMET:全面评估长上下文语言模型的基准发布

Introducing HELMET: Holistically Evaluating Long-context Language Models

AI 导读

普林斯顿团队发布 HELMET 长上下文语言模型评测基准,已评估 59 个近期 LCLM,并将在 ICLR 2025 展示。该基准针对现有评测过度依赖 NIAH 等合成任务、与实际下游表现相关性差的问题,从多样性、可控性和可靠性三方面改进。

来源:Hugging Face Blog · huggingface.co