Hugging Face Blog·· 2023-12-01AI 评分34
Open LLM Leaderboard 深度解析 DROP 基准评分异常
Open LLM Leaderboard: DROP deep dive
AI 导读
Open LLM Leaderboard 新增 DROP 基准后,绝大多数模型 f1-score 低于 10 分。Hugging Face 排查发现,归一化步骤会忽略后接非空格空白符的数字答案,且以 . 作为停止词会截断浮点答案、让长回答的高质量模型 f1 更低。改用 \n 作为停止词重新计算后,分数与模型整体表现的相关性明显改善。
来源:Hugging Face Blog · huggingface.co