Artificial Analysis 发布文生图排行榜与竞技场
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和对比阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评估。模型经 HuggingFace Inference Endpoints 部署,由 lighteval 库通过 API 请求完成评测。
Artificial Analysis 开发的 LLM Performance Leaderboard 现已上线 Hugging Face,覆盖超过 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此 Hugging Face 与 .txt 合作,尝试用结构化生成库 Outlines 约束模型输出,以降低提示词格式带来的评测方差。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示下的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等多项选择题任务,采用 Classic 与 Reflect 两种提示策略生成推理链,并称对训练数据污染更具鲁棒性。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 的医学与生物学子集。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估窗口检测并防止数据污染。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试诱导其泄露虚构银行 XYZ001 客户的敏感财务信息,再投票选出隐私保护更强的模型。
UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后对比两个 TTS 模型的合成语音并投票选出更自然的一方,结果汇入公开排行榜。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,用真实人类越狱提示词测试前沿模型的抗攻击能力,最终得分由 LlamaGuard 与 GPT-4 判定为 Safe 的提示词百分比构成。
Upstage 于 2023 年 9 月发起 Open Ko-LLM Leaderboard,用于评测韩语大语言模型,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA 和 Ko-CommonGEN V2 五项任务,并新建私有测试集以防止数据污染。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类别评估 LLM 推理能力。
Patronus 团队与 Hugging Face 合作,基于 Hugging Face Leaderboard Template 推出 Enterprise Scenarios Leaderboard,用于评测语言模型在真实企业用例中的表现。
Hugging Face 发布 Hallucinations Leaderboard,基于 EleutherAI Language Model Evaluation Harness 对多种 LLM 进行幻觉相关基准评测,覆盖闭卷问答、摘要、阅读理解、指令遵循、事实核查等任务,并已发布相关论文。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 评估框架对 LLM 安全性进行评测,该框架曾获 NeurIPS 2023 杰出论文奖。
Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。
推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。
Vectara 基于 Hugging Face 开源的排行榜模板,发布了新的 HHEM 幻觉排行榜,用于评估 GPT-4、Gemini、Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜通过 requests 和 results 两个数据集管理模型评测请求与结果,并支持动态更新和社区提交新模型。Vectara 还公开了定制后的后端源码,可部署为 Hugging Face Space。
Open LLM Leaderboard 新增 DROP 基准后,绝大多数模型 f1-score 低于 10 分。Hugging Face 排查发现,归一化步骤会忽略后接非空格空白符的数字答案,且以 . 作为停止词会截断浮点答案、让长回答的高质量模型 f1 更低。改用 \n 作为停止词重新计算后,分数与模型整体表现的相关性明显改善。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、1/5/10/20 并发请求及 GPTQ 4-bit 量化。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并解析了评测中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。
Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何显著低于 LLaMA 论文报告值:榜单基于 EleutherAI LM Evaluation Harness,而 LLaMA 团队用的是 UC Berkeley 原始实现,Stanford HELM 又是第三种实现。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了人类标注与 GPT-4 对开源模型输出的偏好评分。
Hugging Face 用 Optimum Habana 在 BERT 预训练、Stable Diffusion 推理和 T5-3B 微调上对比了 Habana Gaudi2、初代 Gaudi 与 Nvidia A100 80GB,Gaudi2 训练和推理速度约为 A100 80GB 的两倍。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),覆盖 8 类任务、56 个数据集、最多 112 种语言,排行榜已汇总超 2000 条结果。该基准通过 pip install mteb 即可对任意嵌入模型评测,并将结果提交至公开排行榜,方便按速度、性能与嵌入维度筛选模型。
Hugging Face 在 Evaluation on the Hub 上线零样本分类评估功能,由 AutoTrain 驱动,无需写代码即可评估 Hub 上的任意因果语言模型,目前支持最大 66B 参数模型。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并汇总到数据集排行榜,官方已用该工具评测了数百个模型。工具已嵌入现有生态,评测提交界面和排行榜都是 Hugging Face Spaces,用户可从数据集页面发起评测。
推荐理由:官方说明可在 Hub 上零代码评测任意模型与数据集,并给出结果写入模型卡与排行榜的完整流程。
OpenAI Five 在基准测试中以三局两胜击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家队伍,其中四人有过职业 Dota 经历。比赛在直播观众面前进行,同时在线观看人数达 10 万。
推荐理由:OpenAI Five 在公开直播中三局两胜击败 99.95 百分位人类队伍,可据此了解当时 AI 在复杂实时游戏中的表现边界。
OpenAI Five Benchmark 比赛已结束。OpenAI 公布了这场 Dota 2 人机对抗基准赛的结果。