Graphite 研究:Claude Opus 5.5 最爱说“this matters”,GPT 模型写作习惯反而离人类越来越远
Graphite 研究发现 Claude Opus 5.5 的写作标志是“dependable”一词,出现频率是人类样本的 23 倍,“this matters”更是高出 116 倍;OpenAI 的 Astra 则偏爱“not simply X”式纠正性框架,出现频率超人类 100 倍。
Graphite 研究发现 Claude Opus 5.5 的写作标志是“dependable”一词,出现频率是人类样本的 23 倍,“this matters”更是高出 116 倍;OpenAI 的 Astra 则偏爱“not simply X”式纠正性框架,出现频率超人类 100 倍。
Mercor 的一项研究让 12 名平均 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准且成本更低。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM、16 个基准、超 34K 道题的测试结果训练,在未被告知基准对应能力的情况下自行恢复出安全与通用推理两个主导维度。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个印度语言。
Hugging Face 发布研究,用共识分歧、掩码实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
微软研究院发布 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,但前者按任务检索少量高支持度 guideline,而非每步注入完整 playbook。
Hume 发布 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个专有与开源语音模型、15 个以上评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 与语音理解。
推荐理由:Hume 公开了语音 AI 人类质量评测基准的规模与关键发现,读者可据此理解现有基准为何高估真实表现。
Hugging Face 发布开源基准 ScarfBench,用于评测 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。评测显示最强智能体行为成功率不足 10%,Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。
Hugging Face 与 Treble Technologies 发布首个开放、社区驱动的远场 ASR 基准 FFASR Leaderboard,覆盖 14 个模拟房间,并设有 Lab Measured 与 Lab Simulated 的 sim-to-real 验证轨道。
Hugging Face 发布 QIMMA(阿拉伯语"顶峰"),一个先验证基准质量再评测模型的开源阿拉伯语 LLM 排行榜。QIMMA 整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌与编程 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评测 AI 智能体的组合推理与多步工作流执行能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域并配有领域文档,任务需 3-7 步推理链,包含 API Chaining、Tool Selection、Multi-Hop Reasoning 等四项任务,模型整体表现不佳。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。
Google Research 发布研究《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,指出 AI 评测常用的每项 1-5 名标注者往往不足,要反映人类意见差异常需每项超过 10 名标注者。
Hugging Face 发布端到端语音智能体评估框架 EVA,首次同时打分任务成功率(EVA-A)与对话体验(EVA-X),并开源含 50 个航司场景的数据集。对 20 个级联与音频原生系统的基准测试显示,准确率与体验之间存在一致的权衡:任务完成得好的智能体,用户体验往往更差。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用 10 项认知能力(感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知)衡量 AI 向 AGI 的进展,并配套三阶段评估协议。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由国际专家小组按六项指标盲评打分。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析了 310 条 ITBench SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞,覆盖发现、修复与攻击三类任务。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3513 个公开样例,另设私有留出集。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评估嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,部分模型在私有集上出现明显性能下滑。
Hugging Face 发布 GAIA 的后继智能体基准 Gaia2,并开源配套的 Meta Agents Research Environments(ARE)框架,用于运行、调试和评测智能体。
推荐理由:GAIA 后继基准 Gaia2 转向读写与噪声环境,配套 ARE 框架可复现评测,便于对照各家模型在真实任务上的差距。
Hugging Face 推出 TextQuests 基准,基于 25 款经典 Infocom 交互式文字游戏,测试 LLM 作为智能体的长上下文推理与探索学习能力。
Hugging Face 发布 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种菲律宾语言,包含文化知识、经典 NLP、阅读理解、生成四大类共 12 项任务,并基于 Lighteval 构建。
Hugging Face 推出 3LM(علم),一个专门评测阿拉伯语 LLM 在 STEM 与代码生成上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成高难度选择题,以及翻译成阿拉伯语的 HumanEval+ 与 MBPP+ 代码任务。
Hugging Face 开源长视频理解基准 TimeScope,将 5-10 秒的"针"片段插入 1 分钟至 8 小时的视频中,考察定位检索、信息综合与细粒度时序感知三项能力。测试显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频任务上仍表现吃力,性能随视频变长明显下滑。
Hugging Face 发布 FutureBench,用真实预测市场与新闻生成任务评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,同时接入 Polymarket 每周约 8 个问题,答案可随时间客观验证,且从设计上杜绝数据污染。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,面向 LLM 早期训练阶段(约 200B tokens 以内)构建科学知识领域的评测基准,参赛者需基于 lm-evaluation-harness 通过 Hugging Face Space 提交方案。
Hugging Face 发布 ScreenSuite,称其为面向 GUI 智能体的最全面评测套件,统一整合了 13 个基准,覆盖感知与定位、单步动作、多步智能体三类能力。
Hugging Face 在 Open LLM Leaderboard 中新增模型推理的 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据。分析覆盖 Gemma、Llama、Mistral、Mixtral、Phi、Qwen2 等 2742 个模型,发现社区微调或合并模型通常比其官方基座模型更低碳,而部分 MoE 模型因推理时间过长导致排放高于预期。
Artificial Analysis 发布 Big Bench Audio 评测数据集,用于评估音频语言模型的推理能力,该数据集将 Big Bench Hard 的 1000 道题改编为音频形式。
Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与榜单,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度基于 LLM-as-judge 打分。榜单采用动态评测策略,数据集与评测代码先盲测三个月再公开,随后更换新私有基准,以缓解数据污染。该基准同时覆盖多轮与单轮场景,是这一语言无关评测框架的首次应用。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式运行。该榜单整合超 20 个数据集,由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译调整,旨在为日语 LLM 提供集中、开放的对比平台。
BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 存在的判别力不足、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。
Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。