Open ASR Leaderboard 新增首个全球南方语言评测集 Monsoon
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个印度语言。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个印度语言。
Hugging Face 发布研究,用共识分歧、掩码实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 视频版与真人医生同级的评测结果,可了解多智能体异步架构如何兼顾对话延迟与临床推理。
Hume 发布 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个专有与开源语音模型、15 个以上评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 与语音理解。
推荐理由:Hume 公开了语音 AI 人类质量评测基准的规模与关键发现,读者可据此理解现有基准为何高估真实表现。
Hugging Face 与 Treble Technologies 发布首个开放、社区驱动的远场 ASR 基准 FFASR Leaderboard,覆盖 14 个模拟房间,并设有 Lab Measured 与 Lab Simulated 的 sim-to-real 验证轨道。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 在医生监督下作为护理团队成员与患者交互。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于两款医生常用 AI;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。
推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。
Hugging Face 发布端到端语音智能体评估框架 EVA,首次同时打分任务成功率(EVA-A)与对话体验(EVA-X),并开源含 50 个航司场景的数据集。对 20 个级联与音频原生系统的基准测试显示,准确率与体验之间存在一致的权衡:任务完成得好的智能体,用户体验往往更差。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊初级保健就诊前为患者采集病史,由医生通过视频实时监督。
推荐理由:Google 与 BIDMC 首次把 AMIE 放进真实门诊流程做前瞻性可行性研究,读者可看到安全监督机制与盲评结果。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。
推荐理由:Google Research 联合非洲高校发布 27 种语言的开放语音数据集,可了解低资源语音数据的采集方法与许可条件。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Google Research 介绍了一个端到端语音到语音翻译(S2ST)模型,可在原说话人音色下实时翻译,延迟仅 2 秒,而现有级联方案通常有 4–5 秒延迟并会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,可对照级联方案的误差累积问题。
Artificial Analysis 发布 Big Bench Audio 评测数据集,用于评估音频语言模型的推理能力,该数据集将 Big Bench Hard 的 1000 道题改编为音频形式。