Google 发布 MedGemma 1.5 4B 与医疗语音识别模型 MedASR
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,改进函数调用、指令遵循与多轮对话能力。
推荐理由:官方给出函数调用、指令遵循与多轮对话三项改进的具体分数,可据此判断语音智能体的可用性提升。
Google Research 介绍了一个端到端语音到语音翻译(S2ST)模型,可在原说话人音色下实时翻译,延迟仅 2 秒,而现有级联方案通常有 4–5 秒延迟并会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,可对照级联方案的误差累积问题。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 官方发布语音到语音新模型并同步扩展 Realtime API 能力,可据此了解语音智能体的接口变化。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线走向。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备原生多语言、音频问答与摘要、语音触发函数调用等能力,API 定价为每分钟 $0.001。
推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此评估自部署与调用成本。
Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的实时通信库。它内置自动语音检测与轮次切换、WebRTC 版 Gradio UI、WebSocket 支持,并可通过 fastphone() 获取免费电话号码接入音频流。库还提供语音转文字、文字转语音和停用词检测等工具,可挂载到任意 FastAPI 应用部署。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方公告仅给出上述要点,未披露具体参数、价格或可用范围。
推荐理由:OpenAI 官方一次性给出 o1 模型与 Realtime API、微调方法的更新,便于开发者对照现有集成评估升级点。
OpenAI 发布 Realtime API,开发者现在可以在自己的应用中构建快速的语音到语音体验。
推荐理由:OpenAI 官方发布 Realtime API,开发者可据此判断语音到语音交互的接入方式。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间进行实时推理。
推荐理由:OpenAI 官方发布新旗舰模型,可据此了解其在音频、视觉与文本上的实时跨模态能力。
OpenAI 发布 ChatGPT 和 Whisper 的 API,将这两项能力开放给开发者调用。
Hugging Face 博客介绍如何用投机解码(Transformers 中的 assisted generation)将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。
推荐理由:以 Whisper 为例给出投机解码的完整实现与基准数据,可迁移到其他自回归模型的推理加速。
OpenAI 发布 ChatGPT iOS 应用,支持对话同步和语音输入,并将最新的模型改进带到移动端。
推荐理由:OpenAI 官方公布 ChatGPT iOS 应用,说明对话同步与语音输入两项能力,可据此了解其移动端入口的初始形态。
Hugging Face 宣布 SpeechT5 已集成进 Transformers,官方权重发布在 Hugging Face Hub,并提供语音合成、音色转换和语音识别三个 Spaces 演示。
推荐理由:SpeechT5 以同一套架构覆盖 TTS、语音转换与 ASR,文中给出可直接运行的代码与权重入口,便于判断能否接入现有语音流程。
Hugging Face 发布教程,逐步讲解如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖模型原理、Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估和 Gradio 演示。
推荐理由:完整给出用 Transformers 微调 Whisper 的代码流程,并以 8 小时印地语数据把 WER 从 63.5% 降到 32.0% 作为可参照结果。
OpenAI 宣布训练并开源名为 Whisper 的神经网络,称其在英语语音识别上接近人类水平的鲁棒性与准确率。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可了解其在英语语音识别上的鲁棒性与准确率定位。