OpenAI 发布 gpt-realtime 并更新 Realtime API
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 官方发布语音到语音新模型并同步扩展 Realtime API 能力,可据此了解语音智能体的接口变化。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 官方发布语音到语音新模型并同步扩展 Realtime API 能力,可据此了解语音智能体的接口变化。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线走向。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备原生多语言、音频问答与摘要、语音触发函数调用等能力,API 定价为每分钟 $0.001。
推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此评估自部署与调用成本。
Genspark 借助 GPT-4.1 和 OpenAI Realtime API 构建无代码个人智能体,45 天内做到 3600 万美元 ARR。该产品主打无代码方式,让用户无需编程即可搭建个人 AI 智能体。
Retell AI 基于 GPT-4o 和 GPT-4.1 打造 AI 语音自动化,正改造呼叫中心。其无代码平台让企业无需脚本即可上线自然的实时语音智能体,降低通话成本、提升 CSAT 并自动处理客户对话。
Arm 工程师 Michael Gamble 基于 Stability AI 的 Stable Audio Open 模型,在 Arm CPU 上构建了一款完全本地运行的音效生成应用,无需 GPU 和云端推理,几秒内即可根据提示词生成 .wav 文件并直接导入 Ableton Live。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较此前版本最高提升 8 倍,转录质量无损。
Speak 正借助 AI 为语言学习提供个性化体验,其 CEO 兼联合创始人 Connor Zwick 在对话中介绍了相关做法。
Hugging Face 与 Cloudflare 达成合作,FastRTC 开发者用 Hugging Face token 即可接入 Cloudflare 的 WebRTC 基础设施。
Hugging Face 与印度科学研究所 IISc/ARTPARK 达成合作,让全球开发者更便捷地使用印度多模态多语言数据集 Vaani。
Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的实时通信库。它内置自动语音检测与轮次切换、WebRTC 版 Gradio UI、WebSocket 支持,并可通过 fastphone() 获取免费电话号码接入音频流。库还提供语音转文字、文字转语音和停用词检测等工具,可挂载到任意 FastAPI 应用部署。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
Artificial Analysis 发布 Big Bench Audio 评测数据集,用于评估音频语言模型的推理能力,该数据集将 Big Bench Hard 的 1000 道题改编为音频形式。
Hugging Face 发布 Speech-to-Speech(S2S)项目,通过 VAD、STT、语言模型和 TTS 组成的级联流水线实现语音对话,支持英语、法语、西班牙语、中文、日语和韩语,可单语言运行或用 auto 标志自动检测语言。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下实现快速生成,从而解决扩散模型因迭代采样导致的生成速度慢问题。扩散模型已在图像、音频和视频生成领域取得显著进展,但迭代采样过程拖慢了生成速度。
OpenAI 发文详解其文本转语音模型 Voice Engine 的技术原理与安全研究。该模型可根据文本生成语音,OpenAI 同时介绍了围绕这一技术开展的安全研究工作。
OpenAI 与业内顶尖选角及导演专业人士合作,从 400 多份投稿中筛选,最终为 ChatGPT 选定 5 种声音。
Hugging Face 发布自定义推理 handler 方案,在 Inference Endpoints 上把 Whisper 语音识别、Pyannote 说话人分离与推测解码整合进单一 API 端点。
OpenAI 分享了自定义语音生成模型 Voice Engine 小规模预览的经验教训。该模型可根据声音样本创建定制语音,OpenAI 同时探讨了合成语音带来的挑战与机遇。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后对比两个 TTS 模型的合成语音并投票选出更自然的一方,结果汇入公开排行榜。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 微调 facebook/w2v-bert-2.0 完成低资源 ASR。Wav2Vec2-BERT 是 580M 参数音频模型,预训练于 4.5M 小时、覆盖 143 种语言的无标注音频。
Hugging Face 博客介绍如何用投机解码(Transformers 中的 assisted generation)将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。
推荐理由:以 Whisper 为例给出投机解码的完整实现与基准数据,可迁移到其他自回归模型的推理加速。
Hugging Face 发布教程,介绍如何基于 Meta AI 的 MMS 检查点微调 Adapter 层以适配低资源语言的语音识别。MMS 的 Adapter 训练仅需 10-20 分钟微调即可获得极低词错误率,每个 Adapter 层仅约 2.5M 权重,比微调整个模型更省内存、更稳健。
Hugging Face 发布教程,演示如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,把玩家语音转成文本,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从搭建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API。
OpenAI 发布 ChatGPT iOS 应用,支持对话同步和语音输入,并将最新的模型改进带到移动端。
推荐理由:OpenAI 官方公布 ChatGPT iOS 应用,说明对话同步与语音输入两项能力,可据此了解其移动端入口的初始形态。
Hugging Face 宣布 SpeechT5 已集成进 Transformers,官方权重发布在 Hugging Face Hub,并提供语音合成、音色转换和语音识别三个 Spaces 演示。
推荐理由:SpeechT5 以同一套架构覆盖 TTS、语音转换与 ASR,文中给出可直接运行的代码与权重入口,便于判断能否接入现有语音流程。
Hugging Face 发布音频数据集使用指南,介绍如何用 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。当时 Hub 上已有 77 个语音识别数据集和 28 个音频分类数据集,并支持 Dataset Preview 在线试听样本。
Hugging Face 发布教程,逐步讲解如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖模型原理、Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估和 Gradio 演示。
推荐理由:完整给出用 Transformers 微调 Whisper 的代码流程,并以 8 小时印地语数据把 WER 从 63.5% 降到 32.0% 作为可参照结果。
OpenAI 宣布训练并开源名为 Whisper 的神经网络,称其在英语语音识别上接近人类水平的鲁棒性与准确率。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可了解其在英语语音识别上的鲁棒性与准确率定位。
Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,在 🤗 Transformers 中对任意长音频乃至实时语音做高质量自动语音识别。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 checkpoint 结合用于音频解码。
Hugging Face 发布教程,演示如何用 🤗 Transformers 将预训练检查点 Wav2Vec2-XLS-R-300M 微调用于低资源语音识别。
Hugging Face 发布教程,演示如何用 🤗 Transformers 微调 Wav2Vec2 预训练模型做英语 ASR。Wav2Vec2 由 Alexei Baevski 等人于 2020 年 9 月发布,仅用 10 分钟标注数据即可在 LibriSpeech 干净测试集上取得低于 5% 的 WER。