Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。
推荐理由:官方给出音频标签控制方式、Elo 分数与多语言覆盖,可据此判断语音生成的可控性变化。
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。
推荐理由:官方给出音频标签控制方式、Elo 分数与多语言覆盖,可据此判断语音生成的可控性变化。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人高层推理的进展。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本,后续将支持 Apple Silicon Mac。
推荐理由:Waypoint-1.5 把实时世界模型从数据中心拉到消费级显卡,读者可据此判断本地交互式生成世界的硬件门槛。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖端侧到工作站,并给出 Apache 2.0 许可与首日工具支持,可据此判断本地部署与微调的选择空间。
Google DeepMind 的 Gemma 4 多模态模型家族已在 Hugging Face 发布,采用 Apache 2 许可,支持图像、文本和音频输入并生成文本。
推荐理由:Gemma 4 五档尺寸与 Apache 2 许可一并给出,读者可据此判断端侧多模态与本地部署的可行边界。
阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上取得 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,已在 Hugging Face 上线并采用 Apache 2.0 许可。
推荐理由:3B 小模型在表格与图表抽取上对标更大模型,并给出 LoRA 模块化部署路径,可据此判断企业文档流水线的选型。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低,已通过 Gemini Live API 在 Google AI Studio 预览,并接入 Gemini Enterprise for Customer Experience、Search Live 和 Gemini Live。
推荐理由:官方给出语音模型的延迟、推理基准与多语言覆盖变化,可据此判断语音智能体的可用边界。
Google DeepMind 发布 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能按前奏、主歌、副歌、桥段等结构元素进行提示控制。
推荐理由:官方披露 Lyria 3 Pro 的时长与结构控制能力,以及它在 Vertex AI、Gemini 等入口的开放范围。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可生成带情感表达的语音并支持零样本跨语言音色适配。
推荐理由:Mistral 首款 TTS 模型给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开了与 ElevenLabs 的人工对比结果。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态 computer-use 模型,现已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:官方披露了模型架构、训练数据规模与 WebVoyager 提升幅度,可据此判断高吞吐 computer-use 智能体的落地条件。
OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 的更小、更快版本。两款模型针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。
推荐理由:OpenAI 官方给出 GPT-5.4 mini 与 nano 的定位,读者可据此判断小模型在编码与工具调用场景的取舍。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合并进单一开源模型,并给出与 GPT-OSS 120B 的输出长度对比,便于判断效率取舍。
Mistral 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并同步上线 Mistral Vibe 的 agent 模式与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出权重、API 与 FLTEval 评测,可对照其与 Claude 系列的成本差距。
OpenAI 发布 GPT-5.4,称其为面向专业工作能力最强且最高效的前沿模型,具备 SOTA 级编码、电脑操作和工具搜索能力,上下文窗口为 1M token。
推荐理由:官方给出 GPT-5.4 的定位与能力清单,可据此了解前沿模型在专业工作场景的迭代方向。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:原文给出价格、速度与基准数据,读者可据此判断高并发场景下的成本与延迟取舍。
OpenAI 发布 GPT-5.3 Instant,官方称其在日常对话中更顺畅、更实用。该条目来自 OpenAI 官方新闻页,正文未能抓取,除标题外暂无更多细节。
Google DeepMind 发布最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的高级世界知识、质量与推理能力带到 Flash 级速度。
推荐理由:Google DeepMind 官方发布 Nano Banana 2,读者可据此了解其能力边界与在 Gemini、搜索、Flow 等产品中的落地范围。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的更强核心推理模型,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 得分与多端上线范围,可据此判断新模型在复杂推理任务上的位置。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题,已在 Gemini 应用中向 Google AI Ultra 订阅用户开放,并首次通过 Gemini API 向部分研究者、工程师和企业提供早期访问。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩与开放入口,可据此判断其科研与工程定位。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 公布实时编码模型的速度与上下文规格,可据此判断编码工作流的响应变化。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生智能体,将前沿编码能力与通用推理结合,面向长周期、真实世界的技术工作。
推荐理由:OpenAI 官方发布 Codex 原生智能体模型,可据此了解其在编码与通用推理上的定位。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。
推荐理由:官方给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时转写的成本与部署边界。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上取得 78.5%、OSWorld G 上取得 79.0% 的 SOTA 成绩,模型已在 Hugging Face 上线。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face Hub,Waypoint-1-Small 为 2.3B,Medium 版本即将推出。
推荐理由:原文给出模型规模、训练数据量与推理库性能数字,可据此判断实时交互视频生成在消费级硬件上的可行性。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,读者可了解 4D 重建的效率提升幅度与机器人、AR 等落地方向。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 提到 256K 并新增轨迹与 OCR 能力,可据此判断物理 AI 视觉推理的可用边界。
TII 发布 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三个参数版本,采用在每个 block 内并行运行 Mamba 状态空间模型与 Transformer 注意力的 Falcon-H1 混合架构。
推荐理由:原文给出三个参数规模的架构、上下文窗口与基准对比,可据此判断阿拉伯语模型的部署选型。
Google 回顾 2025 年在 8 个领域的研究突破,模型方面 3 月发布 Gemini 2.5、11 月推出 Gemini 3、12 月推出 Gemini 3 Flash,其中 Gemini 3 Pro 登顶 LMArena 并在 MathArena Apex 取得 23.4% 的 SOTA。
ServiceNow 发布 AprielGuard,一个 8B 参数的安全与安全防护模型,可检测 16 类安全风险以及提示词注入、越狱、思维链污染、上下文劫持、记忆投毒和多智能体攻击序列等对抗攻击。
OpenAI 发布 GPT-5.2-Codex,称其为该公司最先进的编码模型。该模型主打长程推理、大规模代码转换以及增强的网络安全能力。
推荐理由:OpenAI 官方发布新一代编码模型,读者可据此了解其在长程推理与大规模代码改造上的定位。
OpenAI 发布 GPT-5.2 系统卡增补文件,涉及 GPT-5.2-Codex。该页面为 OpenAI News 官方条目,正文内容未能抓取,仅标题可用。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。
推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可重跑评测流程并独立核验结果。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟和成本结合,定价为每 100 万输入 token 0.50 美元、每 100 万输出 token 3 美元。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断它在速度与成本上的取舍。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,改进函数调用、指令遵循与多轮对话能力。
推荐理由:官方给出函数调用、指令遵循与多轮对话三项改进的具体分数,可据此判断语音智能体的可用性提升。
OpenAI 发布 GPT-5.2,称其为该公司在数学与科学方面最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新 SOTA。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:OpenAI 官方给出 GPT-5.2 在数学与科学基准上的新 SOTA 结果,并说明其已用于解决一个开放理论问题。
OpenAI 更新 GPT-5 系统卡,将 GPT-5.2 纳入其中。GPT-5.2 是 GPT-5 系列的最新模型家族,其安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡所述基本一致。这些模型与 OpenAI 其他模型一样,训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
推荐理由:官方系统卡更新披露 GPT-5.2 的安全缓解思路与 GPT-5 系列保持一致,可对照前代系统卡了解其安全策略延续性。