微软 AI 发布面向语音智能体的转写与语音合成模型
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟略超 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟略超 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中做选择并给出置信度。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,并称智能体决策不再必须有人参与。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,与 Claude 驱动的 Thinking mode 并列。
推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 与 DPO 数据构造细节,以及引用密度过滤带来增益的对比经验。
谷歌于 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon,在软件工程、金融研究、法律研究及企业自动化等领域评测中表现领先。Argon 支持最高 100 万单次词元输出,高于此前的 6.4 万,缓存输入价格较前版本降低 95%,并能自主发现、验证并修复软件漏洞,目前已向部分合作方开放。随着 Argon 落地,谷歌取消了原定于 6 月发布的 Gemini 3.5 Pro 迭代计划。
推荐理由:谷歌 Gemini 4 系列首款旗舰模型 Argon 的能力与定价变化,以及随之取消的 Gemini 3.5 Pro 迭代计划。
微软发布三款自研语音 AI 模型:实时转录模型 MAI-Transcribe-2-Streaming,以及文本转语音模型 MAI-Voice-2.1 和低延迟版 MAI-Voice-2.1-Flash。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1(77.9%)、CWE-bench v1(68%)、Vals Index(68.90%)和 Text Arena(1525 分)等评测中领跑,但在 Code Arena 仅排第八。
推荐理由:汇总了 Gemini 4 Argon 的多项基准成绩、定价与首批开放范围,并附上内部员工对跑分与实际编程表现的争议。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前用户尚无法使用。此前外界预期的 Gemini 3.5 Pro 并未出现。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,把不可感知的签名直接嵌入生物代码,使水印在数字模型和合成出的实体蛋白质上都能被验证,同时实验室测试显示其不损害蛋白质的生物功能。
推荐理由:Google DeepMind 把水印从数字内容延伸到合成生物,读者可了解其技术路径与生物安全筛查的衔接方式。
Simon Willison 于 9 月 29 日发文点评 GPT 6.1 Sol,称其以五分之一的价格提供接近 Astra 的智能水平。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 NVIDIA Kumo Structured 模型集合,已在 Hugging Face 上线,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:原文给出模型规模、训练数据来源与四个基准排名,读者可据此判断表格基础模型的准确率与效率取舍。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,整个筛选到候选验证过程仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。
推荐理由:作者实测了 Sonnet 5.5 的编码与思考预算表现,并对比了它与 Opus 5.5、ChatGPT 免费层的差异。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时给出两种尺寸、多接口能力与 OSWorld 2.0 分数,可对照前沿闭源模型看成本与参数差距。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话。
推荐理由:官方给出 Live Avatar 的实时音视频对话能力、97 种语言切换与企业定制入口,可据此判断多模态智能体的落地形态。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅使部署模型参数量增加 8.9%,并首日支持 llama.cpp、MLX-VLM 和 SGLang。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型给出语音克隆、逐行表演控制与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款语音对话模型同时发布,给出语音智能体在实时推理与工具调用上的能力边界和开放入口。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时卫星观测数据,可每小时生成一次预报。
推荐理由:原文给出分辨率、更新频率与降水精度提升幅度,读者可据此判断 AI 天气预报在 Google 产品中的实际可用程度。
Hugging Face 推出 NeoMME 系列多语言多模态编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型。
Google 推出 TimesFM-3,一款原生预训练支持多变量预测的时间序列基础模型,参数量 3.3 亿,在超 1 万亿时间点的真实与合成语料上预训练。它单次前向传播即可联合预测多条共演化序列,支持多目标、历史协变量和已知未来协变量,并输出 10 至 90 分位共 9 个分位数。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。
推荐理由:Granite 4.2 公开了从预训练到多阶段 RL 的完整构建流程,可对照其数据配比与奖励设计理解推理模型的训练取舍。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升吞吐,GPU 上最高 3.18 倍、端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三个 LFM2.5 模型的 DSpark 草稿模型与 H100、MacBook 实测吞吐数据,可据此判断投机解码在端侧与 GPU 上的实际收益。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体(Nano 128 维 1.4M 参数、Tiny 192 维 6.2M 参数、Base 768 维 89M 参数)、分辨率及影像源,输出 int8 格式的 Cloud-Optimized GeoTIFF。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式模拟器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库提供服务。
DharmaOCR 在葡萄牙语专用基准上取得 0.925 分,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量与稳定性上保持优势。
Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:Google 把零样本思路搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比表现。
Google Research 提出一种新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在 Pixel 9 和 10 系列上实现开箱即用的加速。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何在内存受限下提速。
PaddleOCR 发布新一代通用 OCR 模型家族 PP-OCRv6,已在 Hugging Face 上线,提供 tiny、small、medium 三档,参数量从 1.5M 到 34.5M。
Hugging Face 发布 OlmoEarth v1.1,一个将计算成本最多降低 3 倍、同时保持 v1 性能的地球观测模型系列。该系列通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,并修改预训练方案以避免性能下降,提供 Base、Tiny、Nano 三种规模权重及训练代码。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排序模型,参数规模覆盖 17m、32m、68m、150m、400m 到 1b,均基于 Ettin ModernBERT 编码器构建。