跳到正文

#多模态

今日 0 条
10月1日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,整个筛选到候选验证过程仅用一个周末。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

9月25日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话。

    推荐理由:官方给出 Live Avatar 的实时音视频对话能力、97 种语言切换与企业定制入口,可据此判断多模态智能体的落地形态。

9月24日周四
  1. Hugging Face Blog40

    Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,为 LFM2.5-VL-3B 加速视觉语言推理

    Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅使部署模型参数量增加 8.9%,并首日支持 llama.cpp、MLX-VLM 和 SGLang。

9月3日周四
8月28日周五
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。

    推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与 API 入口,可据此判断生成视频工作流的可控性变化。

8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首个支持场景为美国手语(ASL)转英文。该模型基于超过 50 种手语、逾 10 万小时数据训练,其中约四分之一为 ASL 数据,在 FLEURS-ASL(sd-test)上取得 70 BLEURT 的零样本成绩。

    推荐理由:官方披露了 SL2T 的训练规模、手语翻译难点与端侧隐私方案,可了解手语 AI 从实验室走向消费产品的路径。

8月10日周一
8月4日周二
  1. Mistral AI66

    Mistral AI 发布 Shieldstral 多模态安全分类模型

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类模型,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。

    推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,可对照其与 7 倍体量模型的基准表现。

7月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还可原生调用 Google Search 等工具。

    推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。

7月28日周二
7月21日周二
7月16日周四
7月15日周三
  1. Hugging Face Blog88

    Thinking Machines 在 Hugging Face 发布 Inkling 多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的开源多模态 MoE 模型,同时发布 276B 总参数 12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与多模态评测数据,可据此判断开源大模型在长上下文与多模态推理上的进展。

7月1日周三
6月22日周一
6月9日周二
6月5日周五
5月18日周一
5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 等渠道开放。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放渠道,可据此判断其速度与成本定位。

4月28日周二
  1. Hugging Face Blog78

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多榜成绩,可据此判断开源全模态模型在文档、音视频与智能体场景的可用性。

4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。

    推荐理由:官方给出音频标签控制方式、Elo 分数与多语言覆盖,可据此判断语音生成的可控性变化。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。

    推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人高层推理的进展。

4月3日周五
4月2日周四
4月1日周三
3月31日周二
3月26日周四
3月17日周二
  1. OpenAI News62

    OpenAI 发布 GPT-5.4 mini 和 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 的更小、更快版本。两款模型针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。

    推荐理由:OpenAI 官方给出 GPT-5.4 mini 与 nano 的定位,读者可据此判断小模型在编码与工具调用场景的取舍。

  2. Mistral AI76

    Mistral 发布 Mistral Small 4 开源模型,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码能力合并进单一开源模型,并给出与 GPT-OSS 120B 的输出长度对比,便于判断效率取舍。

3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。

    推荐理由:原文给出价格、速度与基准数据,读者可据此判断高并发场景下的成本与延迟取舍。

2月27日周五
1月16日周五
1月14日周三
1月6日周二
12月17日周三
  1. Mistral AI66

    Mistral 发布 OCR 3,表单与手写识别胜率较上代提升 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。

    推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。

12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列模型,含 675B 参数的 Mistral Large 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 一次性开源从 3B 到 675B 的完整模型族,读者可据此了解开源模型在参数规模与部署形态上的最新覆盖范围。

11月20日周四
  1. Google DeepMind80

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,面向开发者提供影棚级图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,以及 Adobe、Figma 等接入情况,便于判断其与上一代的取舍。