跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

100条精选相关主题图像生成AI 视频语音与音频

最新精选

第 41–60 条 · 共 100 条
3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。

    推荐理由:原文给出价格、速度与基准数据,读者可据此判断高并发场景下的成本与延迟取舍。

2月27日周五
2月19日周四
  1. Google DeepMind71

    Gemini 上线 Lyria 3 音乐生成,支持文字与图片生成 30 秒曲目

    Google DeepMind 的最新生成式音乐模型 Lyria 3 以 beta 形式在 Gemini app 上线,用户用文字或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并附由 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 中的生成方式、语言覆盖与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。

1月30日周五
  1. Google DeepMind71

    Google DeepMind 向美国 AI Ultra 订阅者开放 Project Genie 世界模型原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。

    推荐理由:官方披露了世界模型原型的三项核心能力与已知限制,可据此判断实时生成交互世界的可用边界。

1月16日周五
1月14日周三
  1. Google DeepMind71

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,支持原生竖屏与 1080p/4K 放大

    Google DeepMind 更新 Veo 3.1 的 Ingredients to Video 能力,让基于参考图生成的视频在简单提示词下也有更丰富的对白与叙事,并提升角色、背景和物体的一致性。

    推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得切换。

1月6日周二
12月17日周三
  1. Mistral AI66

    Mistral 发布 OCR 3,表单与手写识别胜率较上代提升 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。

    推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。

12月11日周四
  1. OpenAI News80

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 发布 GPT-5.2,定位为面向日常专业工作的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支持更快、更可靠的智能体工作流。

    推荐理由:官方给出 GPT-5.2 在推理、长上下文、编码与视觉上的定位,可据此判断日常专业工作与智能体流程的可用性。

12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列模型,含 675B 参数的 Mistral Large 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 一次性开源从 3B 到 675B 的完整模型族,读者可据此了解开源模型在参数规模与部署形态上的最新覆盖范围。

11月20日周四
  1. Google DeepMind62

    Google 在 Gemini 应用中上线 AI 图像验证功能

    Google DeepMind 宣布在 Gemini 应用中上线图像验证功能,用户上传图片并提问是否由 Google AI 生成或编辑,Gemini 会检测 SynthID 水印并结合自身推理给出判断。

    推荐理由:Google 把 SynthID 水印检测直接放进 Gemini 应用,读者可了解 AI 图像溯源在消费端产品的落地方式。

  2. Google DeepMind80

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,面向开发者提供影棚级图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,以及 Adobe、Figma 等接入情况,便于判断其与上一代的取舍。

11月19日周三
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Pro 并推出 Antigravity 开发平台

    Google DeepMind 发布 Gemini 3 Pro,称其在主要 AI 基准上超过此前版本,编码与智能体任务表现优于 2.5 Pro。模型已在 Google AI Studio 和 Vertex AI 以预览形式开放,200k token 以内输入 $2/百万 token、输出 $12/百万 token,并在 Google AI Studio 免费提供但有限速。

    推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与 Antigravity 平台入口,可据此判断其编码与智能体能力落点。

  2. Google DeepMind87

    Google DeepMind 发布 Gemini 3,Pro 版预览上线并推出 Deep Think 模式

    Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,首发 Gemini 3 Pro 预览版,并同步上线 Gemini 应用、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新的智能体开发平台 Google Antigravity。

    推荐理由:官方一次性给出 Gemini 3 Pro 与 Deep Think 的基准成绩、产品落地范围和开放入口,可据此判断能力代际变化。

11月13日周四
  1. Google DeepMind66

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令跟随者升级为能思考目标、与用户对话并随时间自我改进的交互式游戏伙伴。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解从指令跟随到自主推理与自我改进的路径。

8月7日周四
  1. OpenAI News85

    OpenAI 发布 GPT-5

    OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方向达到 SOTA 表现。

    推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位,可作为了解该模型代际变化的官方口径。

  2. Hugging Face Blog60

    TRL 为视觉语言模型加入 MPO、GRPO、GSPO 等对齐方法

    Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。

    推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。