跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

100条精选相关主题图像生成AI 视频语音与音频

最新精选

第 21–40 条 · 共 100 条
6月5日周五
5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实地点生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国境内地点并搭配风格与角色描述生成可交互世界。该能力由 Maps Imagery Grounding 驱动,目前仅支持美国地点,并随 Project Genie 逐步向全球 Google AI Ultra 200 美元订阅用户(18 岁以上)开放。

    推荐理由:Project Genie 接入 Street View 真实影像,读者可了解世界模型如何用真实地点锚定生成环境。

5月17日周日
  1. Google DeepMind62

    Google 将 SynthID 与 C2PA 内容验证扩展到 Search、Gemini、Chrome 和 Pixel

    Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能此前已在全球被使用 5000 万次。

    推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。

5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 等渠道开放。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放渠道,可据此判断其速度与成本定位。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 在医生监督下作为护理团队成员与患者交互。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于两款医生常用 AI;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。

    推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。

4月28日周二
  1. Hugging Face Blog78

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多榜成绩,可据此判断开源全模态模型在文档、音视频与智能体场景的可用性。

4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。

    推荐理由:官方给出音频标签控制方式、Elo 分数与多语言覆盖,可据此判断语音生成的可控性变化。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。

    推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人高层推理的进展。

4月9日周四
  1. Hugging Face Blog60

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态嵌入与重排模型。嵌入模型把不同模态映射到共享向量空间,重排模型对混合模态输入对打分,可用于视觉文档检索、跨模态搜索和多模态 RAG。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索如何接入现有 RAG 流程。

4月3日周五
4月2日周四
3月31日周二
3月26日周四
3月25日周三
  1. Google Research60

    Google 发布 Vibe Coding XR,用 Gemini 与 XR Blocks 生成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成可运行的物理感知 Android XR 应用,官方称耗时在 60 秒以内。

    推荐理由:Google 把 Gemini 与 XR Blocks 组合成从自然语言到 Android XR 应用的生成流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发的门槛变化。

3月17日周二
  1. OpenAI News62

    OpenAI 发布 GPT-5.4 mini 和 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 的更小、更快版本。两款模型针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。

    推荐理由:OpenAI 官方给出 GPT-5.4 mini 与 nano 的定位,读者可据此判断小模型在编码与工具调用场景的取舍。

  2. Mistral AI76

    Mistral 发布 Mistral Small 4 开源模型,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码能力合并进单一开源模型,并给出与 GPT-OSS 120B 的输出长度对比,便于判断效率取舍。

  3. Mistral AI60

    Mistral AI 与 NVIDIA 合作,共同开发开源前沿模型

    Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,双方计划共同开发前沿开源 AI 模型,Mistral 提供模型架构、多模态能力和微调工具,NVIDIA 提供算力、模型开发工具与合成数据生成管线。

    推荐理由:Mistral 以创始成员身份加入 NVIDIA Nemotron Coalition,读者可了解开放前沿模型的联合训练分工与开源计划。

3月12日周四
  1. Google Research66

    Google 与 BIDMC 开展对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊初级保健就诊前为患者采集病史,由医生通过视频实时监督。

    推荐理由:Google 与 BIDMC 首次把 AMIE 放进真实门诊流程做前瞻性可行性研究,读者可看到安全监督机制与盲评结果。