跳到正文

#多模态

今日 3 条
12月17日周三
  1. Mistral AI66

    Mistral 发布 OCR 3,表单与手写识别胜率较上代提升 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。

    推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。

12月11日周四
  1. OpenAI News80

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 发布 GPT-5.2,定位为面向日常专业工作的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支持更快、更可靠的智能体工作流。

    推荐理由:官方给出 GPT-5.2 在推理、长上下文、编码与视觉上的定位,可据此判断日常专业工作与智能体流程的可用性。

12月9日周二
12月4日周四
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列模型,含 675B 参数的 Mistral Large 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 一次性开源从 3B 到 675B 的完整模型族,读者可据此了解开源模型在参数规模与部署形态上的最新覆盖范围。

11月20日周四
  1. Google DeepMind62

    Google 在 Gemini 应用中上线 AI 图像验证功能

    Google DeepMind 宣布在 Gemini 应用中上线图像验证功能,用户上传图片并提问是否由 Google AI 生成或编辑,Gemini 会检测 SynthID 水印并结合自身推理给出判断。

    推荐理由:Google 把 SynthID 水印检测直接放进 Gemini 应用,读者可了解 AI 图像溯源在消费端产品的落地方式。

  2. Google DeepMind80

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,面向开发者提供影棚级图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,以及 Adobe、Figma 等接入情况,便于判断其与上一代的取舍。

11月19日周三
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Pro 并推出 Antigravity 开发平台

    Google DeepMind 发布 Gemini 3 Pro,称其在主要 AI 基准上超过此前版本,编码与智能体任务表现优于 2.5 Pro。模型已在 Google AI Studio 和 Vertex AI 以预览形式开放,200k token 以内输入 $2/百万 token、输出 $12/百万 token,并在 Google AI Studio 免费提供但有限速。

    推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与 Antigravity 平台入口,可据此判断其编码与智能体能力落点。

  2. Google DeepMind87

    Google DeepMind 发布 Gemini 3,Pro 版预览上线并推出 Deep Think 模式

    Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,首发 Gemini 3 Pro 预览版,并同步上线 Gemini 应用、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新的智能体开发平台 Google Antigravity。

    推荐理由:官方一次性给出 Gemini 3 Pro 与 Deep Think 的基准成绩、产品落地范围和开放入口,可据此判断能力代际变化。

11月14日周五
11月13日周四
  1. Google DeepMind66

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令跟随者升级为能思考目标、与用户对话并随时间自我改进的交互式游戏伙伴。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解从指令跟随到自主推理与自我改进的路径。

11月11日周二
11月6日周四
11月4日周二
10月31日周五
10月30日周四
10月21日周二
10月15日周三
9月23日周二
9月22日周一
8月7日周四
  1. Hugging Face Blog60

    TRL 为视觉语言模型加入 MPO、GRPO、GSPO 等对齐方法

    Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。

    推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。

8月1日周五
7月23日周三
7月17日周四
  1. Mistral AI66

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线走向。

7月8日周二
6月28日周六
6月26日周四
6月3日周二
  1. Hugging Face Blog71

    H Company 发布 GUI 自动化 VLM 系列 Holo1 与基准 WebClick

    H Company 发布 Holo1 系列 Action VLM 及多模态定位基准 WebClick,模型已开源在 Hugging Face。该系列包含 Holo1-3B 和 Holo1-7B,其中 7B 在常见 UI 定位基准上平均准确率达 76.2%,为小尺寸模型中最高。

    推荐理由:Holo1 开源了 GUI 定位模型与配套基准,读者可据此评估浏览器自动化在成本与精度上的取舍。

5月21日周三
  1. Hugging Face Blog62

    Hugging Face 发布 nanoVLM:用纯 PyTorch 训练视觉语言模型的最简仓库

    Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,可在免费 Colab 上启动训练。其视觉骨干采用 Google 的 SigLIP 编码器,语言骨干沿用 Llama 3 架构,两者通过 Modality Projection 模块对齐,训练目标为视觉问答。

    推荐理由:官方给出 nanoVLM 的架构选择与训练流程,读者可据此在免费 Colab 上跑通一个 VLM。

5月12日周一
5月7日周三
4月29日周二
4月23日周三
  1. Hugging Face Blog35

    TNG 微调 olmOCR-7B-0225-preview,打造忠实还原页眉页脚的 OCR 引擎

    TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,使模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。微调模型已在 Hugging Face 开源。

4月16日周三
4月11日周五
4月5日周六
  1. Hugging Face Blog85

    Llama 4 Maverick 与 Scout 上线 Hugging Face

    Meta 发布 Llama 4 Maverick(约 400B 总参数)与 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持文本与图像输入,并已在 Hugging Face Hub 上线。

    推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的架构细节与部署入口,可据此判断长上下文与多模态的落地条件。

3月18日周二