Mistral 发布 OCR 3,表单与手写识别胜率较上代提升 74%
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。
推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。
推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟和成本结合,定价为每 100 万输入 token 0.50 美元、每 100 万输出 token 3 美元。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断它在速度与成本上的取舍。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支持更快、更可靠的智能体工作流。
推荐理由:官方给出 GPT-5.2 在推理、长上下文、编码与视觉上的定位,可据此判断日常专业工作与智能体流程的可用性。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3513 个公开样例,另设私有留出集。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评估声音嵌入模型的 8 类听觉能力,涵盖检索、推理、分类、转录、分割、聚类、重排序与重建。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性开源从 3B 到 675B 的完整模型族,读者可据此了解开源模型在参数规模与部署形态上的最新覆盖范围。
Google DeepMind 宣布在 Gemini 应用中上线图像验证功能,用户上传图片并提问是否由 Google AI 生成或编辑,Gemini 会检测 SynthID 水印并结合自身推理给出判断。
推荐理由:Google 把 SynthID 水印检测直接放进 Gemini 应用,读者可了解 AI 图像溯源在消费端产品的落地方式。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,面向开发者提供影棚级图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,以及 Adobe、Figma 等接入情况,便于判断其与上一代的取舍。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更准确的图像内文字渲染、多语言生成与更强的世界知识。
推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,可据此判断图像生成与编辑的可用范围。
Google DeepMind 发布 Gemini 3 Pro,称其在主要 AI 基准上超过此前版本,编码与智能体任务表现优于 2.5 Pro。模型已在 Google AI Studio 和 Vertex AI 以预览形式开放,200k token 以内输入 $2/百万 token、输出 $12/百万 token,并在 Google AI Studio 免费提供但有限速。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与 Antigravity 平台入口,可据此判断其编码与智能体能力落点。
Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,首发 Gemini 3 Pro 预览版,并同步上线 Gemini 应用、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新的智能体开发平台 Google Antigravity。
推荐理由:官方一次性给出 Gemini 3 Pro 与 Deep Think 的基准成绩、产品落地范围和开放入口,可据此判断能力代际变化。
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率、可区分天然林与其他树木覆盖的地图数据集,独立数据集验证准确率达 92.2%。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令跟随者升级为能思考目标、与用户对话并随时间自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解从指令跟随到自主推理与自我改进的路径。
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器生成百万级图像的 AligNet 数据集,再微调其他模型,使其在"找不同"任务上更符合人类判断,并提升鲁棒性与泛化能力。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作开发森林砍伐驱动因素模型,以 1km² 分辨率覆盖 2000-2024 年,并开放 30 米尺度砍伐风险预测基准数据集。
OpenAI 发布 IndQA,一个用于评估 AI 系统在印度语言中表现的新基准,由领域专家参与构建,覆盖 12 种语言和 10 个知识领域,重点考察文化理解与推理能力。
Google Research 在 Research@ 活动上公布三项进展:Earth AI 整合地理空间模型与 LLM 推理,其河流洪水模型覆盖 150 个国家超 20 亿人;开源癌症变异识别工具 DeepSomatic 发表于 Nature Biotechnology,并与 Google DeepMind 联合发布 270 亿参数的单细胞分析基础模型 C2S-Scale。
Google Research 发布 StreetReaderAI 无障碍街景原型,基于 Gemini 构建 AI Describer 与 AI Chat 两个子系统,为盲人和低视力用户实时生成道路、路口与地点的语音描述,并支持语音或键盘平移、移动和跳转。
Hugging Face 发布指南,介绍如何用 Chandra、OlmOCR-2 等开源权重 OCR 模型搭建文档处理流水线,并给出各模型的 OlmOCR 评测分数。指南覆盖模型能力对比、微调与开箱即用的取舍、选型要点,以及用多模态检索和文档问答超越传统 OCR。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉支持,可在表格中查看、分析图像并抽取信息,也能从文本生成图像和编辑图像,全部由 Inference Providers 上的开放模型驱动。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化(INT8)或静态量化压缩模型,最后执行推理,无需 GPU。
Hugging Face 发布 Smol2Operator,以 SmolVLM2-2.2B-Instruct 为基线,通过两阶段训练让原本无 grounding 能力的视觉语言模型获得 GUI 操作与智能体推理能力。
SchoolAI 基于 GPT-4.1、图像生成和 TTS 构建安全、教师引导的 AI 工具,已服务超过 100 万个课堂,提升参与度、监督能力和个性化学习。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(8000 训练/2000 测试样本)的分类任务上显著优于基座模型,基座模型常把 Playground 误判为 Stadium,且会幻觉出不存在的类别名。
Hugging Face 开源长视频理解基准 TimeScope,将 5-10 秒的"针"片段插入 1 分钟至 8 小时的视频中,考察定位检索、信息综合与细粒度时序感知三项能力。测试显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频任务上仍表现吃力,性能随视频变长明显下滑。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线走向。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充方案中约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并用背包问题(knapsack)策略将序列打包进固定 token 上限的 batch。
NVIDIA 发布 Llama Nemotron Nano VL,一个 8B 视觉语言模型,面向智能文档处理,已在 Hugging Face 上线并可通过 NVIDIA NIM API 调用。
Gemma 3n 从 Google I/O 的预览版转为正式发布,已在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等开源库上线。
推荐理由:Gemma 3n 正式开源并接入主流推理库,读者可据此了解端侧多模态模型的部署路径与内存优化思路。
H Company 发布 Holo1 系列 Action VLM 及多模态定位基准 WebClick,模型已开源在 Hugging Face。该系列包含 Holo1-3B 和 Holo1-7B,其中 7B 在常见 UI 定位基准上平均准确率达 76.2%,为小尺寸模型中最高。
推荐理由:Holo1 开源了 GUI 定位模型与配套基准,读者可据此评估浏览器自动化在成本与精度上的取舍。
Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,可在免费 Colab 上启动训练。其视觉骨干采用 Google 的 SigLIP 编码器,语言骨干沿用 Llama 3 架构,两者通过 Modality Projection 模块对齐,训练目标为视觉问答。
推荐理由:官方给出 nanoVLM 的架构选择与训练流程,读者可据此在免费 Colab 上跑通一个 VLM。
Hugging Face 发布博客盘点过去一年视觉语言模型的关键变化,涵盖 any-to-any、推理、小尺寸、MoE 解码器、视觉语言动作模型等新趋势。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业选型的成本与落地条件。
Meta 发布 Llama Guard 4,一个 12B dense 多模态安全模型,以及两个新的 Llama Prompt Guard 2 模型,模型 checkpoint 已上线 Hugging Face Hub 的 Llama 4 Collection。
推荐理由:Meta 开源多模态安全模型,给出架构剪枝思路与相对上一代的召回对比,可据此评估内容审核管线。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,使模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。微调模型已在 Hugging Face 开源。
Cohere 正式接入 Hugging Face Inference Providers,成为首个在 HF Hub 上直接分享并托管自家模型的模型厂商。
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra Instructed 7B 大语言模型扩展至图像和视频多模态任务,集成 Google SigLIP-So400m 编码器与 2 层 MLP 投影器,采用四阶段训练,使用 610 万条指令微调样本(含 84.2 万条纯文本)。
Meta 发布 Llama 4 Maverick(约 400B 总参数)与 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持文本与图像输入,并已在 Hugging Face Hub 上线。
推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的架构细节与部署入口,可据此判断长上下文与多模态的落地条件。
NVIDIA 在 GTC 2025 上发布三项面向物理 AI 的开源成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。
推荐理由:NVIDIA 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此判断物理 AI 开发可用的工具链起点。