跳到正文

#模型发布

今日 0 条
11月17日周一
11月13日周四
  1. OpenAI News78

    OpenAI 在 API 中上线 GPT-5.1

    OpenAI 在 API 中上线 GPT-5.1,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。该版本还新增 apply_patch 和 shell 工具。

    推荐理由:OpenAI 官方给出 GPT-5.1 在 API 中的能力变化与新增工具,读者可据此判断现有调用链是否需要调整。

11月12日周三
10月29日周三
10月28日周二
9月30日周二
  1. OpenAI News69

    OpenAI 发布 Sora 2 视频与音频生成模型系统卡

    OpenAI 发布新一代视频与音频生成模型 Sora 2,并同步公开系统卡。相比 Sora,新模型在物理准确性、画面真实感、音画同步、可控性和风格覆盖范围上有所提升,官方称这些能力是此前的视频模型较难实现的。

    推荐理由:官方系统卡披露 Sora 2 在物理准确性、音画同步与可控性上的能力变化,可据此了解视频生成模型的新边界。

9月15日周一
  1. OpenAI News66

    OpenAI 发布 GPT-5-Codex,为 Codex 中的智能体编码优化

    OpenAI 发布 GPT-5 系统卡附录,公开新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。该模型会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂的任务则独立工作更长时间。

    推荐理由:官方系统卡附录披露 GPT-5-Codex 按任务复杂度动态调整思考投入,可据此了解 Codex 中编码智能体的能力取向。

9月12日周五
9月9日周二
9月4日周四
  1. Hugging Face Blog60

    Google 发布 EmbeddingGemma 高效多语言嵌入模型

    Google 发布 EmbeddingGemma,一款面向端侧场景的多语言嵌入模型,参数量 308M,上下文窗口 2K,支持 100 多种语言,量化后内存占用低于 200MB。

    推荐理由:308M 参数、2K 上下文、支持 100 多种语言,可据此判断端侧 RAG 与多语言检索的落地空间。

8月28日周四
8月7日周四
  1. OpenAI News82

    OpenAI 在 API 平台发布 GPT-5

    OpenAI 在 API 平台发布 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。

    推荐理由:OpenAI 官方在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。

  2. OpenAI News67

    OpenAI 发布 GPT-5,定位企业 AI 与自动化

    OpenAI 发布 GPT-5,称其为公司目前最先进的模型,面向企业 AI、自动化和办公效率场景。官方将其定位为智能工作新时代的推动力。

    推荐理由:OpenAI 官方对 GPT-5 的定位说明,可了解其面向企业 AI 与自动化场景的落点。

  3. OpenAI News85

    OpenAI 发布 GPT-5

    OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方向达到 SOTA 表现。

    推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位,可作为了解该模型代际变化的官方口径。

  4. OpenAI News83

    OpenAI 发布 GPT-5 系统卡

    OpenAI 发布 GPT-5 系统卡,说明其统一模型路由系统如何调度 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本,以针对不同任务和开发者用途提供快速或更强的响应。

    推荐理由:官方系统卡披露 GPT-5 的统一模型路由机制,读者可了解不同任务如何被分配到对应模型。

  5. OpenAI News62

    OpenAI 发布 GPT-5 首次上手预览

    OpenAI 发布 GPT-5 的首次上手预览,展示一组资深开发者第一次使用 GPT-5 的过程。

    推荐理由:OpenAI 官方放出 GPT-5 的首次上手片段,可据此了解开发者实际使用这款新模型的场景。

8月5日周二
  1. OpenAI News62

    OpenAI 发布其能力最强的开放权重模型

    OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、更灵活、更易在全球获取的重要一步。官方表示,此举服务于让尽可能多的人用上 AI 的使命,AI 的下一个前沿不只关乎能力,也关乎谁能使用它。

    推荐理由:OpenAI 官方宣布发布其能力最强的开放权重模型,读者可据此了解其开放策略的最新落点。

  2. OpenAI News84

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。

    推荐理由:OpenAI 以 Apache 2.0 开源两款不同规模权重模型,可据此判断本地部署与工具调用的可选范围。

7月16日周三
  1. Hugging Face Blog32

    Hugging Face 发布 Ettin Suite:同配方训练的 SoTA 配对编码器与解码器

    Hugging Face 推出 Ettin Suite,这是首个用相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 至 1B。其编码器全面超越 ModernBERT,解码器则击败或持平 Llama 3.2 1B 与 SmolLM2。该系列首次实现两种架构的公平对比,结果显示编码器在分类与检索任务占优,解码器在生成任务领先。

7月15日周二
  1. Mistral AI78

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备原生多语言、音频问答与摘要、语音触发函数调用等能力,API 定价为每分钟 $0.001。

    推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此评估自部署与调用成本。

7月11日周五
7月10日周四
7月8日周二
6月28日周六
6月26日周四
6月10日周二
6月3日周二
  1. Hugging Face Blog71

    H Company 发布 GUI 自动化 VLM 系列 Holo1 与基准 WebClick

    H Company 发布 Holo1 系列 Action VLM 及多模态定位基准 WebClick,模型已开源在 Hugging Face。该系列包含 Holo1-3B 和 Holo1-7B,其中 7B 在常见 UI 定位基准上平均准确率达 76.2%,为小尺寸模型中最高。

    推荐理由:Holo1 开源了 GUI 定位模型与配套基准,读者可据此评估浏览器自动化在成本与精度上的取舍。

5月28日周三
  1. Mistral AI60

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个专为代码设计的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:官方给出代码嵌入模型在检索任务上的对比与维度精度取舍,可据此评估代码 RAG 的存储成本。

5月23日周五
5月21日周三
  1. Mistral AI73

    Mistral AI 发布智能体编码模型 Devstral,Apache 2.0 开源

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SoTA 模型高出 6 个百分点以上。

    推荐理由:Mistral 与 All Hands AI 合作的智能体编码模型,给出 SWE-Bench Verified 成绩与本地部署门槛,便于判断开源编码模型的当前水平。

  2. Hugging Face Blog41

    Falcon-Arabic:阿拉伯语语言模型的突破

    阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度达 32,000 tokens。该模型在 OALL v2 基准上超越同规模阿拉伯语 LLM,甚至优于参数量达其 4 倍的模型,并在 Arabic MMLU、Exams、MadinahQA、Aratrust 等任务上领先。

5月16日周五
  1. OpenAI News62

    OpenAI 发布 o3 与 o4-mini 系统卡补充说明:Codex

    OpenAI 为 o3 和 o4-mini 系统卡发布补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直到通过。

    推荐理由:官方系统卡补充说明披露了 Codex 背后的 codex-1 及其训练方式,可了解该编码智能体的技术来源。

5月15日周四
  1. Hugging Face Blog62

    Falcon-Edge 发布 1B 与 3B 三值量化语言模型系列

    Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。

    推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。

5月7日周三