跳到正文

#模型发布

今日 0 条
7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。

    推荐理由:Google 一次补齐 Gemma 2 的小尺寸、安全分类器和可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。

7月24日周三
  1. Mistral AI78

    Mistral AI 发布 Mistral Large 2,123B 参数支持 128k 上下文

    Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。

    推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。

7月23日周二
  1. Hugging Face Blog88

    Llama 3.1 发布:405B、70B 与 8B,支持多语言和长上下文

    Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。

    推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,可作为部署选型的参考。

7月18日周四
7月16日周二
  1. Mistral AI71

    Mistral 发布 Codestral Mamba 代码模型

    Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,在 256k tokens 的上下文检索测试中表现良好,官方称其代码与推理能力可对标 SOTA Transformer 模型。

    推荐理由:Mamba 架构首次以代码模型形态开放权重,读者可据此了解线性时间推理在代码场景的落地方式。

6月27日周四
6月12日周三
5月29日周三
5月24日周五
  1. Hugging Face Blog62

    TII 发布 Falcon 2:11B 参数预训练语言模型与 VLM,训练数据超 5000B tokens、支持 11 种语言

    TII 发布 Falcon 2 系列,包含 11B 基础语言模型和具备图像理解能力的 11B VLM,训练数据超过 5000B tokens,主要支持英语并覆盖西班牙语、法语、德语等另外十种语言。

    推荐理由:TII 官方给出 Falcon 2 的训练数据、架构与评测对比,可据此判断 11B 小模型在多语言和视觉理解上的位置。

5月14日周二
  1. Hugging Face Blog62

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。

5月13日周一
4月29日周一
4月18日周四
4月17日周三
  1. Mistral AI82

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅激活 39B,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准表现,可据此判断其成本与能力定位。

4月15日周一
4月14日周日
4月9日周二
  1. Hugging Face Blog62

    Google 发布代码专用模型 CodeGemma,含 2B 与 7B 三个版本

    Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。

    推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。

2月28日周三
2月26日周一
2月21日周三
  1. Hugging Face Blog77

    Google 发布开源大模型 Gemma,Hugging Face 全面集成

    Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。

    推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。

1月19日周五
1月4日周四
12月11日周一
  1. Mistral AI85

    Mistral AI 发布开源稀疏 MoE 模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数 46.7B,每个 token 仅激活 12.9B 参数,推理速度比 Llama 2 70B 快 6 倍,在多数基准上匹配或超过 Llama 2 70B 与 GPT3.5,支持 32k token 上下文和英法意德西五种语言。

    推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比边界。

  2. Hugging Face Blog80

    Mistral 发布 Mixtral 8x7B,Hugging Face 全面集成

    Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。

    推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。

11月6日周一
9月27日周三
  1. Mistral AI78

    Mistral AI 发布首个模型 Mistral 7B,以 Apache 2.0 开源

    Mistral AI 发布首个模型 Mistral 7B,这是一个 7B 参数模型,在全部标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布、可无限制使用。官方称这是三个月内从零搭建团队、MLops 栈与数据处理流水线的结果,同时开放 GitHub 仓库和 Discord 频道,并计划今年秋季继续发布更大模型与新架构。

    推荐理由:Mistral AI 首篇官方博客,交代开源路线与 Mistral 7B 的定位,可对照其后续模型演进。

  2. Mistral AI80

    Mistral AI 发布 7.3B 参数模型 Mistral 7B

    Mistral AI 发布 7.3B 参数语言模型 Mistral 7B,采用 Apache 2.0 许可,可无限制使用,并提供了参考实现、vLLM 推理服务器、Skypilot 及 HuggingFace 等使用方式。

    推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并给出 Apache 2.0 许可与本地、云端部署路径。

9月13日周三
  1. Hugging Face Blog62

    Hugging Face 发布 Würstchen:面向图像生成的快速扩散模型

    Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。

    推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。

9月6日周三
  1. Hugging Face Blog80

    TII 的 Falcon 180B 上线 Hugging Face

    TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。

    推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。

8月25日周五
  1. Hugging Face Blog82

    Code Llama 发布:Llama 2 学会写代码,Hugging Face 生态同步集成

    Meta 发布 Code Llama,这是基于 Llama 2 初始化、在 5000 亿 token 代码数据上训练的代码模型家族,包含 7B、13B、34B 三个规模,并额外提供 Python 专精版和指令微调版,采用与 Llama 2 相同的社区许可,可商用。

    推荐理由:Hugging Face 生态对 Code Llama 的集成说明,含 7B/13B/34B 各版本基准与部署方式,便于判断选型与落地成本。

8月22日周二
  1. Hugging Face Blog66

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,复现 DeepMind 未公开的 Flamingo,接受任意图像与文本序列输入并生成文本。模型提供 9B 和 80B 两个参数规模,各有基础版和指令微调版,仅基于公开数据与模型(LLaMA v1、OpenCLIP)构建。

    推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可了解其数据构成与开放程度。

7月18日周二
6月5日周一
5月4日周四
  1. Hugging Face Blog78

    BigCode 发布 StarCoder:15B 参数开源代码大模型

    Hugging Face 与 ServiceNow 联合主导的 BigCode 发布 StarCoder 与 StarCoderBase,两个代码大模型基于 GitHub 上许可宽松的数据训练,覆盖 80 多种编程语言,参数量约 15B、训练 1 万亿 token。

    推荐理由:官方给出 StarCoder 的参数量、训练数据与 HumanEval 对比表,可据此判断开源代码模型当时的位置。

3月14日周二
  1. OpenAI News93

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。

    推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解其能力定位。

  2. OpenAI News89

    OpenAI 发布 GPT-4

    OpenAI 发布 GPT-4,可用于创意与技术写作任务。它能在写歌、写剧本等场景中生成、编辑内容,并与用户反复迭代,还能学习用户的写作风格。

    推荐理由:官方给出 GPT-4 在创意与技术写作上的生成、编辑与风格学习能力,可据此判断写作类任务的可用边界。