跳到正文

#开源生态

今日 4 条
6月27日周四
6月13日周四
6月12日周三
6月7日周五
  1. Hugging Face Blog18

    Hugging Face 将重新设计 Transformers 文档

    Hugging Face 宣布重新设计 Transformers 文档,原因是现有文档内容零散、导航困难且过时。新版将面向构建 AI 产品的开发者,采用代码优先、解决方案导向的写法,并放弃 Diátaxis 的刚性结构,改为随内容自然生长的有机结构,让新增内容与原有文档融合而非层层叠加。

6月6日周四
6月5日周三
  1. Mistral AI62

    Mistral 在 la Plateforme 推出模型定制与微调服务

    Mistral AI 在 la Plateforme 上线模型定制功能,提供三种微调入口:面向自建基础设施的开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。

    推荐理由:Mistral 给出微调的三条落地路径与 LoRA 效率对比,读者可据此判断自建还是托管微调更合适。

6月4日周二
5月29日周三
  1. Mistral AI62

    Mistral AI 发布非生产许可 MNPL,Codestral 率先采用

    Mistral AI 推出非生产许可 MNPL,允许开发者将技术用于非商业用途并支持研究工作,要求基于其成果开展商业业务的一方以公平可持续的方式合作。Codestral 于同日在该许可下发布。Mistral 表示将继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。

    推荐理由:Mistral 推出 MNPL 非生产许可,读者可了解其如何在开放原则与商业可持续之间划界。

5月28日周二
5月24日周五
  1. Hugging Face Blog62

    TII 发布 Falcon 2:11B 参数预训练语言模型与 VLM,训练数据超 5000B tokens、支持 11 种语言

    TII 发布 Falcon 2 系列,包含 11B 基础语言模型和具备图像理解能力的 11B VLM,训练数据超过 5000B tokens,主要支持英语并覆盖西班牙语、法语、德语等另外十种语言。

    推荐理由:TII 官方给出 Falcon 2 的训练数据、架构与评测对比,可据此判断 11B 小模型在多语言和视觉理解上的位置。

5月22日周三
5月21日周二
5月16日周四
5月14日周二
  1. Hugging Face Blog62

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。

5月13日周一
  1. Hugging Face Blog71

    Hugging Face 发布 Transformers Agents 2.0

    Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增两类可基于历史观察迭代的智能体,并加入共享功能。官方称新框架下 Llama-3-70B-Instruct 智能体在 GAIA 榜单上超过多个基于 GPT-4 的智能体,排名第 4,成为开源类别领先者。

    推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。

5月9日周四
5月5日周日
5月1日周三
4月29日周一
4月19日周五
4月18日周四
4月17日周三
  1. Mistral AI82

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅激活 39B,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准表现,可据此判断其成本与能力定位。

4月16日周二
4月15日周一
4月11日周四
  1. Hugging Face Blog38

    Hugging Face 详解视觉语言模型:架构、开源模型与微调方法

    Hugging Face 发布视觉语言模型入门指南,梳理其核心架构由图像编码器、嵌入投影器和文本解码器组成,并盘点 LLaVA 1.6、CogVLM、Qwen-VL、Yi-VL-34B 等开源模型。文章还介绍了 Vision Arena、Open VLM Leaderboard 等评测榜单及 MMMU、MMBench 等基准,并演示如何用新版 trl 微调这类模型。

4月10日周三
4月9日周二
  1. Hugging Face Blog62

    Google 发布代码专用模型 CodeGemma,含 2B 与 7B 三个版本

    Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。

    推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。

4月4日周四
  1. Hugging Face Blog38

    Hugging Face 与 Wiz Research 合作提升 AI 安全

    Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台的安全缺陷,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。

4月3日周三
4月2日周二
3月22日周五
3月20日周三
  1. Hugging Face Blog62

    Cosmopedia:如何为 LLM 预训练构建大规模合成数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。

    推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。