跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 161–180 条 · 共 243 条
5月14日周二
  1. Hugging Face Blog62

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。

5月13日周一
  1. Hugging Face Blog71

    Hugging Face 发布 Transformers Agents 2.0

    Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增两类可基于历史观察迭代的智能体,并加入共享功能。官方称新框架下 Llama-3-70B-Instruct 智能体在 GAIA 榜单上超过多个基于 GPT-4 的智能体,排名第 4,成为开源类别领先者。

    推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。

4月29日周一
4月18日周四
4月15日周一
4月9日周二
  1. Hugging Face Blog62

    Google 发布代码专用模型 CodeGemma,含 2B 与 7B 三个版本

    Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。

    推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。

3月22日周五
3月20日周三
  1. Hugging Face Blog62

    Cosmopedia:如何为 LLM 预训练构建大规模合成数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。

    推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。

  2. Hugging Face Blog62

    Hugging Face 介绍 GaLore:在消费级硬件上训练大模型

    Hugging Face 发布博客介绍 GaLore 优化器,可将优化器状态内存占用降低超过 82.5%,让 70 亿参数模型(如 Llama 架构)在 NVIDIA RTX 4090 等消费级 GPU 上训练。

    推荐理由:原文给出 GaLore 与 8-bit 优化器结合的完整用法和可运行代码,读者可据此在消费级显卡上复现大模型训练。

2月28日周三
2月21日周三
  1. Hugging Face Blog77

    Google 发布开源大模型 Gemma,Hugging Face 全面集成

    Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。

    推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。

2月16日周五
  1. Hugging Face Blog62

    Hugging Face 教程:用开源 LLM 合成数据训练定制模型,成本降至 2.7 美元

    Hugging Face 发布教程,展示如何用开源 LLM 生成合成数据来训练更小更专用的模型。案例以金融新闻投资者情绪分类为例,用 Mixtral-8x7B-Instruct-v0.1 配合 CoT 与 Self-Consistency 标注数据。

    推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。

2月8日周四
  1. Hugging Face Blog60

    Hugging Face 为 TGI 和 Inference Endpoints 推出兼容 OpenAI 的 Messages API

    Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接配合 OpenAI 客户端库以及 LangChain、LlamaIndex 使用。

    推荐理由:官方给出 OpenAI 兼容接口的接入方式与限制,读者可据此评估把现有 OpenAI 调用迁到开源模型的成本。

2月1日周四
1月24日周三
  1. Hugging Face Blog62

    Hugging Face 实测开源 LLM 作为 LangChain 智能体的表现

    Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。

    推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。

1月14日周日
1月10日周三
  1. Hugging Face Blog78

    用 Unsloth 和 TRL 让 LLM 微调提速 2 倍

    Hugging Face 博客介绍社区工具 Unsloth,与 transformers、PEFT、TRL 完全兼容,可将 LLM 微调速度提升约 2 倍、显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。

    推荐理由:原文给出 Unsloth 与 TRL 的完整接入代码和 59 次基准数据,读者可据此判断微调提速与显存节省幅度。

1月2日周二
12月20日周三
  1. Hugging Face Blog62

    用投机解码让 Whisper 推理提速 2 倍

    Hugging Face 博客介绍如何用投机解码(Transformers 中的 assisted generation)将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。

    推荐理由:以 Whisper 为例给出投机解码的完整实现与基准数据,可迁移到其他自回归模型的推理加速。

12月11日周一