跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 181–200 条 · 共 243 条
12月11日周一
  1. Hugging Face Blog80

    Mistral 发布 Mixtral 8x7B,Hugging Face 全面集成

    Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。

    推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。

12月5日周二
  1. Hugging Face Blog62

    Hugging Face 与 AMD 实现 AMD GPU 上大语言模型开箱即用加速

    Hugging Face 与 AMD 宣布合作进展,Transformers 模型和任务现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。

    推荐理由:Hugging Face 与 AMD 公布开箱即用支持进展,读者可了解在 AMD Instinct 上运行 Transformers 与 TGI 的实际路径与性能对比。

11月9日周四
10月27日周五
10月24日周二
10月19日周四
10月3日周二
  1. Hugging Face Blog62

    Hugging Face tokenizers 新增 chat_template 属性,解决聊天格式错配导致的性能下降

    Hugging Face tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,避免因格式不一致造成的静默性能下降。

    推荐理由:Hugging Face 把聊天格式从 transformers 硬编码搬到 tokenizer 属性,读者可据此理解格式错配为何会静默拉低模型表现。

9月27日周三
  1. Mistral AI80

    Mistral AI 发布 7.3B 参数模型 Mistral 7B

    Mistral AI 发布 7.3B 参数语言模型 Mistral 7B,采用 Apache 2.0 许可,可无限制使用,并提供了参考实现、vLLM 推理服务器、Skypilot 及 HuggingFace 等使用方式。

    推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并给出 Apache 2.0 许可与本地、云端部署路径。

9月13日周三
  1. Hugging Face Blog62

    Hugging Face 发布 Würstchen:面向图像生成的快速扩散模型

    Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。

    推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。

9月8日周五
  1. Hugging Face Blog62

    Hugging Face 为 SDXL 带来 T2I-Adapter 支持

    Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。

    推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。

9月6日周三
  1. Hugging Face Blog80

    TII 的 Falcon 180B 上线 Hugging Face

    TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。

    推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。

8月25日周五
  1. Hugging Face Blog82

    Code Llama 发布:Llama 2 学会写代码,Hugging Face 生态同步集成

    Meta 发布 Code Llama,这是基于 Llama 2 初始化、在 5000 亿 token 代码数据上训练的代码模型家族,包含 7B、13B、34B 三个规模,并额外提供 Python 专精版和指令微调版,采用与 Llama 2 相同的社区许可,可商用。

    推荐理由:Hugging Face 生态对 Code Llama 的集成说明,含 7B/13B/34B 各版本基准与部署方式,便于判断选型与落地成本。

8月22日周二
  1. Hugging Face Blog66

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,复现 DeepMind 未公开的 Flamingo,接受任意图像与文本序列输入并生成文本。模型提供 9B 和 80B 两个参数规模,各有基础版和指令微调版,仅基于公开数据与模型(LLaMA v1、OpenCLIP)构建。

    推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可了解其数据构成与开放程度。

8月8日周二
7月27日周四
  1. Hugging Face Blog62

    Hugging Face 与 Apple 用混合位宽量化把 Stable Diffusion XL 搬上 Mac Core ML

    Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。

    推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。

7月18日周二
7月5日周三