跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

273条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 241–260 条 · 共 273 条
3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 联合 Hugging Face 开源 ViT 与 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 把 ViT 与 ALIGN 连同训练数据一起开源,读者可据此判断视觉语言模型复现的门槛变化。

3月3日周五
2月10日周五
2月8日周三
  1. Hugging Face Blog62

    SpeechT5 上线 Hugging Face Transformers,一套架构支持语音合成、识别与音色转换

    Hugging Face 宣布 SpeechT5 已集成进 Transformers,官方权重发布在 Hugging Face Hub,并提供语音合成、音色转换和语音识别三个 Spaces 演示。

    推荐理由:SpeechT5 以同一套架构覆盖 TTS、语音转换与 ASR,文中给出可直接运行的代码与权重入口,便于判断能否接入现有语音流程。

1月26日周四
12月9日周五
  1. Hugging Face Blog62

    图解 RLHF:从预训练、奖励模型到 PPO 微调

    Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。

    推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。

11月7日周一
11月3日周四
  1. Hugging Face Blog62

    用 Transformers 微调 Whisper 实现多语言 ASR

    Hugging Face 发布教程,逐步讲解如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖模型原理、Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估和 Gradio 演示。

    推荐理由:完整给出用 Transformers 微调 Whisper 的代码流程,并以 8 小时印地语数据把 WER 从 63.5% 降到 32.0% 作为可参照结果。

9月27日周二
9月26日周一
9月21日周三
9月16日周五
9月12日周一
  1. Hugging Face Blog62

    Hugging Face 发布 diffusers 0.3,新增图生图、文本反转与 Mac 支持

    Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性 inpainting 等 pipeline。优化后 Stable Diffusion 显存占用降至 3.2GB,代价是约 10% 的速度损失,并可通过 mps 在 M1/M2 设备上推理。该版本还提供实验性 ONNX 导出与 pipeline、首版文档,社区已分享超过 200 个文本反转概念。

    推荐理由:官方一次性列出 diffusers 0.3 的图生图、文本反转、小显存优化与 Mac 支持,便于判断扩散模型工具链的可用边界。

8月22日周一
7月12日周二
  1. Hugging Face Blog78

    Hugging Face 发布 176B 参数开源多语言模型 BLOOM

    Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。

    推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型在透明度上的做法。

6月28日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Evaluation on the Hub,零代码评测任意模型与数据集

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并汇总到数据集排行榜,官方已用该工具评测了数百个模型。工具已嵌入现有生态,评测提交界面和排行榜都是 Hugging Face Spaces,用户可从数据集页面发起评测。

    推荐理由:官方说明可在 Hub 上零代码评测任意模型与数据集,并给出结果写入模型卡与排行榜的完整流程。

5月16日周一
  1. Hugging Face Blog62

    Gradio 3.0 发布,新增 Blocks 低层 API 与前端重构

    Hugging Face 发布 Gradio 3.0,对 Gradio 库做了彻底重新设计。新版前端改用 Svelte 等现代技术,页面体积更小、加载更快,并改进了 Dataframe 等组件、新增 Gallery 组件和 TabbedInterface 类。

    推荐理由:官方说明 Gradio 3.0 的前端重构与 Blocks 低层 API,读者可据此判断自定义 ML demo 布局与数据流的写法。

5月9日周一
12月21日周二
  1. Hugging Face Blog62

    Gradio 加入 Hugging Face

    Hugging Face 收购机器学习初创公司 Gradio,Gradio 联合创始人撰文宣布这一消息。Gradio 于 2019 年由斯坦福博士生与三位室友发布,用于让机器学习工程师快速搭建并分享模型 demo,至今已有超过 30 万个 demo 用它构建。作者表示加入 Hugging Face 后将继续发展 Gradio,让任何有浏览器和网络连接的人都能使用机器学习模型。

    推荐理由:Gradio 创始人以当事方身份讲述被收购的经过,读者可了解这款开源库从 2019 年起步到 30 万 demo 的路径。

12月15日周三
  1. Hugging Face Blog62

    Hugging Face 将 Perceiver IO 加入 Transformers,支持任意模态

    Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。

    推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。