跳到正文

#Hugging Face

今日 0 条
11月29日周一
  1. Hugging Face Blog36

    Hugging Face 推出 Data Measurements Tool:用于查看数据集的交互式工具

    Hugging Face 发布开源 Python 库与无代码界面 Data Measurements Tool,基于 Dataset 和 Spaces Hub 及 Streamlit 构建,可在线构建、测量和比较数据集。该工具能自动计算词汇量、标签分布、实例长度、重复项及 Zipf 定律拟合度等指标,帮助数据集创建者和用户进行负责任的数据开发。

11月15日周一
11月4日周四
10月26日周二
  1. Hugging Face Blog30

    大语言模型:新的摩尔定律?

    微软和 NVIDIA 发布 Megatron-Turing NLG 530B,号称全球最大最强的生成式语言模型,但复现该实验的基础设施成本接近 1 亿美元。作者质疑这类超大模型趋势:单台 DGX A100 服务器售价 19.9 万美元、功耗最高 6.5 千瓦,而 2019 年马萨诸塞大学研究显示在 GPU 上训练 BERT 的碳排放约等于一次横跨美国的飞行。

10月25日周一
10月20日周三
10月13日周三
10月5日周二
9月24日周五
9月14日周二
  1. Hugging Face Blog60

    Hugging Face 发布 Optimum:面向大规模 Transformer 的优化工具库

    Hugging Face 发布开源库 Optimum,目标是简化 Transformer 模型在特定硬件上的训练与推理优化,首个合作方为 Intel。Optimum 与 Intel Neural Compressor 配合,可对 BERT 等模型做训练后量化、量化感知训练和动态量化,用于 Intel Xeon CPU 部署。

    推荐理由:Hugging Face 官方发布 Optimum 开源库,读者可了解其与 Intel Neural Compressor 配合量化 Transformer 的路径。

7月15日周四
  1. Hugging Face Blog62

    Hugging Face 提出 DeDLOC 协作训练方法,40 名志愿者预训练出孟加拉语模型 sahajBERT

    Hugging Face 等机构提出 DeDLOC 协作分布式训练方法,可自适应参与者的网络与硬件条件,并用 40 名志愿者预训练出孟加拉语模型 sahajBERT。

    推荐理由:DeDLOC 用 40 名志愿者和家用 GPU 预训练出孟加拉语模型,读者可了解分布式协作训练如何绕开算力门槛。

7月13日周二
7月8日周四
6月28日周一
6月3日周四
5月25日周二
  1. Hugging Face Blog62

    Gradio 2.0 发布:一行代码加载并混用 Hugging Face 模型

    Gradio 2.0 发布,可用一行代码为几乎任意 Hugging Face 模型生成 GUI,默认调用 Hugging Face 托管的 Inference API,也可本地运行 transformers 计算。该版本支持并行加载多个模型做对比、串联多个模型构建复杂应用,例如用 3 行代码搭建翻译并摘要芬兰语新闻的应用。安装方式为 pip install gradio。

    推荐理由:Gradio 2.0 把 Hugging Face 模型加载与界面搭建压缩到一行代码,读者可据此判断模型演示与组合应用的门槛变化。

4月20日周二
4月16日周五
  1. Hugging Face Blog60

    Hugging Face 发布 Accelerate 库,让原始 PyTorch 训练脚本适配任意设备

    Hugging Face 发布开源库 Accelerate,让原始 PyTorch 训练脚本无需重写即可在任意设备上运行。只需在标准训练脚本中加入约五行代码,即可支持单机或多机多 GPU、TPU 以及混合精度训练,并自动处理设备放置。

    推荐理由:官方给出五处代码改动即可跑分布式与混合精度的对比,便于判断迁移成本。

4月8日周四
3月31日周三
  1. Hugging Face Blog34

    深入理解 BigBird 的块稀疏注意力机制

    Hugging Face 博客解析 BigBird 的块稀疏注意力机制,该模型已随 🤗Transformers 提供 RoBERTa 风格版本,可处理最长 4096 的序列,计算成本远低于 BERT。BigBird 用滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的全注意力,目标不是超越 BERT,而是在长序列上更高效。

3月23日周二
3月18日周四
3月12日周五
3月9日周二
2月25日周四
  1. Hugging Face Blog22

    Hugging Face 工程师谈构建神经网络时的调试思路

    Hugging Face 工程师分享构建和调试神经网络的思考流程,建议先放下机器学习、专注分析数据标签与噪声,再从逻辑回归、word2vec、fastText 等简单基线起步,并对照随机预测器评估指标。作者还建议不要迷信五行代码模板,实现后可用 16 条样本做小批量过拟合测试,若无法达到 0 loss 则很可能存在实现错误。

2月10日周三
2月9日周二
1月26日周二
1月19日周二
1月18日周一
11月9日周一
11月3日周二
11月2日周一
10月10日周六
9月10日周四
7月3日周五
3月1日周日
  1. Hugging Face Blog62

    如何用 Transformers 生成文本:不同解码方法详解

    Hugging Face 发布教程,介绍如何用 transformers 库实现自回归语言生成的多种解码方法,包括贪心搜索、beam search 和采样。文中以 GPT2 为例给出可运行代码,演示 num_beams、no_repeat_ngram_size、temperature、top_k、top_p 等参数的效果。

    推荐理由:系统梳理贪心、beam search 与采样等解码策略的差异,并给出 transformers 中可直接运行的参数配置。