Hugging Face 如何为 API 客户将 Transformer 推理提速 100 倍
Hugging Face 通过模型管线优化、Rust 版 Tokenizers 与智能缓存,为 Accelerated Inference API 客户实现约 10 倍推理提速,再借助 ONNX Runtime 的图优化、算子融合与量化等硬件相关编译手段拿到另外 10 倍,合计 100 倍。
Hugging Face 通过模型管线优化、Rust 版 Tokenizers 与智能缓存,为 Accelerated Inference API 客户实现约 10 倍推理提速,再借助 ONNX Runtime 的图优化、算子融合与量化等硬件相关编译手段拿到另外 10 倍,合计 100 倍。
Hugging Face 发布教程,介绍如何用 BERT、GPT2 等预训练检查点热启动 encoder-decoder 模型,从而跳过昂贵的预训练阶段。该方法基于 Rothe 等人 2020 年的论文,在多个序列到序列任务上以极低训练成本达到与 T5、Pegasus 等大型预训练 encoder-decoder 模型相当的效果。
Hugging Face 发布客座博客,记录将 Facebook FAIR 的 fairseq wmt19 新闻翻译系统移植到 transformers 的完整过程。
Hugging Face Transformers 在 3.1 版本中与 Ray Tune 集成,用户只需在 Trainer 的 hyperparameter_search 中指定 backend="ray" 即可调用 HyperBand、Bayesian Optimization、Population-Based Training 等调参算法。
Hugging Face 发布博客详解基于 Transformer 的编码器-解码器架构如何建模序列到序列问题,聚焦其数学模型与推理用法,并拆解编码器、解码器两部分。
Hugging Face 发布 PyTorch 扩展 pytorch_block_sparse,其 BlockSparseLinear 可直接替换 torch.nn.Linear,让模型更小更快。
Hugging Face 博客详解 Reformer 模型,它能在不到 8GB 内存下训练长度达 50 万 token 的序列,而 bert-base-uncased 仅支持 512 token。Reformer 通过局部与 LSH 自注意力、分块前馈层、可逆残差层和轴向位置编码四项改造降低内存占用,并已集成进 Transformers 库。
Hugging Face 发布教程,介绍如何用 transformers 库实现自回归语言生成的多种解码方法,包括贪心搜索、beam search 和采样。文中以 GPT2 为例给出可运行代码,演示 num_beams、no_repeat_ngram_size、temperature、top_k、top_p 等参数的效果。
推荐理由:系统梳理贪心、beam search 与采样等解码策略的差异,并给出 transformers 中可直接运行的参数配置。
Hugging Face 发布教程,演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数的小型语言模型 EsperBERTo,并在世界语上完成预训练与词性标注微调。
推荐理由:以世界语为例完整走通从零预训练到下游微调的流程,可迁移到其他低资源语言。