跳到正文
原文
Hugging Face Blog·· 2021-01-18AI 评分40

Hugging Face 如何为 API 客户将 Transformer 推理提速 100 倍

How we sped up transformer inference 100x for 🤗 API customers

AI 导读

Hugging Face 通过模型管线优化、Rust 版 Tokenizers 与智能缓存,为 Accelerated Inference API 客户实现约 10 倍推理提速,再借助 ONNX Runtime 的图优化、算子融合与量化等硬件相关编译手段拿到另外 10 倍,合计 100 倍。

来源:Hugging Face Blog · huggingface.co