Hugging Face Blog·· 2021-01-18AI 评分40
Hugging Face 如何为 API 客户将 Transformer 推理提速 100 倍
How we sped up transformer inference 100x for 🤗 API customers
AI 导读
Hugging Face 通过模型管线优化、Rust 版 Tokenizers 与智能缓存,为 Accelerated Inference API 客户实现约 10 倍推理提速,再借助 ONNX Runtime 的图优化、算子融合与量化等硬件相关编译手段拿到另外 10 倍,合计 100 倍。
来源:Hugging Face Blog · huggingface.co