跳到正文
原文
Hugging Face Blog·· 2023-12-05精选AI 评分62

Hugging Face 发布 Optimum-NVIDIA,一行代码加速 LLM 推理

Optimum-NVIDIA Unlocking blazingly fast LLM inference in just 1 line of code

AI 导读

Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改成 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒。

推荐理由

官方给出单行代码替换即可提速的量化数据与 FP8 支持范围,便于判断迁移成本。

来源:Hugging Face Blog · huggingface.co