跳到正文
原文
Hugging Face Blog·· 2023-12-05AI 评分52

Hugging Face 如何让 LoRA 推理提速 300%:告别冷启动

Goodbye cold boot - how we made LoRA Inference 300% faster

AI 导读

Hugging Face 在 Inference API 中实现 LoRA 动态加载,让基础模型保持热启动、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应时间从 35 秒降到 13 秒。

来源:Hugging Face Blog · huggingface.co