Hugging Face Blog·· 2023-12-05AI 评分52
Hugging Face 如何让 LoRA 推理提速 300%:告别冷启动
Goodbye cold boot - how we made LoRA Inference 300% faster
AI 导读
Hugging Face 在 Inference API 中实现 LoRA 动态加载,让基础模型保持热启动、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应时间从 35 秒降到 13 秒。
来源:Hugging Face Blog · huggingface.co