跳到正文
原文
Hugging Face Blog·· 2025-12-11精选AI 评分62

llama.cpp server 新增 router 模式,支持动态加载与切换多个模型

New in llama.cpp: Model Management

AI 导读

llama.cpp server 新增 router 模式,无需重启即可动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;模型按需加载,超过 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。

推荐理由

llama.cpp server 新增 router 模式,读者可据此了解本地多模型热切换与显存回收的具体做法。

来源:Hugging Face Blog · huggingface.co