Hugging Face Blog·· 2025-12-11精选AI 评分62
llama.cpp server 新增 router 模式,支持动态加载与切换多个模型
New in llama.cpp: Model Management
AI 导读
llama.cpp server 新增 router 模式,无需重启即可动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;模型按需加载,超过 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。
推荐理由
llama.cpp server 新增 router 模式,读者可据此了解本地多模型热切换与显存回收的具体做法。
来源:Hugging Face Blog · huggingface.co