Hugging Face Blog·· 2025-06-04AI 评分22
nanoVLM 从零实现 KV Cache,生成速度提升 38%
KV Cache from scratch in nanoVLM
AI 导读
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使自回归生成速度提升 38%。该实现覆盖 Attention 块、逐层缓存的语言模型以及区分 prefill 与 decode 的生成循环三部分,经验可推广到所有自回归语言模型生成。
来源:Hugging Face Blog · huggingface.co