跳到正文
原文
Hugging Face Blog·· 2025-04-16AI 评分36

TNG 如何优化 LLM 并发请求的 Prefill 与 Decode 性能

Prefill and Decode for Concurrent Requests - Optimizing LLM Performance

AI 导读

TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token,并分析了并发请求下 prefill 与 decode 两阶段的性能差异。

来源:Hugging Face Blog · huggingface.co