Hugging Face Blog·· 2025-04-16AI 评分36
TNG 如何优化 LLM 并发请求的 Prefill 与 Decode 性能
Prefill and Decode for Concurrent Requests - Optimizing LLM Performance
AI 导读
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token,并分析了并发请求下 prefill 与 decode 两阶段的性能差异。
来源:Hugging Face Blog · huggingface.co