BestBlogs.dev· Fini.Yang·· 6 小时前AI 评分22
在 16GB 显存/32GB 内存上通过 Strata 本地部署 Qwen3.8-Flash-Next
Local Deployment of Qwen3.8-Flash-Next via Strata
AI 导读
作者用 Strata 在 16GB VRAM、32GB RAM 的硬件上本地部署 Qwen3.8-Flash-Next,测试了 Coder IQ1_M 与 Full IQ2_XS 两个量化版本。IQ2_XS 准确性明显提升,但推理速度仅约 32 tokens/s,内存压力极大。作者认为 32GB RAM 不足以流畅运行更大量化模型,瓶颈主要在内存而非显存。
来源:BestBlogs.dev · bestblogs.dev