最近在折腾本地部署Qwen2.5-7B-Instruct,用的vLLM,显卡是4090(24G显存)。模型加载没问题,显存占用大概14G,但跑起来生成速度只有8-10 tokens/s,看别人帖子说同样配置能到40+。我试过调--max-model-len、--gpu-memory-utilization,也换了FlashAttention,还是没改善。CPU和内存占用都不高,GPU利用率只有30%左右,感觉像在等什么。是不是我量化选得不对(用的AWQ)?还是说vLLM版本和CUDA版本有兼容问题?求大佬指点一下排查方向,或者给个能参考的启动参数,谢谢!
楼主
1天前
部署Qwen2.5-7B本地服务,显存够但推理慢得离谱,是哪里配置不对?
请 登录 后发表回复
全部回复
共 1 条
2楼
11小时前
看描述像是vLLM的调度问题,4090跑7B AWQ正常应该能到50+。你试试加--enable-chunked-prefill,然后把--max-num-seqs调低到16,另外确认下是不是旧版vLLM没开--use-flash-attn的自动检测。我之前遇到过类似情况,最后是更新vLLM到0.6.3+才解决,CUDA 12.1配flash-attn 2.6.1比较稳。还有个小坑,AWQ的group size如果设128比32慢不少,你检查下模型配置。