最近在折腾本地部署Qwen2.5-7B-Instruct,用的vLLM,显卡是4090(24G显存)。模型加载没问题,显存占用大概14G,但跑起来生成速度只有8-10 tokens/s,看别人帖子说同样配置能到40+。我试过调--max-model-len--gpu-memory-utilization,也换了FlashAttention,还是没改善。CPU和内存占用都不高,GPU利用率只有30%左右,感觉像在等什么。是不是我量化选得不对(用的AWQ)?还是说vLLM版本和CUDA版本有兼容问题?求大佬指点一下排查方向,或者给个能参考的启动参数,谢谢!