最近在折腾本地部署,机器是4090 24G,想用VLLM跑Qwen2.5-7B-Instruct做API服务。参考了官方文档,设置了--max-model-len 4096--gpu-memory-utilization 0.9,还用--enforce-eager关闭了CUDA graph。但启动后只要并发请求一多(大概5-6个),显存直接拉满然后OOM,日志里报的是torch.OutOfMemoryError。试过降低max-num-seqs到2,虽然不崩了,但吞吐量感觉还不如直接用transformers。我看别人说7B模型24G挺轻松的,是不是我的KV Cache配置有问题?或者该用AWQ量化版本?求有经验的大佬指点一下,先谢过了。