最近在折腾本地部署,机器是4090 24G,想跑Qwen2.5-7B-Instruct做代码补全。我用了vLLM,开了gptq量化(4bit),max-model-len设了8192,结果一启动就OOM,看日志显示KV cache分配失败。后来把max-model-len降到4096勉强能跑,但上下文一长就开始疯狂换页,速度慢到没法用。我查了文档,说7B 4bit大概要6-7G显存,按理说24G应该绰绰有余啊?是不是我--gpu-memory-utilization参数没调好?还是说vLLM对量化模型的支持有问题,应该直接用AWQ或者FP8?另外我注意到有人推荐用llama.cpp的flash attention,说显存占用更低,有点犹豫要不要换方案。有没有大佬指点一下,我这配置到底该怎么调优?