最近在试着把llama3.1-8B或者Qwen2.5-7B部署到自己的双3090上,跑推理服务给团队用。先试了FP16,显存直接爆了,后来查资料说AWQ量化能降到原来一半左右,我就用AutoAWQ做了4bit量化,结果跑起来一看,显存占用还是15-16G,几乎没怎么降。查了代码发现好像是因为模型加载时默认还是用FP16的权重?或者是量化后推理时算子没切到位?我用了vLLM加载,设了dtype=auto,但效果不明显。有没有大佬踩过这个坑?AWQ量化后显存占用的瓶颈到底在哪?是需要手动调一下并行策略,还是vLLM对量化模型的显存管理本身就有问题?真心求助,谢谢。