最近在搞llama2-70B的本地部署,手头有4张A100(40G),用vLLM加载FP16版本,不管怎么调tensor-parallel-size都报OOM,后来改用AWQ 4bit量化勉强跑起来,但生成质量明显下降,尤其是中文长文本逻辑混乱。我看了半天官方文档,说是要开--quantization参数配合GPTQ,但试了还是不行。想问问有经验的老哥:是不是我加载方式有问题?还是说40G单卡根本玩不动70B?如果非要本地跑,有什么靠谱的量化方案或者offload策略推荐吗?不求速度,只求别崩,能跑通就行。