背景:用LoRA微调了一个Qwen2.5-7B,任务挺简单的,就是让模型学会输出特定JSON格式。微调完合并权重,想部署到4090上做推理。看网上说用GPTQ量化到4bit能省不少显存,我就试了试。结果模型加载后显存占用还是12GB多,加上推理时的KV cache,稍微长点的上下文直接OOM。我又试了试AWQ,效果差不多。现在有点懵,是不是合并权重后再量化会把LoRA的成果弄丢?还是说7B模型本身就需要这么大,想跑到百轮对话必须上多卡?求有经验的老哥指点一下,或者推荐个靠谱的量化+部署教程,感谢。