最近在搞一个内部知识库问答的demo,模型选的Qwen2.5-7B-Instruct。服务器是两张4090,单卡24G。刚开始直接FP16加载,单卡推理,结果上下文一长(超过4K)就OOM,后来切了张量并行,两张卡一起跑,总算能跑到8K,但吞吐量特别拉胯。想试试AWQ或者GPTQ量化到4bit,显存是降下来了,但回答质量肉眼可见下降,尤其是代码生成和数学逻辑题,经常胡说八道。