最近在搞一个本地知识库问答的项目,用的Qwen2-7B-Instruct,显卡是4090 24G。直接FP16加载,上下文一长(超过2k)就OOM,试了AWQ 4bit量化,显存倒是下来了,但回答质量明显下降,尤其是涉及代码生成和逻辑推理的时候,幻觉变多。也试过GPTQ和GGUF的Q4_K_M,感觉都差不多。想问下各位,部署这种7B模型到底该怎么选精度和量化方案?是不是我上下文长度设置有问题,或者应该用vLLM这类框架做流式处理来省显存?求真实经验,别上来就让我上A100。