最近在折腾本地部署,机器是3090(24G),想跑Qwen2.5-14B做代码补全。直接加载FP16会OOM,试了GPTQ和AWQ 4bit量化,显存是降下来了,但补全的代码质量明显下降,经常出现语法错误或者逻辑不对。也试过llama.cpp的Q5_K_M,速度倒是还行,但效果还是不如FP16。