最近在折腾本地部署,机器是RTX 4090 24G,想跑Qwen2.5-7B-Instruct。FP16加载后显存刚好卡在23G左右,稍微加长上下文就爆了。试了GPTQ 4bit,显存占用降下来了,但生成明显变“笨”,代码和逻辑推理经常出错。也试过AWQ,感觉差不多。想问下有没有什么折中方案?比如用FP8或者混合精度,或者有什么优化库能榨干显存?另外,长文本场景下KV Cache是不是特别吃显存,有没有动态释放或者压缩的办法?不求跑满,但希望质量和占用能平衡一下。