最近在折腾本地部署,机器是4090 24G,想跑个7B或13B的模型做代码补全。先试了FP16的Llama-3-8B,加载完权重加KV cache直接OOM,后来用4bit量化(GPTQ)倒是能跑,但生成代码的质量明显下降,尤其是多步推理和长上下文场景,经常出现逻辑断裂。也试过GGUF的Q4_K_M,感觉和GPTQ差异不大。网上看很多人说用vLLM或SGLang能优化显存,但我试了vLLM,同样的量化模型吞吐确实上去了,可单次请求的延迟反而变高了?是不是我配置有问题?另外,像CodeLlama这种专门做代码的模型,量化后是不是比通用模型损失更大?有没有靠谱的折中方案,或者是我该直接换更小的模型?求过来人指点。