最近在折腾本地跑70B模型,设备是双卡4090,48G显存。试了FP16直接OOM,后来用AWQ量化到4bit能跑了,但推理速度慢得离谱,生成一段代码要等半天。更尴尬的是,量化后代码生成质量明显下降,逻辑经常出错,感觉跟API差了一大截。网上看很多人说用vLLM或者TensorRT-LLM能提速,但配置起来一头雾水,踩了一堆坑。想问问各位佬,是继续抠量化方案还是直接换小模型?或者有没有什么成熟的部署框架推荐?目标就是本地写代码辅助用,能稳定生成不崩就行。求真实经验,别让我再当小白鼠了。