最近在折腾本地部署,机器是3090 24G,想跑7B或者13B的模型。试了FP16直接爆显存,改成INT8勉强能跑,但生成质量肉眼可见下降,尤其是代码生成,经常出现语法错误。又试了GPTQ和AWQ,感觉速度还行,但效果还是不如原版。看网上有人说用vLLM或者ollama能优化,我试了ollama,感觉加载快了点,但长文本还是会卡。想问下大家,日常用来写代码和查资料,一般怎么平衡显存占用和模型效果?有没有什么实用的优化技巧或者推荐的量化方案?另外,是不是应该直接换个更小的模型,比如把13B换成7B,还是说量化调参更值得折腾?有点迷茫,求指点。