最近想搞个本地知识库问答,看网上都说用ChatGLM或者Qwen,就试着在自己笔记本上部署。显卡是4060 8G的,跑7B模型用FP16直接爆显存,加载到一半就OOM了。后来试了4bit量化,倒是能跑起来,但回答质量明显下降,逻辑经常出错,尤其是多轮对话,感觉跟官方api差了一大截。想问下各位,是不是有什么折中的办法?比如用GGUF的Q5或者Q6量化,效果会比GPTQ的4bit好很多吗?或者有没有那种模型分层的方案,把一部分层放在CPU上跑?我看了半天文档有点懵,感觉水很深,求有经验的老哥指点一下。