最近在做本地知识库问答,用的RAG+ChatGLM3-6B,之前用16G的4090跑4bit量化勉强能行,但最近换了更大的知识库,想升级到Qwen1.5-7B,发现量化到NF4之后显存勉强够(大概14.5G),但回答质量明显下降,特别是长文本推理时经常出现重复和逻辑断裂。试过GPTQ的8bit,又超了大概1.2G显存。也试过offload到CPU,但速度慢到没法用。想问问各位大佬,有没有在4090上跑7B模型还保持效果的办法?比如用vLLM或者什么新的推理框架能优化显存?还是说只能换24G的卡了?有点迷茫,求指点。