最近在折腾本地跑7B模型,电脑是4090 24G,准备部署个ChatGLM3或者Qwen1.5玩玩。用的llama.cpp和transformers都试了,FP16直接OOM,加载到一半就爆显存。后来试了4bit量化(GPTQ和AWQ都试了),显存是够了,但生成出来的代码逻辑明显变差,写个递归都能报错。