最近在折腾本地部署,想搞个开源模型做代码补全和文档总结。看了一圈,Qwen和Llama系列都挺火,但真到自己上手发现坑好多。我手上只有一张4090 24G,试了下7B的量化版倒是能跑,但速度一般,而且上下文一长就爆显存。看网上有人说用llama.cpp配合GGUF格式能压到很小,但效果损失怎么样?还有如果用vLLM或者TGI这种框架,是不是对显存要求更高?另外量化到4bit会不会导致输出质量明显下降?求有经验的老哥指点一下,预算有限暂时不考虑租云GPU,就想本地玩一玩。