最近想把Llama-3-8B部署到本地做代码生成,用的是4090 24G显存,按理说8B模型量化成4bit应该跑得动。但我实际用Ollama跑Q4_K_M版本,生成速度只有8-10 token/s,还不如我朋友用CPU跑的速度。我看网上别人同配置都能跑到40+,怀疑是不是我的显存频率设置有问题,或者Ollama默认没开GPU加速?另外我试过用vLLM部署,但量化模型老报错,有没有比较稳的部署方案?求有经验的大佬指点一下,我是刚接触这块,不太确定该往哪个方向调优。