最近想把Llama 3 8B部署到自己电脑上跑一跑,显卡是RTX 4070 12G,用的Ollama+llama.cpp。试了Q4_K_M量化,感觉生成速度还行,但一旦把上下文长度调到8K,显存直接吃满,然后开始疯狂swap,卡成PPT。我看别人说12G跑8B应该很轻松,但我这连2K上下文+长对话都费劲。是不是我量化等级选错了?还是说上下文长度和KV cache的关系我没搞懂?另外,用GPTQ或者AWQ会不会比GGUF更省显存?求有经验的大佬指点一下,感谢。