最近在折腾本地部署开源模型,用的是一张24G显存的4090。先试了Llama3-8B,随便输入一段长文本就显存溢出,后来换qwen2-7B稍微好点,但batchsize设成1也经常卡死。我看别人用ollama或者llama.cpp量化后跑得很顺,但我对量化不太熟,怕精度下降太多影响任务效果。主要场景是做长文档摘要,上下文长度需要8k以上。想问下大家,这种需求下是不是必须上量化?还是说用vLLM或者flash attention能缓解显存问题?另外,有没有推荐的量化方案(比如4bit还是8bit)对摘要任务影响小一点的?求有经验的大佬指点,感恩!