最近在做公司内部的一个知识库Agent,想用私有化部署的Qwen2.5-14B(int8量化)来跑。现在卡在资源规划上:单卡A100(80G)能跑,但并发一高就疯狂OOM,试过vLLM,也调了max_num_seqs,但还是会偶尔报错。我们实际场景是十几个内部员工同时用,每个会话要带历史上下文,感觉KV Cache吃显存特别快。想问下有经验的前辈,这种体量的并发需求,是直接上两张卡做张量并行,还是用量化更狠的(比如AWQ)加长上下文截断?另外,RAG检索出来的片段怎么和对话历史拼接,才能减少重复计算又保证效果?有点迷茫,求指点。