最近在折腾一个RAG+工具调用的Agent项目,考虑到隐私和成本,想用本地模型跑。试了Qwen2.5-7B,量化到4bit,单轮对话还行,但一旦挂上多轮记忆和检索上下文,显存直接爆,还经常把前面的指令忘了。看了下vLLM,支持长上下文但似乎要吃更多显存;又试了llama.cpp,速度又跟不上。想问问各位,你们在16G显存或者纯CPU环境下,是怎么平衡上下文长度和性能的?有没有什么配置或者裁剪上下文的技巧?现在有点卡在这了,求指点。