最近在捣鼓本地部署大模型跑Agent,用的Qwen2.5-7B,量化到4bit了,但一开多轮对话+工具调用,显存就飙到接近14G,我的3080ti 12G直接爆掉。试过vLLM,但好像对Agent那种流式输出和频繁切换工具支持不太好,经常报错。也试过用CPU+GPU混合,但速度慢得离谱。想问下大家在生产或实验环境里,跑这种需要多轮推理的Agent应用,是直接上多卡,还是有什么省显存的黑科技?或者干脆用API,本地部署的意义就不大了?求指点。