最近在折腾一个RAG+工具调用的Agent项目,用的Qwen2.5-7B-Instruct,量化到4bit后单卡3090勉强能跑。但问题是加上embedding模型和向量库,显存直接爆了,只能不停清缓存。我看很多人说用vLLM部署能省显存,但我试了下,配合LangChain的Agent时总报兼容性问题,要么是tool calling格式不对,要么是流式输出卡住。想请教下各位,本地部署大模型做Agent到底怎么选推理框架?是继续用transformers硬扛,还是换更小的模型(比如3B)?另外,有没有办法让embedding模型和LLM共享显存而不互相干扰?求具体可行的方案,谢谢!