最近在折腾本地部署一个简单的Agent(用来做文档问答和工具调用),用的Qwen2.5-7B,量化到4bit之后还是吃显存,我的3060 12G有点扛不住,跑几个并发就OOM了。试过用CPU推理,但速度太慢,交互体验很差。也看了Llama.cpp和Ollama,但感觉对工具调用和函数回调的支持不够灵活,跟LangChain对接有点别扭。想问下各位大佬,在不换显卡的前提下,有没有什么方案能兼顾显存占用和Agent的可用性?比如换更小的模型(3B/1.5B)配合RAG,或者用API做兜底?另外,大家有没有试过用vLLM配合paged attention,实际能省多少显存?求分享下实战经验,感谢!