最近在折腾本地部署,想用开源模型(比如Qwen或者Llama)跑一个简单的Agent,功能就是让模型调用几个工具API。结果发现显存直接爆掉,我用的4090 24G,光加载模型就占了快15G,再加上对话历史和工具返回的结果,稍微长一点的会话就直接OOM。我已经试了4bit量化,但还是感觉不够用,vLLM也试过,但好像对Agent这种多轮调用的场景支持不太友好。有没有大佬分享下实际落地的经验?比如是不是该用更小的模型,或者有什么好的显存管理技巧?另外,工具调用的结果是不是应该先截断再喂给模型?现在有点迷茫,求指点。