最近在折腾MCP(模型上下文协议),把几个常用的数据处理工具接进本地跑的Qwen2.5-7B。发现只要模型发起工具调用,显存就从原来的9G直接飙到12G+,多轮对话时甚至会OOM。我试过在加载模型时设torch.cuda.set_per_process_memory_fraction,但好像对MCP的子进程或工具执行部分不起作用。是不是MCP的server端会默认预分配显存?还是说框架在工具返回结果时会重新构建上下文导致缓存爆炸?有没有什么配置能限制单次工具调用的显存峰值,或者强制清理KV cache?求实战经验,官方文档翻了一圈没找到明确说法。