最近在折腾基于vLLM的本地部署,用的Qwen2.5-7B,单卡A100 40G。单轮推理没问题,但一旦做连续对话(比如保持5轮以上历史),显存就蹭蹭往上涨,最后直接OOM。查了官方文档,试了调整max_num_batched_tokens和gpu_memory_utilization,好像效果不明显。
有没有老哥遇到过类似问题?是不是需要对历史对话做显存回收,或者vLLM本身有什么参数控制历史缓存?另外,我看到有人提到flash attention能省显存,但我这个版本好像默认就启用了?
求大佬指点,实在不想每次对话都重新加载模型…