最近在试着用LoRA微调一个7B的对话模型(基座是Qwen2.5),训练阶段用的batch size=1,显存勉强够用(24G)。但微调完合并权重后,用vLLM部署推理,居然比原始模型多吃了快6G显存,而且并发一高就OOM。我确认过合并后的权重没问题,推理时也没加载训练时的优化器状态。查了一圈,有人说可能是KV cache的预分配问题,也有人说是LoRA的adapter没卸载干净。但我用lora_merge_and_unload()合并后明明只保存了合并权重。有没有大佬遇到过类似情况?是LoRA本身就会增加推理时的显存开销,还是我哪里配置错了?求指点,卡在部署这步好几天了。