最近把微调好的Qwen2.5-7B模型部署到公司测试服务器上,单卡40G A100,用vLLM启动,设置了max_model_len=4096,gpu_memory_utilization=0.85,结果一跑推理就OOM,日志里看到显存直接飙到38G+。我试过降低batch size到1也不行,但同样的参数部署原版Qwen2.5-7B就没事。微调时用的是LoRA,合并权重后保存的safetensors文件大小和原版差不多。是不是微调后的模型有什么额外的显存开销?还是说vLLM对微调过的模型兼容性不好?求有经验的大佬指点一下排查方向。