最近在搞一个法律问答的LoRA微调,基座是Qwen2-7B-Instruct,微调用的是4bit QLoRA,跑完测试集效果还行。但部署到生产环境时发现推理速度比原版慢了好多——原来大概25 token/s,现在只有12 token/s,显存占用倒是没爆(大概14GB/24GB)。我试过关掉微调权重直接用原版,速度就恢复正常。
目前用的是vLLM加载,gptq量化,max_model_len调到4096。想问问大家:这种情况是不是因为LoRA权重在推理时动态合并导致的额外开销?还是说量化对微调后的权重不友好?有没有什么部署技巧能兼顾速度和效果?真诚求教,谢谢。