最近在搞一个法律文书问答的垂直小模型,基于Qwen2.5-7B做了LoRA微调。微调完用vLLM部署到一张A10上,但发现推理速度比原版base模型慢了好多,尤其长上下文(4K以上)时首token延迟能到2-3秒。试过TGI也一样,显存占用倒是没爆,但吞吐就是上不去。我已经设了max_model_len=8192,gpu_memory_utilization也调到0.9了,量化也用了GPTQ,但感觉提升不明显。想问下各位老哥,是不是我微调后权重碎片化导致的?还是说7B模型在A10上本来就是这个水平?有靠谱的优化思路吗?或者有没有推荐的部署方案,比如加个prefill/decode解耦之类的高级特性?先谢过各位了。