最近在折腾本地部署Qwen2.5-7B给Agent当推理后端,显卡是4080 16G,显存占用才10G左右,但每次工具调用的推理延迟要4-5秒,多轮对话时甚至能飙到8秒。我开了vLLM,max_length设了4096,温度0.7,也没开流式。看GPU利用率只有60%左右,CPU内存也没爆。看网上别人用同样显卡跑7B都说秒回,我怀疑是不是量化版本的问题?还是说Agent场景下system prompt太长(我塞了大概800字工具描述)导致prefill阶段太慢?求有经验的大佬指点一下优化方向,或者告诉我这个延迟其实正常……先谢过了。