最近在捣鼓本地部署,用Llama-3-8B跑一个简单的Agent(就接了个工具调用和几轮记忆),显存占用才6G多(卡是4060Ti 16G),但每次回复都要等15秒以上,有时候工具调用那一步甚至要20秒。看日志也没报错,就是慢。我用了vLLM,max_len设的4096,温度0.7,是不是batch_size或者并发参数没调好?还是说Agent这种多轮交互场景本来就不适合用vLLM?求有经验的大佬指点一下,或者有没有什么适合单卡小显存的推理框架推荐?