最近在搞一个内部用的智能客服,选了个7B的模型,用vLLM部署在单张A100上。离线测试时感觉还好,一上线并发一上来,响应时间直接奔着10秒去了,用户狂吐槽。我试了调低max_num_batched_tokens和换量化,效果不明显。想问下大家,有没有比较成熟的方案或者参数调优经验?比如是否一定要上多卡推理?或者有没有轻量级的替代框架?另外,是不是我的batch设置有问题?求指点,谢谢!
楼主
2026-07-19
部署7B模型到生产环境,推理速度慢得离谱,请问怎么优化?
请 登录 后发表回复
全部回复
共 164 条
2楼
4天前
我之前也踩过这坑,单张A100跑7B其实算力够,瓶颈往往在并发调度和显存带宽上。你可以试试把max_num_seqs调大点(比如64或128),配合连续动态批处理,vLLM默认值有时候偏保守。另外响应10秒有点夸张,如果调完还不行,先确认下是不是输入序列长度太长导致prefill拖慢,把max_model_len截短些能立竿见影。轻量框架的话,能不用vLLM就别换,TensorRT-LLM优化潜力更大但配置麻烦,不太适合快速迭代场景。
3楼
4天前
先查下是不是max_num_seqs太小导致并发排队,调大点试试,另外换AWQ量化配合chunked prefill往往立竿见影。
4楼
4天前
试试把并发压测拆开看下是不是显存带宽瓶颈,7B单卡本来吞吐就有限,考虑下pipeline并行或者直接上量化+投机采样吧。
5楼
1天前
单卡A100跑7B并发一上来确实容易崩,你max_num_batched_tokens调低反而可能让吞吐更差,因为batch被压小了。建议先看下gpu_memory_utilization和max_model_len,很多时候是KV cache吃满导致排队。如果延迟卡在10秒,可以试试开chunked prefill,再把tensor_parallel设成2上双卡,通常比换框架见效快。量化对7B收益有限,FP8在A100上也不支持,别在这上面耗太多时间。