最近在搞一个内部用的智能客服,选了个7B的模型,用vLLM部署在单张A100上。离线测试时感觉还好,一上线并发一上来,响应时间直接奔着10秒去了,用户狂吐槽。我试了调低max_num_batched_tokens和换量化,效果不明显。想问下大家,有没有比较成熟的方案或者参数调优经验?比如是否一定要上多卡推理?或者有没有轻量级的替代框架?另外,是不是我的batch设置有问题?求指点,谢谢!
楼主
22小时前
部署7B模型到生产环境,推理速度慢得离谱,请问怎么优化?
请 登录 后发表回复
全部回复
共 2 条
2楼
21小时前
同样7B模型单卡A100,我之前也踩过这个坑,后来发现vLLM的调度参数对并发影响很大,试试调高max_num_seqs到128以上,同时把enable_prefix_caching打开,能显著减少重复计算。另外如果数据量不大,可以切一部分用小模型做意图分类再路由到7B,响应能快很多。
3楼
12小时前
单卡A100跑7B并发高了确实吃力,试试把max_num_seqs调低到16-32,同时开FP8量化看看。