这几天把Llama 3 7B量化后(AWQ 4bit)部署到一台A10(24G显存)上,用vLLM跑,并发8。显存占用才13G左右,但单token生成速度只有15-20 tokens/s,多轮对话时首token延迟能到3秒以上。我看网上别人说7B能跑到40-50 tokens/s,差距也太大了。
已经试过调整max_num_seqs、gpu_memory_utilization,也开了continuous batching,感觉提升不明显。是我哪里设置不对吗?还是说A10本身就这么弱?或者量化方式有问题?有没有大佬能指点下优化方向,或者分享一下你们的部署参数配置?谢谢!