刚把微调好的Llama 3 8B模型用vLLM部署到一台A100上,显存占用才40%左右,但每次请求都要等5-6秒才出第一个token,完全没法用。我试了调整batch size和max_num_seqs,效果不明显。是不是因为模型是FP16加载的,或者我的量化方式不对?有看到别人说用AWQ量化能快很多,但不太清楚具体怎么跟vLLM配合。另外,我的请求大多是短文本生成(几十个token),是不是应该用某种流式输出或者预填充策略?求有经验的大佬指点一下,真的被卡住了,项目要赶着上线……
楼主
22小时前
部署Llama 3 8B到生产环境,显存够但推理慢得离谱,怎么优化?
请 登录 后发表回复
全部回复
共 2 条
2楼
16小时前
试一下把vLLM的prefill chunk size调小,短文本生成用这个参数效果挺明显的。
3楼
9小时前
A100跑8B模型按理说不应该这么慢,5-6秒的首token延迟明显不正常。你检查一下vLLM的--block-size参数没有?默认16可能太大,短文本生成改成8或4能显著降低预填充耗时。另外AWQ量化确实能提速,vLLM原生支持,直接用quantization=awq加载模型就行,但记得先装好autoawq库。还有一个可能:如果微调时添加了特殊token或padding,vLLM的tokenizer配置没对齐会导致计算浪费,建议用--tokenizer-mode auto试试。