最近想在单张A100(80G)上部署Qwen2.5-32B-Instruct做内部工具,量化到AWQ 4bit后显存大概还剩10G左右。我先试了vLLM,吞吐还行,但首token延迟偶尔会飙到3秒多,感觉不太稳定。后来换了SGLang,首token快了一些,但并发一高就报OOM,查了下好像是prefill和decode内存复用的问题,没调明白。
最近想在单张A100(80G)上部署Qwen2.5-32B-Instruct做内部工具,量化到AWQ 4bit后显存大概还剩10G左右。我先试了vLLM,吞吐还行,但首token延迟偶尔会飙到3秒多,感觉不太稳定。后来换了SGLang,首token快了一些,但并发一高就报OOM,查了下好像是prefill和decode内存复用的问题,没调明白。
SGLang那个OOM调下--mem-fraction-static试试,我之前调低点就好了,vLLM可以开prefix-caching压首token延迟。