最近想把Qwen2.5-7B部署到公司内部做私有化问答,服务器是两张A100 80G,按理说应该够用吧?结果一跑起来,直接OOM了两次,查了半天发现是vLLM默认的prefill和decode并发设置太高,手动调低batch size和max_num_seqs才勉强跑起来,但响应慢了不止一倍。
楼主
2026-07-18
部署Qwen2.5-7B到生产环境,显存一直爆,有没有轻量化的方案?
请 登录 后发表回复
全部回复
共 183 条
2楼
2天前
两张A100 80G跑7B还OOM确实有点离谱,vLLM那个默认gpu_memory_utilization是0.9,prefill阶段KV cache直接吃满,建议先把它降到0.85试试。轻量化的话可以看下AWQ或者GPTQ量化版本,7B量化后单卡24G都能跑,精度损失做内部问答基本感知不到。另外max_model_len也别设太大,很多人直接拉到32k,KV cache占用是线性涨的,按业务实际长度砍到8k能省不少。
3楼
12小时前
两张A100 80G跑7B确实不该OOM,你大概率是KV cache吃满了,vLLM默认gpu_memory_utilization是0.9,留给cache的空间其实不多,并发一上来就炸。可以试试把max_model_len调小点,比如从32k降到8k,cache占用直接少一大截,对内部问答场景基本够用。另外量化也是个路子,AWQ或者GPTQ的4bit版本显存能砍一半多,精度损失在问答任务上几乎感觉不出来。实在不行就换SGLang,调度策略比vLLM省显存一些,我这边实测同样硬件能多扛不少并发。
4楼
10小时前
两张A100 80G跑7B还OOM确实有点离谱,不过vLLM那套默认参数确实挺激进的,gpu_memory_utilization给到0.9再加上大batch,KV cache直接吃满。你可以试试换SGLang或者TensorRT-LLM,同样的卡吞吐能好不少,也不用把max_num_seqs压那么低。另外量化其实也值得考虑,AWQ或者GPTQ跑7B在A100上基本看不出质量损失,显存能省快一半,响应速度反而上来了。