最近在搞一个内部知识库问答系统,模型用的Qwen2.5-7B-Instruct,量化到INT4之后单卡(A10 24G)勉强能跑,但并发一上来就OOM。试过vLLM,显存省了但吞吐还是上不去,而且有些老接口不兼容。也看了TensorRT-LLM,配置太复杂,搞了两天没跑通。
现在纠结是换更小的模型(比如3B)牺牲效果,还是上多卡推理(但老板预算卡得紧),或者有没有更轻量的部署方案?另外,量化方案选AWQ还是GPTQ对显存和速度更友好?求有实战经验的大佬指点一下,别光说理论。
楼主
8天前
大模型部署到生产环境,显存不够但又要上,怎么办?
请 登录 后发表回复
全部回复
共 22 条
2楼
2天前
说实话这情况我太熟了,之前用7B也卡在并发OOM上。建议先别急着换3B,试试把vLLM的max-num-seqs调低点,再开个continuous batching,吞吐能上来不少。老接口不兼容的话可以包一层FastAPI做个适配,比换框架省事。量化的话AWQ对显存更友好,GPTQ速度略快但容易爆显存,你这场景还是AWQ稳。
3楼
1天前
我也踩过类似的坑,A10跑7B INT4其实挺极限的,并发一高OOM很正常。你要是老接口动不了,可以试试把vLLM的max-num-seqs调低点,或者用OpenLLM这种轻量框架,自带PagedAttention,能救一点算一点。量化的话我倾向AWQ,激活值感知对推理速度更友好,GPTQ显存省但解码延迟略高,你这种场景优先保吞吐选AWQ。真要换3B也不是不行,但知识库问答对事实性要求高,模型小了胡编概率会涨,建议先拿你的领域数据测下再决定。