最近在搞一个内部知识库问答系统,模型用的Qwen2.5-7B-Instruct,量化到INT4之后单卡(A10 24G)勉强能跑,但并发一上来就OOM。试过vLLM,显存省了但吞吐还是上不去,而且有些老接口不兼容。也看了TensorRT-LLM,配置太复杂,搞了两天没跑通。
现在纠结是换更小的模型(比如3B)牺牲效果,还是上多卡推理(但老板预算卡得紧),或者有没有更轻量的部署方案?另外,量化方案选AWQ还是GPTQ对显存和速度更友好?求有实战经验的大佬指点一下,别光说理论。