最近在做一个内部知识库问答的小项目,选型的时候觉得Qwen2.5-7B-Instruct效果不错,就打算直接部署。结果发现单卡A10(24G显存)跑起来倒是没问题,但并发一上来(比如5、6个请求同时打),显存直接爆掉,推理延迟也飙到十几秒。试了vLLM,但量化到INT4又怕效果掉太多,毕竟知识库回答要准。查了一圈,看到有说用KV Cache量化、或者把模型切到多卡,还有说用AWQ的,有点晕。想问下各位实际在搞部署的大佬,这种小规模生产场景(用户量不大但要求响应快),一般是用量化还是上多卡?或者有没有什么更轻量的方案(比如蒸馏成小模型)?顺便求个靠谱的量化教程链接,感激不尽。