最近在折腾本地知识库,用vLLM部署Qwen2.5-7B-Instruct,开--max-model-len 8192,单卡A10(24G)。单线程测速还行,大概40 tokens/s,但一旦用gradio开个web demo,3-4个人同时问问题,显存直接爆掉,报CUDA out of memory