最近在把Qwen2.5-7B-Instruct部署到内网服务器上给业务用,机器是A10 24G,用vLLM启动,max-model-len设了4096,gpu-memory-utilization也调到0.9,按理说7B模型+4096上下文应该绰绰有余。但实际一压测,并发一上来就报CUDA OOM,有时候甚至单条长请求也会崩。查了日志发现vLLM的KV cache好像没按预期的比例分配,而且显存碎片化严重。