最近在尝试把Qwen2.5-7B部署到一张RTX 4060 Ti 16G上做API服务。我看网上很多人说7B模型用vLLM跑推理,16G显存勉强够用。但我按照官方文档设了max-model-len=2048,gpu-memory-utilization=0.9,启动之后随便发几个请求就OOM了,有时候连第一次推理都跑不完。