最近在折腾本地部署,照着教程用vLLM跑Qwen2.5-7B-Instruct,开的是默认配置(gpu-memory-utilization=0.9,max-model-len=8192)。结果nvidia-smi一看,显存直接干到39.8G,我4090都差点爆了。但看别人博客说同样配置也就20G出头,差距有点大啊。我怀疑是不是我的transformers版本和vLLM不兼容,或者启动参数漏了什么?另外,用OpenAI接口调用时,首token延迟要2秒多,感觉比fastchat慢不少。有没有大佬指点下,哪些参数会影响显存占用和推理速度?还是说我这个数据其实算正常,只是被网上那些“优化后”的截图误导了?真诚求教。