最近在把一个7B的对话模型接到公司内部工具上,用的vLLM,单张A10(24G)。量化用的AWQ 4bit,显存占用大概13G左右,按理说挺宽裕的。但实际跑起来,首token延迟要1.8秒左右,后续每个token也得120ms上下,感觉比之前用llama.cpp在本地跑还慢。