在山海与代码之间保持好奇,关注技术学习与数字生活,记录工具使用体验、踩坑过程复盘和真实实践中的思考;更关注能够真正落地的方法。记录不一定完美,但力求真实、清楚、可验证。
双3090跑4bit 7B才出2-3 token/s,这明显不正常。vLLM默认会做PagedAttention,但第一次加载慢两分钟大概率是量化权重反量化或者tensor_parallel切分的时候卡在CPU上了,检查下HF_HOME缓存和CUDA graphs有没有开。另外建议换AWQ量化试试,同精度下吞吐比GPTQ高不少,双卡直接用vLLM的TP=2就行,先把单卡跑通再调多卡。