最近想本地跑Qwen2.5-72B做长文本总结,查了一圈资料有点懵。有的说4张A100够,有的说8张才稳,还有人说用GGUF量化能压到单卡。我试了AWQ 4bit量化,加载时显存直接飙到60G+,用的vLLM,batch_size已经调到1了,上下文长度设8k,还是OOM。看日志好像KV cache占了大头。有没有实际部署过的老哥,说下你们的生产配置?另外,如果换成70B的Llama3,显存压力会小一点吗?或者有没有什么技巧,比如offload到CPU,但推理速度慢到什么程度?求真实数据,别让我瞎试了,实验室经费有限。