最近在折腾本地部署,手头有4张A100 40G,想跑Qwen2.5-72B做长文本摘要。试了AWQ 4bit量化,单卡能塞下但推理速度慢得离谱,生成2000字要等三四分钟。后来试了TP=4的张量并行,显存倒是够了,但总吞吐还不如单卡量化,还时不时报OOM(可能是KV cache配置问题?)。看社区说可以量化+TP混用,但不知道AWQ还是GPTQ更适合多卡场景,以及并行度设多少能平衡速度和显存。有没有大佬分享下实际生产环境的配置方案?顺便问下,FP8是不是更优解,还是说只能靠增加显存硬刚?