最近在做一个小项目,想用R1的蒸馏版替代之前的GPT-4调用,主要跑客服意图识别。但部署时发现显存占用比想象中高,单卡A100跑7B的量化版,并发一上来延迟就飙到3秒多。试过vLLM和TensorRT-LLM,吞吐还是上不去,不知道是不是我配置有问题?另外看官方推荐用fp8,但手头只有A100,转fp8后效果有点掉,有点纠结该不该为了速度牺牲精度。有没有大佬分享下实际生产环境的部署经验?比如用几卡、怎么切分、量化方案怎么选?顺便问下,R1的蒸馏版和原版差距到底有多大,值得为显存妥协吗?