最近在试着微调一个7B的chat模型,用的LoRA,单卡A100 40G。训练的时候loss降得挺正常,但一跑推理就报CUDA OOM,而且加载模型的时候就要吃掉快25G显存。我试了FP16和int8量化,感觉也没好多少。看别人的部署教程好像很轻松,是不是我的batch size或者max length设置有问题?还是说7B模型本来就这德行,得用vLLM或者什么其他框架才行?求有经验的大佬指点一下,给个大致的方向就行,谢谢了!