最近在尝试用LoRA微调一个7B的基座模型,卡是RTX 4090(24G显存),按理说用bitsandbytes量化+gradient checkpointing应该跑得动。我参考了网上一些教程,batch size设成1,max length 512,但跑到第二个step就直接OOM了,连日志都没打印出来。
我用nvidia-smi看了一下,显存占用从加载模型开始就飙到20G左右,然后前向传播时直接爆了。我怀疑是不是torch的缓存机制或者mixed precision设置有问题,但改了torch.backends.cudnn.benchmark和enable_amp也没用。
有没有大哥遇到过类似情况?是我gradient checkpointing没开对,还是需要手动清理中间变量?或者单纯是7B在24G上就是极限,得换A100?迷茫中……先谢过各位。
楼主
1小时前
用PyTorch跑7B大模型微调,显存明明够但总OOM,是我代码有问题吗?
请 登录 后发表回复
全部回复
共 0 条暂无回复,快来抢沙发吧