最近在尝试用DeepSpeed的ZeRO-3微调一个7B的LLaMA模型,单卡A100 80G,batch size已经降到1了,结果训练到一半还是OOM。我用了deepspeed的auto offload,也试过把cpu_offload和pin_memory打开,但感觉没太大改善。是不是我理解错了ZeRO-3的原理?还是说7B模型本来就不太可能在单卡上微调?另外,我看到的显存占用大部分是optimizer states和activation,有没有什么trick能省一省?比如用gradient checkpointing或者混合精度?但我试了bf16好像效果不稳定。求大佬指点,先谢过了。