最近在单卡A100上微调一个7B的模型,用的是HuggingFace的Trainer,听说PyTorch 2.0的torch.compile能自动加速,就试着加上了。结果发现训练速度不但没提升,显存还多占了快10个G,而且第一次编译特别慢,等了快十分钟才跑起来。试了mode="reduce-overhead"和"max-autotune"都差不多,有时候还会报一些奇怪的graph break警告。是我用的方式有问题,还是说在大模型场景下torch.compile其实不太适合?有没有实际用过的老哥分享下经验,到底该怎么配置才能吃到这个加速红利?