最近在折腾开源模型微调,之前一直用PyTorch写LoRA脚本,跑起来挺顺的。这两天想试试国产的MindSpore和PaddlePaddle,就把一个简单的BERT分类任务迁移过去。结果发现同样的数据集、同样的batch size和lr,在PyTorch里loss稳稳下降,换到MindSpore上loss曲线直接上下乱跳,偶尔还冒出NaN。我查了梯度裁剪和混合精度设置,看着都跟PyTorch那边差不多,但就是不稳定。想问下各位大佬,是框架默认的随机种子处理不一样,还是数据加载顺序有差异?或者是我哪里配置没对齐?真心求教,这玩意儿调试起来比写模型还费劲。