最近在微调一个7B的模型做领域问答,用的LoRA,数据是清洗过的几千条指令数据。训练时loss一开始降得还行,但到0.8左右就卡死了,再往下训就开始震荡。试过调学习率、换batch size、加warmup,也试过改LoRA的rank,效果都不明显。看别人说loss能到0.5以下,怀疑是不是数据本身有问题?比如指令格式不统一,或者答案太长导致padding太多?另外也担心是不是基座模型选得不对,还是说训练轮数不够?有经验的大佬能指点一下排查思路吗?或者有其他坑需要注意的,先谢过了。