最近在尝试用LoRA微调一个7B模型做领域问答,数据集是自己爬的几万条行业文档清洗出来的,格式是“指令-回答”对。训练时发现loss在2.5左右就卡住了,大概20轮都不动,验证集上的bleu也很低。试过把学习率从2e-4调到1e-5,batch size也调过,但效果不明显。想问问有经验的朋友,这种loss迟迟不降的情况,一般先排查数据质量(比如重复、噪声、指令太泛)还是模型结构参数(比如rank、alpha设置)?另外如果数据量不够,是不是硬凑更多低质量数据反而有害?有点迷茫,希望能给点排查思路。