最近在试着用LoRA微调llama3-8b做中文法律问答,数据集大概2w条,清洗过,长度都在1k tokens以内。训练时用的lr=2e-4,batch size=8,跑了3个epoch,但loss一直在1.8左右震荡,几乎不动。我试过把lr降到1e-5,结果loss更不降了,直接卡在2.1。我看别人分享的loss曲线都能稳定下降,我这个是不是数据格式有问题?还是说base model本身就不适合中文任务,应该用中文版的模型?求各位大佬指点一下排查方向,现在完全没头绪。