最近在尝试微调一个7B的LLaMA做中文法律问答,用的LoRA。训练集是自己爬的判决书和法条问答对,大概2万条。现在遇到个问题:训练两三个epoch后,loss就卡在1.8左右死活不降了,验证集上的答案也开始重复,比如一直生成“根据相关法律规定……”这种套话。我试过把学习率从2e-4降到1e-5,也加了warmup,但效果不明显。想问问有经验的朋友:这种情况一般是数据清洗不够(比如很多长文本没截断),还是说我应该换更大的模型或者调整LoRA的rank值?有没有什么排查顺序的建议?先谢谢了。