最近在拿LLaMA-7B做领域微调,用的LoRA,学习率试了1e-4到3e-5,batch size调到4,梯度累积16。训练到第3个epoch时loss基本卡在1.8左右震荡,验证集上生成的回答开始出现重复片段,甚至把指令里的标点符号原样复读出来。数据是爬的行业论坛帖子,清洗时只去重和粗略切分,没做严格的指令格式化。想问一下这种情况是学习率衰减策略没设对,还是数据里噪声太多?有人遇到过loss平台期然后靠加大数据量突破的吗?另外,用ChatGPT重新生成一遍训练数据会不会有帮助?