最近在调一个中文法律问答的LoRA,基座用的Qwen2.5-7B。训练集是自己爬的裁判文书+法条问答,大概2万条,清洗得还算干净。跑完3个epoch后,测试集上法律问题回答得挺像样,但一聊日常话题就崩,比如问“今天天气怎么样”它会一本正经引用法条。我试过把学习率从2e-4降到1e-4,情况好一点但依然存在,又不敢再降怕欠拟合。想问问有经验的朋友,这种局部能力增强但全局退化的情况,一般先调什么?是数据配比的问题,还是应该加一些通用语料混合训练?另外我看有人说用AdamW比Adam稳定,真的差很多吗?求指点。