最近在用Llama3-8B做中文法律文书摘要的微调,训练集大概2万条,基于Qwen的template改的。跑完3个epoch后,发现模型在中文通用问答上明显变笨了,很多简单句子都开始蹦英文或者重复片段,但法律摘要任务本身效果还行。我用的学习率是2e-5,warmup 100步,batch size 4,梯度累积8。想问问有经验的前辈,这种“偏科”现象是不是因为增量预训练数据太少、导致原有多语言能力被覆盖了?还是说学习率对基座模型来说太高了?另外,有没有什么策略能在保持下游任务效果的同时,尽量少牺牲原有能力?比如用LoRA会不会好一点?有点迷茫,先谢过大家。