最近在尝试用中文业务数据微调Llama3-8B,用的LoRA,rank=16,alpha=32,学习率设的2e-4,训练了3个epoch。loss降得挺正常,从1.8降到0.7左右。但推理的时候发现,模型在通用问答上明显变笨了,很多常识性回答开始胡编,甚至中英文混杂。我的数据集大概2万条,都是客服对话,清洗过,格式是“问题+回答”对。想请教下大家,这种“学新忘旧”的现象,一般是数据分布太偏导致的灾难性遗忘,还是说学习率/epoch对LoRA来说太大了?有没有什么经验做法,比如混合通用数据、调整rank或者用早停?另外,评测的时候大家一般看哪些指标来判断微调效果是不是跑偏了?先谢过各位。