最近在做一个法律问答的垂直领域微调,基座是Qwen2-7B,用LoRA(r=16, alpha=32)跑了几轮。训练loss降得挺漂亮,从1.8降到0.9,但实际测试时发现,模型对通用常识问题的回答明显变差,甚至有些原本会的基础数学题都开始胡说了。我用的数据集是自己爬的裁判文书+法条问答,大概2万条,清洗过但没做很严格去重。想问下各位大佬:这种情况是灾难性遗忘,还是数据分布太偏导致模型“过拟合”到法律语境了?如果我想保留通用能力,是不是应该混合一些通用指令数据,或者把LoRA的r调小一点?另外,eval的时候只看loss够吗,还是要看具体生成效果?有点迷茫,求指点。