最近在尝试用LoRA微调一个7B的基座模型做代码补全,参考了网上不少教程。我用的数据集大概5000条左右的Python函数级样本,训练了3个epoch,loss降得挺快,但实际推理时发现模型在简单任务上反而退化了,比如让它写个快速排序,会输出一堆冗余注释甚至语法错误。我试过把学习率从1e-4调到5e-5,秩从8调到16,效果还是不稳定。想请教下各位,这种情况一般优先怀疑数据质量还是超参设置?另外,微调后评测集上指标掉点,大家通常怎么定位是灾难性遗忘还是过拟合了?有点迷茫,求指点。