最近在做一个法律文书分类的项目,用开源的BERT-base-chinese做底座,自己攒了大概2万条标注数据。第一次微调时learning rate设的2e-5,batch size 16,跑了3个epoch,结果验证集F1比原模型直接掉了4个点。后来试着把学习率降到1e-5,又加了warmup,稍微好一点但训练集loss和验证集loss差距越来越大,明显过拟合了。我怀疑是不是数据里类别分布太不均匀(最少的类别只有200多条),但试过class weight和focal loss也没改善多少。有没有大佬遇到过类似情况?是应该先做数据增强还是干脆换更大的模型?或者我这种任务量根本不适合微调,直接用什么更轻量的方案?求指点,卡在这好几天了。