最近在尝试用LoRA微调Qwen2.5-7B做垂直客服场景,数据集是自己整理的问答对,大概5000条。训练时发现loss一开始下降很快,到第2个epoch就开始震荡,后面基本不降了,甚至偶尔还回升。我试过调低学习率(从2e-4降到1e-4)、增大batch size(32->64),效果都不明显。用的是peft库,rank设的16,alpha32,只改attention层。是数据量太小了,还是我超参设置有问题?或者其实模型已经学得差不多了,但生成效果还是不太稳定,有道友能指个路吗?