最近在试着用LoRA微调一个7B的基座模型(Qwen2.5),做垂直领域的指令跟随。训练数据大概500条,每条300-500字,格式是instruction+output。跑了两三个epoch,loss一开始降了一些,后面就一直在2.3左右振荡,怎么调学习率(从1e-4换到5e-5)都没用。验证集回答明显还是“背诵”现象,甚至重复我的问题。