最近在拿一个7B模型做领域微调,用了几千条清洗过的问答数据,LoRA rank设的16,学习率5e-5,跑了3个epoch。结果推理时发现,模型回答里经常出现整句重复,比如“根据您的问题,根据您的问题”这种。训练集里没有这类噪音,所以不是数据源头的问题。我也试过降低温度到0.6,重复还是存在,但没那么夸张了。想知道这种情况一般优先调什么?是学习率太高导致灾难性遗忘,还是epoch过拟合了?或者LoRA的alpha/rank配比不太合适?有经验的朋友能不能给个排查思路,感激不尽。