最近用Llama3-8B微调一个垂直领域问答模型,训练集大概5000条手工清洗的QA对,用的LoRA(r=16, alpha=32),学习率2e-4,跑了3个epoch。训练loss降得挺正常,但推理时输出全是“好的好的好的”或者重复某个短语,偶尔带一两个训练集里的词。试过降低temperature到0.1,也调过top_p,效果没用。看别人说可能是数据里target部分有噪声,但我检查过格式,都是标准instruction/response结构。现在不确定是该加大数据量、调LoRA秩,还是改成全参数微调试试?有没有遇到过类似情况的朋友,求指点一下排查方向。