最近在尝试用LoRA微调一个7B的基座模型,任务是用我们公司的内部文档格式做指令跟随。数据清洗过,大概2万条,训练时loss从1.8降到0.9,看着挺正常。但推理的时候发现模型经常答非所问,甚至把上下文里的内容原封不动地复述出来,指令完全没起作用。我试过调学习率(从2e-4到1e-5)、换rank(8/16/32),也试过增加数据集里的负样本,效果都不明显。看了一些教程说可能是灾难性遗忘,但我的基座是Chat版,按理说指令能力应该保留得住……有没有大佬遇到过类似情况?是我微调层选择的问题,还是数据格式哪里不对?真心求指点。