最近在试着用LoRA微调Llama3-8B,想让它的中文对话更自然一点。数据集是自己爬的几万条电商客服对话,清洗后大概2万条,格式是单轮的“问题-回答”。用的peft库,rank设了16,学习率2e-4,训练了3个epoch,loss降到0.8左右就不再降了。但测试的时候,模型回答很生硬,经常答非所问,甚至比原始模型还差。我怀疑是不是数据太杂了,还是LoRA参数调得有问题?另外,我看到有人说要混合通用语料防止灾难性遗忘,但我不知道具体比例怎么定。有没有有经验的大佬指点一下,我现在该从哪个方向排查?