最近在尝试用LoRA微调Llama3-8B做一个简单的电商客服问答模型,数据集是自己爬的约5000条历史对话,清洗后大概3万轮。训练完在验证集上BLEU和ROUGE都还行,但实际测试时发现两个问题:一是对常见退换货问题回答很稳,遇到稍微复杂点的多轮询问就开始胡言乱语,甚至冒英文;二是同一个问题换个问法,答案质量波动很大,有时像模像样,有时直接复读用户消息。我已经试过调学习率(1e-4到5e-5)、增加epoch到3、调整LoRA的rank(8/16/32),也试过加系统提示词,但都没明显改善。想问问大家,这种情况大概率是数据本身覆盖不够,还是我微调方式有问题?或者Llama3的中文能力本来就这个上限?有没有类似踩坑经验的朋友指点一下,感谢!