最近在跟一个项目,想用Llama3-8B微调一个中文客服机器人。数据是几千条真实的问答对,用的Lora,rank=16,学习率2e-4,跑了3个epoch。训练时loss从1.8降到0.9,看着挺正常。但一测试就崩了——模型回复像复读机,比如问“怎么退款”,它回“退款需要联系客服退款需要联系客服”,或者干脆答非所问。我怀疑是数据格式问题,但检查了好几遍,prompt和response分隔符也没错。是不是base模型本身中文能力太弱?还是Lora参数设置不对?或者数据量太少了?有没有人遇到类似情况,求指点一下排查方向。