最近在试着用LoRA微调Llama3-8B做我们公司的客服问答,数据集大概5000条,都是真实对话整理出来的。训练时loss从2.1降到了0.8左右,看着挺正常,但推理时发现模型经常输出“好的,我理解您的问题,请问还有什么可以帮您?”这种套话,或者直接复读用户的问题,完全没有实际内容。我用的base model是meta-llama/Meta-Llama-3-8B-Instruct,学习率设的2e-4,跑了3个epoch。想问下是我数据格式的问题还是训练超参数不对?另外中文语料占比大概70%,会不会是中文知识不够导致生成质量差?有没有大佬遇到过类似情况,求指点方向。