最近在试着用Llama3.1 8B微调一个中文电商客服模型,数据集大概2万条多轮对话,用的Lora(r=16, alpha=32),跑了3个epoch。训练时loss从1.8降到0.9,但实际测试时发现模型经常把“退货政策”答成“发货时间”,甚至有时直接复读用户问题。我检查过模板,加了system prompt,也试过降低学习率到2e-4,还是不行。想问下各位大佬,这种情况是数据质量的问题,还是8B太小扛不住中文多轮任务?或者我该换用Qwen2.5-7B这类中文基座模型重新试?另外,评估时除了BLEU和ROUGE,有没有更靠谱的指标判断对话连贯性?先谢过各位了。