最近在试着用LoRA微调Llama3-8B做客服工单的意图分类(20个类别,大概1万条标注数据)。训练的时候loss从1.8降到了0.6,看着挺正常,但验证集F1只有0.72,比直接跑原始模型的0.75还低。我用的base版不是chat版,学习率2e-4,rank=8,训练了3个epoch。
有点懵,是数据量不够还是LoRA参数没调对?或者Llama3本来就不适合这种短文本多分类任务?有没有大佬遇到过类似情况,求指点一下排查思路。