最近在拿Llama3-8B做中文情感分析微调,用的QLoRA,数据集大概1万条电商评论,二分类(正向/负向)。训练时loss从2.1降到0.8,看着挺正常,但验证的时候发现模型几乎把所有句子都预测成“正向”。我检查了数据,正负样本大概是平衡的(5.5:4.5),也试过调学习率(从2e-4降到1e-5)和增加epoch,结果差不多。我怀疑是不是prompt格式的问题?我用的模板是“评论:xxx 情感:”,但模型好像没理解任务。另外,我用的LoRA rank=8,alpha=16,target_modules只改了q_proj和v_proj,是不是需要改全连接层?有没有大佬遇到过类似情况?想知道是数据的问题还是我哪里设置得不对,求指点,谢谢。