最近在用Llama3-8B微调做一个电商客服问答模型,数据集是自己整理的3000条真实对话(中文)。用的LoRA,rank=8,学习率试了2e-4和5e-5,跑了两轮loss就一直卡在1.2左右下不去了。感觉模型回答像复读机,经常把“你好”回成“你好,请问有什么可以帮助你”,但稍微复杂点的问题就乱编。想问下大家: 1. 是不是数据量太少?还是需要加一些负样本? 2. 学习率和LoRA rank怎么调比较靠谱? 3. 有没有必要先用Base模型做一下sft对齐?我现在直接拿Chat版本微调的。求指点,卡了好几天了😭