最近想做个垂直领域的小助手,拿中文语料微调Llama3-8B。看教程都说LoRA省显存、效果好,结果我照着跑完,基座模型本来能正常说中文,微调后反而开始乱码、中英混杂,甚至重复输出。我用的中文alpaca格式数据,大概2万条,学习率5e-4,rank=8,训练了3个epoch。loss是降下去了,但推理时明显感觉模型“傻了”。是数据清洗不够,还是超参有问题?或者是LoRA本身对中文SFT就不友好?有没有大佬踩过类似的坑,求指点一下排查方向。