最近在跟一个教程用LoRA微调Llama-3-8B,做中文法律问答。数据集是网上爬的几千条问答对,清洗过,长度都在512以内。用的transformers+peft,LoRA rank=8,alpha=16,学习率设了2e-4,跑了3个epoch。结果训练loss降到1.2左右,但推理时模型输出全是重复的“嗯嗯嗯”或者乱码,偶尔蹦出几个英文单词。我把学习率降到5e-5重新跑,loss降到0.9,可输出还是不对劲,像在背训练集里的片段拼凑。我怀疑是不是中文分词没处理好,或者是base model本身英文占比太高?有没有大佬遇到过类似情况,一般先排查数据还是调参?