最近在跑一个法律文书摘要的微调实验,基座是LLaMA-2-7B,用的peft库里的LoRA。训练loss能降到0.8左右,但推理时生成的内容完全不是正常中文,夹杂着大量重复的“^”和“?”符号,偶尔蹦出几个英文单词。我检查过数据预处理,分词器用的是llama官方tokenizer,padding和truncation都设了128。调过学习率(从2e-4降到1e-5)和LoRA的rank(8到64),情况稍微好转但依然乱码。看网上说可能是tokenizer的special token没加,但我用base模型直接生成是正常的,只有微调后才崩。有没有大佬遇到过类似情况?是应该检查attention mask还是需要重新对齐label?求指点一下排查方向,谢谢!