最近在做一个垂直领域的中文问答小模型,基于Llama3-8B,用了LoRA微调。数据集是自己整理的约2万条领域QA对,清洗过,格式也按alpaca模板来了。训练时学习率2e-4,rank=8,alpha=16,跑了3个epoch,loss降到0.8左右。但推理时发现,模型在领域问题上回答得还行,可一旦问点常识或开放性问题,中文表达明显变差,甚至不如原版base模型流畅。我怀疑是不是数据里中英文混杂导致灾难性遗忘,或者LoRA参数设置有问题?有没有人遇到过类似情况?是应该加大rank,还是调整数据比例,或者干脆用QLoRA换个基座?求指点。