最近在试着用LoRA微调Qwen2.5-7B,想让它学会我们公司的内部术语和问答风格。数据集大概500条,都是人工整理的高质量对话,跑了3个epoch,学习率用的3e-4。结果微调完一测试,发现模型在通用知识上明显退化,比如问它“1+1等于几”都开始犹豫,但公司相关的问题答得还行。我试过降低学习率到1e-4,效果稍微好点,但还是有“灾难性遗忘”的感觉。想问问大家,这种情况是不是应该加一些通用数据混合训练?还是说LoRA的rank值设得不够合理(我用的r=8)?或者干脆就是数据量太少,应该先凑到2000条再说?有点迷茫,求指点。