最近在做领域内对话模型的微调,用的LLaMA-7B,LoRA rank=8,学习率2e-4,训练集大概5000条人工清洗过的指令数据。跑完3个epoch,loss从1.8降到0.9,但用验证集里没见过的几个场景去测试,回答开始变得机械,甚至把训练集里的专有名词硬套到新问题上。我试过降低学习率和增加dropout,效果不明显。想请教下大家,这种情况一般是过拟合还是数据分布问题?另外,如果只想要指令跟随能力但不想改变基座模型的通用知识,微调时是不是应该冻结更多层或者用更小的rank?有没有什么经验性的设置参考?