最近在尝试微调一个7B的LLaMA模型做代码补全,用的LoRA,rank设的16,alpha=32。数据集是自己爬的GitHub上的Python项目,大概5万条样本,清洗后按8:1:1切分。训练时batch size=4,梯度累积8步,学习率试过1e-4和3e-4,用的是AdamW。但跑了十几个epoch,loss一直卡在1.8左右下不去,验证集上生成的效果也很差,经常出现语法错误。我看别人的经验贴说微调loss一般能降到1以下,不知道是哪里出了问题。是学习率太高导致震荡,还是数据集本身质量不够(比如重复代码太多)?另外需不需要调整LoRA的rank值?希望有经验的朋友指点一下。