最近在微调Llama3-8B,用自己爬的Python/Java代码片段(大概10万条,清洗过),LoRA rank=16,lr=2e-4,训练了2个epoch。训练时loss从1.8降到0.9,eval loss也正常下降。但实际生成测试时,代码逻辑经常出现重复变量、缩进混乱,甚至比基座模型直接生成还差。我怀疑是不是数据格式问题——我是按“###输入代码###输出注释”这种模板做的,但模型似乎学到了注释风格,没学到代码结构。另外,是不是LoRA rank太小了?或者需要冻结embedding层?有没有人遇到过类似情况?求指点一下排查方向。