最近在折腾用Llama3-8B做企业内部代码补全,因为显存有限就选了LoRA(r=8, alpha=16),只冻住了所有底层,微调了attention和mlp的投影层。训练集是自己爬的GitHub上Python和Java的高星项目,清洗后大概50万条指令对,每条都是“前缀+补全后缀”的格式。训了3个epoch,loss降到0.8左右,但实际推理时生成的代码逻辑完全不对,甚至经常输出重复的注释或者直接不闭合括号。我自己怀疑是数据构造方式有问题,比如补全长度不均、没有做去重,但也有人说是LoRA秩太低,模型学不到语法结构。有没有大佬踩过类似的坑?或者有没有相对靠谱的代码补全微调数据开源集可以推荐?先谢过各位了。