刚入门模型微调,在阿里云上租了A100跑Qwen2-7B,用LoRA做代码补全任务。数据集是自己爬的Python小脚本,大概5000条,每条都做了标准格式化。训练完loss从2.1降到0.3,看起来还行,但实际推理时,比如输入“def calculate_sum(a, b):”,它给我输出“return a + b”之后就开始重复无意义的标点符号……
我怀疑是不是学习率设太大(5e-4),或者LoRA的rank设低了(设的8)。另外,tokenizer的pad_token我用的eos_token,不知道有没有影响。有没有大佬遇到过类似情况?求指点!