最近想把Llama3-8B微调成能写周报的风格模型,用的中文数据集大概5000条,都是自己整理的对话。训练时loss降到1.2左右就下不去了,生成结果经常出现重复词和乱码,甚至中英文混杂。我看教程里都说LoRA很稳,但我的rank设了16,alpha=32,学习率5e-4,跑完感觉跟base模型没什么区别。想问下大佬们,这种情况一般是数据清洗的问题,还是说我超参设置有问题?另外有没有必要先用中文继续预训练一下?求指点,感激不尽。