最近在试着用LoRA微调Llama3-8B,想让模型学会我们公司的客服话术风格。我按网上教程准备了大概2000条JSON数据,格式是{"instruction": "...", "input": "...", "output": "..."},用的transformers+peft,训练loss降到0.8左右,看起来挺正常。但一推理,模型输出的全是重复的乱码或者无意义的符号,偶尔蹦出几个英文单词。我检查过tokenizer和模型加载,都没报错。
想问问各位老哥,这种情况一般是什么原因?是数据格式跟模型模板不匹配,还是学习率设置太激进?或者是我prompt构造时少了<|begin_of_text|>这类特殊标记?有没有类似踩坑经验的大佬指点一下,感激不尽。