最近在试着用LoRA微调Llama3-8B做中文法律问答,数据是自己爬的判例+问答对,大概2万条。我参考了网上一些教程,按Alpaca的格式处理成了instruction/input/output,但input字段很多是空的。跑了一轮(1个epoch,batch_size=4,lr=2e-4),发现loss从1.2升到1.8,完全没下降趋势。我怀疑是不是system prompt和特殊token没处理好,或者空input导致模型学乱了?另外我用了4bit量化+peft,会不会是量化精度影响?求有经验的大佬指点一下,是不是数据格式里少了eos_token的原因?