最近在用LLaMA-Factory微调一个7B模型做客服问答,训练数据里每条都带了system prompt(比如“你是一个耐心专业的客服”)。结果跑完eval发现,没加system prompt的base模型回答反而更自然,微调后的模型总爱重复“请问有什么可以帮您”,遇到复杂问题就直接复读。我怀疑是不是system prompt在微调时被当成了硬编码,把模型的推理能力给“封印”了?或者是我数据构造的方式有问题?求各位佬指条明路,这种场景到底该不该把system prompt加入训练,还是说应该只在推理时加?