最近在微调Llama-3-8B做客服问答,训练时用的prompt模板是“你是客服,请回答:{问题}”,但上线推理时发现用户输入五花八门,比如直接问“退货怎么办”,或者带一堆语气词。如果推理时不用训练模板,效果明显变差,但硬套模板又显得很机械。想问下大家,微调时是不是应该故意在prompt里加入噪声/变体(比如随机省略“请回答”或换措辞)来增强鲁棒性?还是说模板必须严格一致,靠系统提示词去兜底?另外,训练时要不要把历史对话也拼进去?现在只喂单轮问答,感觉多轮语境下模型有点“失忆”。求有实战经验的大佬指点一下,感激不尽!