最近在跑一个法律问答的LoRA微调,基座是Qwen2.5-7B,训练集大概5000条问答对,格式就是标准的“user/assistant”。loss降到0.8左右,但推理时发现一个诡异现象:只要用户问得稍微长一点(比如超过3句话),模型就会把用户的提问当成背景知识复述一遍,然后才开始回答,甚至有时直接“总结”用户的问题,而不是给出答案。