最近在做一个内部知识库的Agent,用Llama-3-8B做了LoRA微调,训练集是大概5000条指令数据,都是“根据文档X回答Y”这种格式。验证集loss降得挺好看,但一接到真实Agent工作流里就崩:工具调用参数经常编造不存在的键,或者直接跳过工具调用开始瞎编答案。我怀疑是不是微调时把工具调用的system prompt格式给稀释了?还是说需要把工具返回结果也拼进训练样本里?求有经验的大佬指点下,这种场景下微调数据该怎么构造才不破坏Agent原有的能力?