最近在做一个内部知识库的Agent,用Llama-3-8B做底座,拿几千条工具调用的对话数据做了LoRA微调。单轮工具选择准确率还行,但一旦涉及多轮对话,模型经常把上一个tool的结果当参数传给下一个tool,或者干脆自己编一个不存在的工具名。我确认过数据格式和system prompt都没问题,推理时temperature也降到0.1了。想问下各位大佬,这种多轮工具调用的“记忆混乱”一般是微调数据里缺少了某些负样本,还是说LoRA的rank和alpha设置得不合适?或者跟基座模型本身的多轮能力关系更大?求指点,孩子已经被这个搞了快两周了。