最近想微调一个7B模型做Agent的工具调用,数据是自建的function calling格式,大概5k条,LoRA rank=16,训练loss从1.2降到0.3看着挺正常。但实际跑多轮任务的时候,模型经常该调用工具的时候不调用,或者参数格式对但选错工具。评估了一下单轮准确率有80%多,一到多轮就崩。想问下这种情况是数据分布问题还是训练方式不对?需不需要加一些负样本或者多轮轨迹数据?有没有踩过类似坑的老哥指点一下。