最近在做一个内部用的Agent,想让模型学会调用我们自己的几个API(查库存、下单这种)。数据集是手工整理的300多条对话,格式参考了Qwen官方工具调用模板。用的LLaMA-Factory,LoRA秩设的16,学习率2e-4,训练了3轮。结果发现一个奇怪的现象:验证集上准确率有88%,但实际跑起来,模型经常在简单场景下突然不输出工具调用,或者把参数名改掉(比如把“order_id”写成“orderId”)。我试过加大数据量到600条,也调过秩和轮数,提升不明显。想问问大家,这类问题一般是数据多样性不够,还是模板/解析逻辑有坑?或者LoRA本身就容易在这种结构化输出上翻车?有没有什么经验能分享一下。