最近在做一个简单的AI Agent项目,用LangChain+GPT-4o跑一个多步工具调用的流程:先查数据库拿用户订单,再调外部API算运费,最后生成报价单。单步调用没问题,但一连起来就经常出错——要么模型在第二步忘了传第一步的参数,要么工具返回结果格式稍复杂就直接“幻觉”出假数据。我试过调低temperature、加few-shot示例、用ReAct模板强制思考,效果都不稳定。想问问大家,这种多步Tool Calling断链是普遍现象吗?换Claude或更强的模型会好一点,还是说我应该自己写状态机来管理上下文?求真实经验,谢谢。