最近在折腾一个给内部用的文档问答Agent,用的LangChain + GPT-4o,流程大概是:意图识别→检索→多步推理→生成答案。单步检索效果还行,但一旦涉及到需要多轮工具调用(比如先查库存再算价格折扣),中间就经常出现幻觉或者干脆调用错参数。我试过加few-shot示例,也调低了temperature,还是不稳定。想问问大家,是LangChain本身的编排太重了,还是我应该在prompt工程上再下点功夫?有没有靠谱的实践路线图?谢谢各位大佬。