最近在做一个文档问答的Agent,用LangGraph搭了个多步RAG流程。一开始是简单的检索-生成,效果还行。但后面加了几个工具,比如查数据库、调用外部API,问题就来了——Agent在每一步都要把之前的工具返回结果、推理过程、用户原始问题全部塞进上下文,几轮下来token直接爆掉,而且模型会“忘记”最开始的目标,开始瞎编。