最近在做一个带工具调用的Agent,用的GPT-4o。单轮任务还行,但一进入多轮工具调用就崩——比如用户连续让AI查天气、订餐厅、再改时间,后面AI就开始“失忆”,甚至把上一轮的工具参数串到下一轮。我自己试过把历史消息全塞进system prompt,结果token爆了不说,模型反而被无关信息干扰。也试过简单的摘要压缩,但摘要丢细节,比如用户中途改过的偏好就丢了。想请教下大家,生产级的Agent一般怎么做上下文管理?是分层记忆(短期+长期)?还是用RAG专门存关键状态?或者有什么工程上的trick(比如把工具调用记录单独结构化存储)?求个大致思路或开源项目参考,感谢!