最近在折腾一个给内部用的文档问答Agent,用的是LangChain+GPT-4o-mini。流程很简单:Retriever查库 → 拼Prompt → LLM回答。但发现只要对话超过5轮,回答就开始乱套,经常答非所问,甚至把之前聊过的内容重复输出。我怀疑是ConversationBufferWindowMemory没设好,或者直接把history一股脑塞进system prompt导致的。有没有老哥遇到类似情况的?你们一般是怎么控制Agent的短期记忆和长期记忆的?是手写一个记忆裁剪逻辑,还是直接上LangGraph里的checkpoint机制?求一个能稳定跑完20轮不崩的实战方案,先谢过了。