最近在用LangChain搭一个简单的Agent项目,结合RAG做客服问答。但做到多轮对话时,发现每次用户问新问题,Agent都会把整段历史塞进prompt,结果token爆炸了,而且有时候用户问的和之前完全无关,检索出来的上下文还带着旧问题,回答就歪了。我试过只保留最近两轮对话,但用户突然问“刚才那个方案再解释一下”又找不到了。想问下大家,RAG+Agent的场景里,历史记录是应该全部丢给LLM自己过滤,还是单独切一个记忆模块?有没有比较轻量的管理策略?或者用向量数据库存历史消息做检索可行吗?求指点。