最近在折腾把RAG流程封装成MCP工具,给内部知识库用。目前是让LLM先调用检索工具拿chunks,再生成回答。但遇到两个问题:一是检索结果一大,后续工具调用的上下文很容易被冲掉,尤其是我还挂了几个别的MCP服务;二是模型有时候会先调用其他工具,再回来检索,导致回答里混入过时信息。有没有人遇到过类似情况?是应该把RAG做成单一工具,把检索和生成逻辑全塞进去,还是继续拆开靠prompt约束?另外,MCP的上下文管理是不是本身就有局限?求指点。