最近在折腾把公司内部的RAG服务封装成MCP工具给Claude用,遇到了一个很头疼的问题。文档库比较大,检索出来的chunk经常超过模型上下文限制,导致回答到一半就断掉。我试过在MCP server端做截断,但感觉这样丢失信息太严重了,而且每次都要手动调那个max_tokens参数,很麻烦。也想过用MapReduce的思路,把检索结果分块多次调用工具再汇总,但MCP这边好像没有现成的批量调用机制。想问问各位老哥,你们在生产环境里是怎么处理RAG和MCP之间的上下文衔接的?有没有什么优雅的窗口滑动或者压缩策略?还是说我应该换个思路,把检索粒度调细一点?