最近在折腾MCP,给本地知识库接了个向量数据库(用的Qdrant),配合embedding模型做RAG。单轮问答效果还行,但一旦对话轮次超过5-6轮,或者用户提问里包含前几轮提到的实体,检索出来的chunk就跑偏了。我目前是把历史对话拼接后一起embedding再查,不知道是不是这个策略有问题?感觉上下文一长,向量空间里语义就被稀释了。有没有大佬遇到过类似情况?是应该对历史对话做压缩/摘要,还是改用混合检索(比如BM25+向量)更稳?另外MCP server这边有没有什么推荐的中间层处理方案?刚入门,求指点,别喷。