最近在折腾 MCP(Model Context Protocol)的时候遇到一个困惑。我打算给自己的知识库接一个向量检索功能,目前有两种方案:一种是直接把向量数据库的查询封装成一个 MCP tool,让模型需要时自己调用;另一种是提前在 MCP server 里把 query 向量算好,再把 top-k 结果作为 context 塞给模型。第一种感觉更灵活,但担心模型乱调用,或者返回格式太原始,反而干扰生成;第二种又觉得有点过度耦合,而且每次都要等向量查询完了才发请求,延迟高。有没有佬友实践过?在 MCP 场景下,向量检索结果一般怎么给模型最合适?我看官方文档也没讲太细,求指点。