最近在做一个知识库问答的小项目,数据量大概几十万条文本,一开始图省事直接用MySQL的like查询,后来发现太慢,就换成了es的match检索,效果还行。但看到很多大佬都在推向量数据库,像milvus、qdrant这些,我就有点懵了——我现在的场景用es的knn插件也能做向量检索,为什么还要单独引入一套向量数据库?是数据量到千万级才有明显区别,还是说在召回率、过滤条件(比如按用户ID过滤)上有本质差异?有没有实际踩过坑的朋友说说,如果数据量在百万级别,直接上向量数据库会不会反而增加运维复杂度?