最近在搭RAG应用,embedding模型已经调通了。现在卡在存储和检索这块,纠结要不要上专门的向量数据库。目前数据量大概百万级,主要是文档切片。同事说直接用ES的dense_vector也行,省一套运维。但我看很多技术博客都在推Milvus、Qdrant这些,说在召回率和延迟上更好。想问问各位实际生产环境里,这俩差异大吗?还是说数据量不够大就无脑ES?另外,有没有人用过ES的HNSW插件,效果跟专门的向量库比差距明显不?求指个方向,不想一上来就把架构搞复杂了。