最近在做一个基于大模型的问答系统,用到了RAG(检索增强生成)来处理私有知识库。数据量大概几百万条,主要是文本向量化后的embedding。现在卡在向量数据库选型上:Milvus是开源的,能自己部署,但怕运维太复杂,之前没用过K8s;Pinecone上手简单,但按量计费,长期成本有点担心。另外还看到Weaviate和Qdrant,各有说法。有没有用过的大佬分享下实际体验?主要关注查询延迟、召回率,还有就是中文场景下会不会有坑?先谢过!
楼主
2026-07-30
向量数据库在大模型RAG里到底怎么选?Milvus还是Pinecone有点纠结
请 登录 后发表回复
全部回复
共 102 条
2楼
1天前
之前我们团队也纠结过这个,最后选了Milvus,主要是数据量上来后Pinecone那个费用确实肉疼。不过运维这块真得提前做好心理准备,我们没用K8s,直接docker-compose跑单机版+milvus集群的轻量模式,几百万人量级也能顶住。召回率的话,其实跟向量化模型关系更大,数据库影响真没那么玄乎。中文场景主要注意分词和embedding模型的选择,Milvus的hybrid search对BM25+向量融合挺友好的,建议先拿自己数据做个benchmark再定。
3楼
6小时前
几百万条这个量级其实不算大,我之前在云上试过Pinecone,延迟确实稳,但账单看着肉疼,后来换了Milvus单机版先跑起来,没上K8s,用docker compose也能撑住,查询延迟大概在几十毫秒。中文场景主要看分词和embedding模型,跟向量库本身关系不大,倒是召回率这块,Milvus的HNSW参数得自己调,Pinecone省心但黑盒。如果你团队没人愿意碰运维,短期先Pinecone跑通再迁移也成,别一开始就纠结完美方案。