最近在做企业知识库的RAG项目,数据量大概200万条文档切块后的向量,用的Milvus集群(3节点)。测试环境一切正常,一上生产就频繁出现查询延迟抖动,从20ms飙到2s,而且召回率明显下降。看了监控发现是段合并和索引构建抢了CPU资源,但业务又要求近实时写入。现在纠结要不要换Qdrant或者Weaviate,还是说调整Milvus的段参数就行?另外,分片和副本数怎么配比较合理?有没有做过类似规模的大佬分享下实际运维经验,跪谢!
楼主
1天前
向量数据库选型翻车了,求大佬们指点下RAG生产环境避坑经验
请 登录 后发表回复
全部回复
共 1 条
2楼
13小时前
遇到过类似的坑,Milvus段合并和索引构建抢资源太真实了,尤其近实时写入压力大时特别明显。调段参数能缓解但别指望根治,我们当时把segment.forceFlush周期拉长、调低indexBuilding并发度,同时给查询和写入分独立resource group,抖动降了不少。分片建议按数据量/单分片5-10GB算,副本2个够用,主要是把segment合并错峰到凌晨。Qdrant我们也测过,写入性能和稳定性确实好点,但迁移成本也不小,建议先压测再决定。