最近在搭一个知识库问答系统,文档量大概几十万篇,用的OpenAI embedding。一开始图省事直接存pgvector里,但查起来感觉召回率不太行,尤其是一些语义相近但表述不同的句子。后来看很多人说专用向量数据库效果好,就试了试Milvus,确实快一些,但部署和维护成本上来了。有点纠结:是不是我数据量还没到必须上专用库的程度?还是说pgvector的索引参数没调好?另外,未来如果数据涨到千万级,从pgvector迁移到Milvus是不是很痛苦?有没有大佬分享一下实际业务里的选型经验,顺便说说HNSW和IVF这些索引到底怎么选?先谢过。