最近在做一个RAG项目,文档量大概几十万条,需要做语义搜索。看了好多教程,有的推荐Milvus,说性能强适合生产,有的说Chroma轻量级上手快。我本地试了下Chroma确实简单,但担心以后数据量大了要迁移。Milvus又感觉部署有点重,还得搞Docker和etcd。想问下各位实际项目中,中小规模的数据量有必要一上来就用Milvus吗?还是先用Chroma或Qdrant这种轻的方案,等量级上去了再迁?另外关于embedding模型的选择,现在用bge-m3,但看到有人直接用OpenAI的接口,效果差距大吗?求真实经验,别太理论的。