最近在做一个基于本地大模型的知识库问答项目,文档量大概几万条,分块后embedding成1536维向量。一开始图省事用了Chroma,但数据量上来后查询延迟有点明显,而且内存占用飙得很高。看了很多教程都在推Milvus,但感觉部署和运维成本有点劝退,特别是还要起一堆依赖服务。想问问实际在用的朋友,像我这种偏轻量级的场景,是继续优化Chroma(比如用持久化+索引调参),还是直接上Milvus的standalone模式更省心?另外Pinecone这类云服务是不是更适合生产环境?希望有踩过坑的佬指点一下,比较迷茫。