最近在做企业知识库的RAG项目,用Milvus存了大概800万条切分后的文档向量(OpenAI embedding,1536维)。单机部署,8个分片,测试时top-5召回率只有62%,但用同样的向量在本地暴力检索能到85%+。我确认了embedding一致,也试过调HNSW参数(M从16调到32,efConstruction从200调到500),效果提升很小。现在怀疑是不是分片后每个shard的nlist设太小导致PQ量化误差被放大?或者是我对“相似度阈值”的理解有偏差?有没有大佬遇到过类似情况,求指点排查方向,谢谢。