做RAG项目,用的Milvus + OpenAI的text-embedding-3-small,数据是几千篇技术文档,分块后大概两万多条向量。现在的问题是检索出来的top5经常有完全不相关的结果,但看相似度分数又没低到离谱。试过调chunk_size(从200调到800)、换过bge-m3模型,也加了metadata过滤,效果都不稳定。特别是用户问一些长尾问题(比如“安卓蓝牙权限兼容性”),召回结果基本乱掉。想问问大家:这种混合查询场景,是不是应该上重排模型(比如bge-reranker)?还是说问题出在索引参数(HNSW的M和efConstruction)没调好?有没有踩过类似坑的朋友说下排查思路……