最近在做RAG项目,用的Milvus存文档切片向量,大概几十万条数据。现在的问题是query召回的相关文档老是不准,top10里经常混进一些语义完全不搭边的结果。我试过换不同的embedding模型(bge-m3和text-embedding-3-small),也试过改距离算法(IP换成了L2),召回率还是上不去。感觉数据清洗和chunk切分也都做了,但效果就是不如预期。想问下各位老哥,是索引参数(比如HNSW的M和efConstruction)会影响召回吗?还是说需要做query改写或者混合检索(比如BM25+向量)?有没有类似踩坑经历的朋友分享一下调参经验,或者推荐一下更合适的向量检索方案?