最近在做私有知识库的RAG,数据量大概20万条文档切片,用的bge-m3转的向量。试了Milvus和ES的knn检索,top20召回率基本都在60%左右,感觉不太行。我预处理做了去停用词、分词,也试过调整chunk大小(256/512都试过),效果没明显变化。现在怀疑是不是混合检索(BM25+向量)权重没调好,还是说RAG本来就这么拉胯?有做过类似项目的老哥能指点下吗,或者推荐下你们在用的检索策略?真心求教,搞了快两周了有点崩溃。