最近在做一个文档问答的RAG项目,用的Milvus存了大概50万条chunk,embedding模型是bge-large-zh。目前遇到的问题是:用户问一些比较具体的问题时,召回的top5里经常混进去一些语义相近但完全不相关的内容,反而真正的答案被挤到十几名开外。我已经试过调相似度阈值、换距离算法(L2和IP都试了),也试过加粗粒度过滤(比如按文档类型先筛一遍),效果都不太稳定。想问下各位老哥,除了无脑加大召回数量或者调topk,还有哪些工程上比较实用的手段能提升召回精度?比如要不要考虑做rerank,或者对chunk做更细的切分策略?现在有点迷茫,感觉数据量上来之后调参的收益越来越不明显了。