最近在搭一个基于本地知识库的RAG问答,文档主要是产品手册和故障排查记录。我用的bge-large-zh,直接embedding后扔faiss里检索,topk取了10。结果发现很多query召回的前几个片段跟问题根本不在一个频道上,比如问“设备过热报警”,召回的前三全是安装说明里的“环境温度要求”。我试过调chunk_size从256到512,也加了overlap,效果还是飘。想问下大家,这种弱相关召回是embedding模型选型的问题,还是说需要做query改写或者混合检索(比如BM25+向量)?另外有没有什么好用的重排模型推荐,最好轻量一点的,毕竟个人项目预算有限。先谢过各位大佬了。