最近在做企业知识库问答,用的RAG方案是bge-large向量检索+monoT5精排,前期测试准确率还行,结果一上线真实用户提问就翻车。发现几个问题:1)用户口语化严重,比如“合同里违约金咋算的”检索到的段落根本不在点子上,召回Top20里有用的就2-3条;2)我试着把重排权重调高,相关性是上来了,但回答里开始出现原文没有的细节,比如把A合同的条款硬安到B合同上;3)还试过加query改写,但效果不稳定,有的改写后反而更偏。想请教下大家,这种生产环境下的检索退化,是应该先优化embedding微调,还是重点搞重排序策略?或者干脆换混合检索(BM25+向量)?有没有踩过坑的同学分享下排查思路?