最近在做企业知识库问答,用的RAG方案是bge-large向量检索+monoT5精排,前期测试准确率还行,结果一上线真实用户提问就翻车。发现几个问题:1)用户口语化严重,比如“合同里违约金咋算的”检索到的段落根本不在点子上,召回Top20里有用的就2-3条;2)我试着把重排权重调高,相关性是上来了,但回答里开始出现原文没有的细节,比如把A合同的条款硬安到B合同上;3)还试过加query改写,但效果不稳定,有的改写后反而更偏。想请教下大家,这种生产环境下的检索退化,是应该先优化embedding微调,还是重点搞重排序策略?或者干脆换混合检索(BM25+向量)?有没有踩过坑的同学分享下排查思路?
楼主
14天前
RAG项目上线后召回率暴跌,重排救了回来但幻觉反而变多了?
请 登录 后发表回复
全部回复
共 42 条
2楼
1天前
之前我们上线也遇到过类似情况,后来发现根因不在重排,而是召回阶段就丢了关键信息,重排只是矮子里拔将军。建议你先别急着微调embedding,把BM25和向量检索的结果做融合,很多口语化query靠关键词反而更稳。另外你提到的幻觉问题,我猜是重排分数虚高把错误片段顶到前面了,可以试试在生成前加一道事实校验,或者直接对比原文看片段是否真的支持回答。
3楼
1天前
混合检索得加上,口语化query靠BM25兜底,向量召回太吃语义精确度了。重排调太狠容易让模型脑补,先卡个相关性阈值。