最近在做一个基于RAG的问答Agent,知识库大概几千个文档块。用户问一个具体问题,向量检索top5召回的chunk里总有两三个是擦边的,结果Agent把不相关内容也揉进回答里,答非所问。试过调小top_k,但又容易漏掉关键信息。想加rerank模型吧,又担心延迟太高,线上响应顶不住。有没有实战过的老哥指点一下,这种召回噪声问题一般怎么解?是加rerank、还是改prompt让模型自己筛,或者干脆上多路召回?真心求教,卡这儿好几天了。
最近在做一个基于RAG的问答Agent,知识库大概几千个文档块。用户问一个具体问题,向量检索top5召回的chunk里总有两三个是擦边的,结果Agent把不相关内容也揉进回答里,答非所问。试过调小top_k,但又容易漏掉关键信息。想加rerank模型吧,又担心延迟太高,线上响应顶不住。有没有实战过的老哥指点一下,这种召回噪声问题一般怎么解?是加rerank、还是改prompt让模型自己筛,或者干脆上多路召回?真心求教,卡这儿好几天了。
暂无回复,快来抢沙发吧