最近在做一个企业内部的问答机器人,知识库是几千篇PDF和Word,切片用的固定500字+50字重叠,向量用的bge-large-zh。现在的问题是,用户问一个具体问题,召回的top20文档里往往只有两三条是真正相关的,而且很多都是同一段内容被不同切片重复覆盖。我试着加了bge-reranker重排序,但感觉提升有限,还经常把一些背景信息排到前面去。我想问下大家,这种场景是应该先做文档级的过滤(比如用标题或章节做粗筛),还是直接改切片策略?另外有没有什么好用的query改写技巧,能减少这种“关键词飘”的情况?求有经验的大佬指点一下,调了一周有点崩溃了。