最近在做领域知识库问答,用的bge-large做向量检索,chunk大小设的256,overlap设了32。测试时发现很多query召回的前20个chunk里真正相关的只有三四个,rerank(用的bge-reranker)之后也还是混着不少无关内容。我尝试调过topk和相似度阈值,但效果不明显。现在怀疑是不是分块策略太死板了,比如一些表格和代码片段被切得稀碎,语义不完整。有没有大佬遇到过类似情况?是应该先做版面分析再分块,还是直接上更细粒度的结构化抽取?想听听大家的实践经验,尤其是混合检索(向量+BM25)会不会对这类问题有帮助?