最近在做一个文档问答的RAG,用的bge-m3做embedding,faiss做检索。文档是那种带小标题的说明书,我一开始按固定512字符切chunk,发现很多问题答案分散在不同chunk里,召回率不行。后来改成按段落切,但段落长短不一,短的只有几十字,长的上千字,结果检索出来的片段相关性很差,top5里经常混进一堆和问题只有字面重合、语义无关的内容。我试过调top_k,也试过加rerank(用的bge-reranker-base),但效果提升不明显。想问下大家,这种结构化长文档,chunk策略到底该怎么定?是不是得结合标题层级做个递归切分?另外rerank模型的选择和阈值设置有没有什么经验?先谢过了。