最近在做一个基于企业文档的问答机器人,用的LangChain+FAISS搭的RAG流程。文档主要是PDF和Word,里面表格和长段落混着。现在问题是检索出来的chunk经常不相关,比如问“报销流程”却召回一堆“差旅标准”的内容。我已经试过换Embedding模型(从bge-small换到bge-large),也调整过chunk_size(从500调到200),效果还是不稳定。想请教一下各位,是不是我分块策略太粗暴了?像这种混合内容文档,是不是该先做结构识别再分块?另外,重排序(rerank)对召回质量的提升真的有那么明显吗?求有实战经验的大佬指点一下,卡了好久了。