最近在做一个内部文档问答的RAG项目,用的LangChain + OpenAI embedding,chunk size试了512和1024,overlap也调过,但检索出来的片段总是不太对,经常答非所问。比如用户问“报销流程”,召回的内容里却混着大量“差旅标准”的段落,感觉语义相关度不高。想问下大家,这种情况一般是chunk切分策略没调好,还是说embedding模型本身就不太适合中文长文档?另外,有没有必要直接上reranker?求有经验的前辈指点下排查思路,现在有点不知道怎么定位问题了。