最近在做一个基于公司内部文档的问答机器人,用的LangChain + OpenAI embedding + Chroma。文档是PDF和Word混合的,有的表格很长,有的段落特别碎。我自己感觉chunk_size调到500,overlap设50已经挺合理了,但检索出来的top-5总有一半是无关内容,甚至有时候问“报销流程”,返回的是“差旅标准”这种沾边但不对的段落。