最近在做一个企业知识库问答,用的langchain+openai的pipeline,检索用的faiss,embedding是text-embedding-ada-002。问题是我按固定chunk_size=500切分文档,重叠设了50,但用户问的问题稍微绕一点(比如“去年Q3的报销流程和今年比有啥改动”),召回的前几段经常命中无关内容,导致生成答案东拼西凑。我试过调top_k从4改到8,效果反而更差。也想过用父子分块或者加metadata过滤,但感觉越改越乱,不知道是不是应该先换embedding模型,还是干脆上重排序?有没有做过的朋友说说,RAG调优到底先调哪里?