最近用LangChain搭了个RAG问答系统,本地测试时top-k命中率还行,结果一上线跑真实用户query就崩了。比如用户问“工资什么时候发”,我库里明明有《薪酬管理制度》相关条文,但检索出来的全是别的文档碎片,甚至把离职流程都带出来了。我怀疑是embedding模型对口语化表达不敏感,但换了BGE-large还是不行。现在看chunk切分也感觉有问题,按固定200字切,很多语义被截断了。想请教下大家,遇到这种线上检索效果差的情况,一般从哪些维度排查?是先调chunk大小还是换rerank策略?有没有靠谱的评估方法(比如构造golden set)能提前发现问题?求实战经验,感谢!