最近在用LangChain+开源embedding模型搭RAG做企业内部知识库问答,部署到生产环境后效果很差。比如用户问“离职流程怎么走”,检索出来的片段经常是招聘相关的,相关性排序明显不对。我用的chunk_size是500,overlap 50,embedding是bge-large-zh,向量库用的Milvus。调过top_k,从5调到20,但还是答非所问。想问下各位,这种情况大概率是chunk切分策略的问题,还是embedding模型对领域术语理解不够?或者说是召回后rerank没做导致的?如果有类似踩坑经历的大佬,希望能分享下你们的调参思路,感谢!