最近在搭一个面向公司内部文档的RAG系统,用的bge-large-zh-v1.5做embedding,Chunk大小设了512,重叠32。部署到生产环境后发现,很多明明相关的文档就是检索不出来,比如用户问“报销流程”,却返回了一堆考勤制度。我怀疑是embedding模型对业务术语理解不够,但换成m3e或者text2vec-base又怕效果差不多。想问下各位大佬,这种场景下有没有比较靠谱的调优思路?是换模型、调chunk策略,还是加reranker更立竿见影?