最近在做一个内部文档问答的小项目,用的Chunk大小是512,重叠50,向量库用的FAISS,Embedding是BGE-large-zh。现在问题是:用户问“怎么申请年假”,系统经常把“年假政策”和“调休流程”混在一起,召回的top5里总有2-3个明显不相关的片段。我试过调chunk大小到256,效果也没好多少。想请教下各位,这种情况是不是Embedding模型本身不够强?换更贵的模型比如OpenAI的text-embedding-3或者Cohere的embed-v3,能显著改善吗?还是说问题出在检索策略上,比如需要加Rerank或者混合检索?预算有限,不太想盲目试错,求过来人指点。