最近在做一个基于开源模型(Qwen2.5-7B)的本地知识库问答,用的bge-m3做embedding,chunk_size设的是512,overlap设了50。但测试下来,很多明显相关的问题召回不到对应文档,比如问“报销流程”只召回第一条,后面详细步骤都没出来。我试过调大top_k,效果也不明显,反而噪音变多了。想请教下各位,这种召回质量差的情况,一般优先排查embedding模型还是重新设计chunk策略?有没有比较系统的调优路径?另外,如果换更强的embedding(比如gte-Qwen2)会不会有质的提升?还是说应该先试试混合检索(BM25+向量)?求有经验的老哥指点下,谢谢!