背景:公司内部知识库,用的bge-m3做embedding,chunk大小设的512,重叠128,向量库用的Milvus。目前测试集上命中率只有65%左右,老板已经有点不耐烦了。我自己排查过,发现很多问题出在用户query太口语化,跟文档里的书面语对不上。试过加HyDE,效果提升有限,还多了一倍延迟。也试过调top_k,从10调到20,召回上去了但精排之后答案质量反而崩了。现在有点迷茫,不知道是该换更强的rerank模型,还是该从数据清洗和chunk策略下手?有没有踩过类似坑的朋友,求分享点实战经验,感激不尽。