最近在搭个人知识库的RAG系统,用的开源模型比如bge-large-zh和m3e,检索时发现长文档切块后召回率还行,但top5里经常混进语义不相关的片段,尤其问一些口语化问题(比如“怎么改代码报错”)和文档里正式表述对不上。已经试过调chunk_size和overlap,也加了混合检索(BM25+向量),但还是觉得embedding本身对中文长句和同义改写不够敏感。想问下大家现在中文embedding模型是不是得换更新的(比如gte或bge-m3)?还是有别的预处理技巧(比如query改写)能救一下?求指路,别骂。