最近在搭一个基于本地技术文档的RAG问答,数据是几百篇Markdown,总token大概50万。我用的bge-large-zh,固定切块512字、重叠128,top_k取5。结果发现很多问题召回的片段和问题关联度很低,比如问“怎么配环境变量”却召回一堆讲API参数默认值的段落。调过相似度阈值,要么漏检要么还是不准。想问问各位老哥,这种场景是不是应该先做章节级切块再二次检索?或者换一下embedding模型比如OpenAI的text-embedding-3-small会好点?另外chunk重叠率是不是也有讲究?我现在有点懵,感觉每一步都有影响但不知道优先调哪个,求指点。