最近在做一个企业知识库问答,用的开源Embedding模型(bge-large-zh)加Milvus,文档切了512字符带overlap。本地测试top5召回看起来挺准,但一接到大模型(Qwen-14B)那边,回答经常瞎编,甚至不如不挂RAG直接问。我怀疑是不是我拼接prompt的方式有问题——现在就是把检索到的段落一股脑塞进system prompt里,没做重排序,也没过滤低分块。另外,文档里表格和图片比较多,切分后语义碎得厉害。有没有大佬遇到过类似情况?想请教下是重排序(比如bge-reranker)能救回来,还是我切分策略本身就得推翻?先谢过。