最近在搭一个企业知识库问答,用的langchain+faiss,embedding是bge-large。测试的时候发现召回top10基本都能命中相关段落,但最终生成答案经常张冠李戴,比如问“XX产品退款流程”会答成“售后政策”。我怀疑是chunk切得不对,现在按256字切且重叠20,也试过128但感觉信息更碎片。另外我把检索到的片段直接塞进prompt,是不是该加一些“根据以下内容回答”的约束?有没有大佬遇到类似情况,怎么定位是检索侧还是生成侧的问题?