最近把一个基于RAG的问答机器人部署到了内部测试环境,用的LangChain + 开源Embedding模型 + Milvus。单测的时候感觉回答质量还行,但真实用户一用,反馈最多的就是“答非所问”,比如问“怎么报销”,返回的却是“请假流程”。我检查了召回结果,发现Top-5里确实有相关文档,但生成就是没用上。感觉问题出在检索和生成之间的衔接上,但不知道是该调chunk大小、改prompt,还是得换rerank模型。有没有老哥遇到过类似情况,有没有系统的排查思路?