最近在做一个基于公司内部文档的RAG问答系统,用的是LangChain + Chroma + 本地部署的Qwen模型。测试阶段发现一个很头疼的问题:直接问模型,它还能答出个大概;但接上RAG检索增强后,回答反而变得碎片化,甚至开始胡编乱造。我查了检索到的chunk,相关性看起来还行,但拼接后喂给模型,它好像就“飘”了,老是把几段不相关的信息揉在一起。我自己怀疑是prompt模板里对“仅基于上下文”的约束写得太死,或者chunk切分粒度(现在按256字符)太小导致上下文断裂。有没有朋友遇到过类似情况?你们是怎么定位是检索端还是生成端问题的?求分享点排查思路。