最近在搭一个基于企业知识库的RAG问答系统,用的bge-m3做embedding,chunk切了512带overlap。检索出来的top-5相关度看着都还行,但大模型生成的时候总喜欢自己脑补,甚至把不同文档里的信息揉在一起编出个不存在的结论。我试过调低temperature,也加了system prompt强调“只基于上下文回答”,还是偶尔翻车。想问下大家,这种问题一般是卡在哪个环节?是chunk切得不够细,还是rerank没做,又或者该换更强的生成模型?有没有比较系统的排查思路?先谢谢各位了。