最近在公司做一个内部知识库的RAG问答系统,用的LangChain + 智谱AI,向量库是Milvus。单测的时候效果还行,但上线后同事反馈有时候答非所问,同一个问题隔几分钟问答案都不一样。我查了日志,发现分块chunk_size设的512,重叠20,召回Top5。怀疑是切分策略或者Embedding模型对特定术语不敏感导致的。想请教下各位,遇到这种生产环境效果不稳定的情况,一般是从哪几个维度去排查?有没有什么系统性的调优方法论?另外,像这种“幻觉”问题,除了加提示词,还有什么工程手段能兜底?谢谢。