最近在做一个法律文书问答的RAG项目,本地测试时单条文档检索top5还挺准的,但一换成全量3000+文档的线上环境,回答质量明显下降,很多明明在库里的事实,模型却说“未找到相关信息”。我怀疑是向量检索环节出了问题,但看了日志,召回结果确实包含了相关片段,只是排序比较靠后。尝试调了chunk_size和overlap,也试过换embedding模型(bge-m3和text-embedding-3-small都试了),效果都不稳定。另外,线上并发一高,响应时间从2秒飙到8秒,怀疑是不是检索链路里有什么隐性问题。有没有大佬遇到过类似情况?该从哪些维度系统排查?是索引结构、召回策略,还是rerank环节的问题?求指点,感激不尽。