最近把公司内部文档库接入了RAG流程,用的bge-large-zh和FAISS,本地测试top5召回还挺准,但一上生产环境(多线程并发调用)就发现检索结果明显变差,甚至经常返回一些完全不相关的片段。查了日志,切块用的是固定512字符,重叠64,文档里大量表格和代码块被硬生生截断。另外,生产环境里我开了GPU加速,但Embedding模型是动态加载的,不知道会不会有缓存竞争问题。想请教一下,这种线上和线下效果差距大的情况,一般优先排查哪些点?是切块策略太死板,还是Embedding服务的并发稳定性不够?有没有比较成熟的调优路径?