最近在搭一个基于本地知识库的RAG问答系统,用的LangChain+OpenAI embeddings+Chroma。文档是产品手册和技术规范,大概几百页。现在的问题是检索出来的片段经常不相关,比如用户问“A设备的保修政策”,返回的却是隔壁B设备的参数说明。我试过把chunk_size从500调到200,重叠度也改过,效果不明显。后来怀疑是embedding模型的问题,但换了个更大的模型也没太大改善。想问问有经验的朋友,你们一般是从哪个维度去调?是改写问题、做混合检索,还是干脆上rerank?另外有没有好用的评估指标,能量化“检索质量”而不是靠肉眼猜?先谢过。