最近在搭一个文档问答的RAG流程,用的bge-m3做embedding,chunk大概300字带50字重叠,检索top5丢给gpt-4o-mini生成。结果离谱的是,答案里只有开头几句跟问题沾边,后面全是模型自己编的“车轱辘话”。我打印了检索到的chunk,发现好多跟问题关键词重合度很高,但语义上根本不是一回事,比如问“退款流程”,chunk里全是“退款”但讲的是退货。现在怀疑是embedding模型对长文档的语义捕捉不行,还是我切分策略有问题?或者干脆应该上重排?有没有类似踩坑的朋友给个方向,谢谢。