最近在做一个人事政策问答的RAG,用的bge-m3做embedding,chunk大小设的512,重叠64。检索出来的top5片段相关性看着还行,但拼在一起喂给qwen2.5-7b之后,回答经常前后矛盾,比如前面说年假5天,后面又说10天。我怀疑是切片把完整的制度条款拦腰截断了。试过调小chunk到256,但召回率又掉了。也试过让LLM先总结每个片段再合并,速度慢得没法用。有没有大佬遇到过类似情况?是应该改切片策略(比如按markdown标题切),还是换rerank,或者干脆改生成端的prompt?求个实操思路。