最近在搭一个基于RAG的问答Agent,用的向量库是Milvus,embedding用的bge-m3。现在遇到个问题:用户问一个稍微复杂点的问题,比如“分析一下我们公司Q3和Q2的销售差异”,我检索出来的chunk都是各自独立的片段,有的讲Q2,有的讲Q3,还有的讲其他部门的数据。拼在一起喂给LLM之后,回答就很散,逻辑不连贯,甚至有时候会编造数据。我试过调top_k和相似度阈值,但效果不明显。看了一些文档说可以试试父文档检索或者加一层rerank,但不太清楚具体怎么设计。有没有大佬遇到过类似问题?是我chunk切分的方式不对,还是说需要在检索之后做额外的上下文重排?希望能给点实操建议,先谢过了。