最近在搭一个垂直领域的RAG问答,用的bge-m3做embedding,chunk切了512带overlap,检索出来的top5看召回内容相关性都还行,但喂给qwen2.5-7b之后,答案经常抓不住重点,甚至把检索片段里的无关细节当成了核心。我试过在prompt里强调“只根据给定资料回答”,也试过把top5改成top3,效果都不稳定。想问问各位,这种情况一般是卡在rerank环节,还是说需要在生成前对检索片段做额外的重排或压缩?或者干脆是模型对长上下文的利用能力不行?有没有什么工程上比较实用的tuning思路?