最近自己在搭一个基于本地知识库的RAG系统,用的bge-large做embedding,chunk大小设成了512。实际测试时,top-k检索返回了10个chunk,但LLM(qwen2.5-7b)经常把不相关的信息也揉进回答里,导致输出又长又偏。我想只让模型聚焦最相关的1-2个chunk,但又怕丢失关键细节。试过调低相似度阈值,结果有时直接没内容返回。请问大家是怎么控制检索“精度”的?是调整chunk大小、rerank、还是Prompt里加限制?求具体踩坑经验。