最近在搭一个文档问答的RAG系统,用的bge-large向量模型,chunk大小设了512。问题是:每次检索返回top 10个chunk,但用户问的问题往往只涉及其中1-2段,剩下8段全是噪声。试过调低top_k,但有时候相关片段又漏掉了。想问下大家,有没有什么策略能“二次过滤”这些chunk?比如先让LLM快速判断哪些chunk和问题相关,或者用关键词匹配做个粗筛?另外,chunk重叠设置多少合适?我现在设了32,感觉还是不够灵活。求指教,感谢!