最近在做一个人社领域的问答Agent,用LangChain+FAISS搭了个RAG。知识库大概一万多个chunk,embedding用的bge-large。现在问题是我调top-k参数调麻了:k=3的时候回答太片面,经常漏关键信息;调到8又混进来一堆不相关的内容,生成答案反而变差。我试过先按相似度阈值过滤再取top,但不同查询的相似度分布差太多,固定阈值也不靠谱。看很多人说用重排序模型,但我现在只想先把检索质量提上去,想问问各位老哥,你们生产环境里一般怎么定这个k值?有没有什么经验法则,或者配合什么指标来判断检索是不是准了?