最近在做RAG的项目,用Chroma存了几千条文档的embedding,查询的时候发现返回结果里经常混进一些“看起来完全无关”的片段。我试着调metadata里的距离阈值,但调小了召回率暴跌,调大了又全是噪声。后来看到有人用top-k截断+相似度过滤的组合,但还是拿不准标准。另外我注意到同样的问题,用OpenAI的embedding和本地bge的向量结果差别很大,是不是不同模型产出的向量分布根本不适合直接比相似度?有没有比较通用的调参思路,还是说只能靠测试集硬试?求过来人指点一下。