最近在做一个RAG小项目,用ChromaDB存了大概10万条文本的向量,用的all-MiniLM-L6-v2模型。但实际查询时发现,有些明显相关的文档排得很靠后,甚至没出现在TopK里。比如用户搜“苹果公司的产品”,结果前几页全是“水果”相关的描述。我调整过距离度量(cosine、L2都试了),也试过加一些简单的filter,但效果提升不大。想问问大佬们,这种情况一般是embedding模型没选对,还是我的数据切得太碎了?或者有什么经典的调参思路可以分享?先谢过!