最近在做一个公司内部文档问答的小项目,用的LangChain加Chroma向量库,文档都是些技术手册和会议纪要。我把文档按段落切分后,用text-embedding-ada-002做向量化,存进去。但用户问个“第三季度的营收目标”,返回的却是另一份无关文档里的“库存周转率”。我试过调高top_k,也试过不同分块大小(512、1024),结果还是飘。想问问大家,这种语义匹配不准的情况,是不是embedding模型不够细?还是说Chroma本身的检索策略有问题?有没有必要换成Milvus或者上重排序?求大佬指点一下思路,卡了好几天了。