最近在搭一个个人知识库问答,用的LLaMA系模型,检索部分试了bge-large和text2vec,感觉召回结果总是不太对味。比如问“怎么配置显卡驱动”,能召回一堆“显卡性能对比”的文章,明明向量相似度挺高,但就是答非所问。我预处理也做了,chunk按512切,重叠32,元数据也加了,就是感觉语义匹配不够精准。是不是该上重排模型了?还是说开源embedding天花板就这样,得换商业API?另外想问问大家,有没有什么技巧能把chunk粒度调得跟问题类型匹配起来,比如短问答和长文综述是不是得用不同策略?求指教。