最近在搭一个私有知识库的RAG,用的Qwen2.5-7B做生成,embedding一开始图省事直接用了sentence-transformers里的all-MiniLM-L6-v2,结果检索出来的东西经常驴唇不对马嘴,chunk也试过256和512,召回率就是上不去。看很多帖子说中文场景要换bge-m3或者gte-large,但我这边机器只有一张3090,跑bge-m3会不会太吃显存?还有人说直接上dense-x或者colbert这类晚交互模型,但感觉复杂度一下子高了好多,不太确定值不值得折腾。有没有大佬在类似配置下做过对比?主要痛点其实是长文档里细节问题的定位,希望检索阶段就能把相关段落锁得更准一点。