最近在做公司内部的文档问答系统,用的是LangChain+Chroma这套。目前卡在Embedding选择上,因为数据是纯中文的,看很多教程都推荐BGE系列,但也有人说直接调OpenAI的text-embedding-ada-002效果更好。我本地跑了一下BGE-large-zh,感觉速度还行,但召回率没做严格评测,心里没底。想请教下大家,在中文场景下,BGE和OpenAI的Embedding实际效果差距有多大?另外,如果后续要接入Rerank模型,是不是对Embedding的要求就没那么高了?预算有限,不想走弯路,求过来人指点。