最近在搭一个个人知识库的RAG项目,主要用来处理一些PDF论文和Markdown笔记。目前用的框架是LangChain,向量库用的Chroma,但到选embedding模型这一步卡住了。看了一些评测,BGE-large-zh-v1.5和m3e-base好像都不错,但实际测试下来发现差距挺明显的:BGE对长文本的语义捕捉确实更稳,但速度和显存占用有点吃不消;M3E轻量很多,可碰到一些专业术语或者中英混合的句子就有点飘。想问问大家在生产或者实际项目中更倾向用哪个?另外有没有必要上那种带指令(instruction)的版本?我目前数据量大概几万条,后面可能会扩到几十万,担心迁移成本。求有经验的大佬指点一下,或者推荐其他更合适的开源方案也行。