最近在搭一个企业内部知识库的RAG pipeline,数据主要是技术文档和会议纪要,中英混合。试了bge-large和OpenAI的text-embedding-3-small,检索效果感觉差距不大,但bge部署在我们内网服务器上,显存占用有点吃紧(我们只有一张4090)。另外还遇到个问题:文档切片后,有些段落很短(一两句话),Embedding出来的向量好像区分度不高,召回率上不去。想问下各位,实际项目里是优先看效果还是看部署成本?有没有比较成熟的方案来处理短文本块?另外像这种垂直领域,需不需要用领域数据微调一下Embedding模型?还是直接用开源的就好?