最近在做一个企业知识库问答,用的LangChain + ChatGLM3,检索部分一开始直接用bge-large-zh,召回还行但排序不太准。看网上说可以拿业务数据微调Embedding模型提升效果,我就用大概3000条query-doc对跑了bge的finetune,loss也降得挺正常。结果换上新模型后,Top5召回率反而掉了快10个点,有些原来能召回的现在都找不到了。是我数据构造有问题还是训练方式不对?有没有踩过类似坑的老哥指点一下,真的有点懵。