最近在做一个法律问答的RAG项目,底模用的Qwen2-7B,先用领域语料做了增量预训练(大概5w条法条+裁判文书),然后又用构造的问答对做了LoRA微调。结果发现单独跑检索(bge-m3)效果还行,但微调后生成的答案经常引用错误条文,甚至把不相关的法条拼在一起。
我怀疑是不是微调阶段把检索器的embedding也带偏了?还是说应该冻结检索模型,只调生成部分?另外,微调数据里“问题-答案”对和“问题-检索片段”对的比例是不是有讲究?我现在大概3:1,但感觉模型更倾向于“背答案”而不是“看检索结果”。希望有做过类似方案的朋友指点一下,是否需要把检索结果显式拼进训练样本里做对比学习?