直接用开源的7B模型做RAG,效果总是差强人意,有什么优化技巧?
最近在这个方向上踩了不少坑,想听听大家的实际经验。
直接用开源的7B模型做RAG,效果总是差强人意,有什么优化技巧?
最近在这个方向上踩了不少坑,想听听大家的实际经验。
这问题我也遇到过,7B模型直接做RAG确实容易翻车。我的经验是先优化检索环节,比如用bge-large-zh这类专门做embedding的模型替换默认方案,能明显提升召回质量。另外,给知识库分块时别偷懒,按语义切分比固定token数靠谱得多,再配合一个简单的reranker过滤一下,效果能拉上来不少。你试过调整prompt模板吗?有时候把检索到的内容重新组织成更友好的格式,模型输出也会跟着变好。