最近在用本地部署的Qwen2.5-7B搭一个简单的RAG问答系统,文档主要是技术手册和API文档,大概几百页。我用的bge-large-zh-v1.5做embedding,chunk大小设的512,重叠50。结果测试时发现,稍微换个问法,比如问“怎么设置超时时间”和“请求超时怎么配”,召回的结果完全不一样,经常召不到关键段落。我试过调chunk大小和重叠,效果提升不明显。想问问大家,这种场景下是应该换更强的embedding模型(比如bge-m3),还是问题出在检索策略上?另外,有没有必要先做一下query改写或者HyDE?感觉每个环节都调一下太费时间了,希望有经验的朋友指点一下方向。