最近在搭一个私有知识库问答,用的LlamaIndex加本地Qwen2.5-7B,embedding用的bge-large-zh。检索出来的top5文档肉眼看着相关度还行,但生成答案总感觉差点意思,经常答非所问或者把不相关细节混进去。我试过调chunk_size和overlap,也试过换top_k,效果提升不明显。看群里有人说加个rerank能救,但我显卡只有12G,再跑个rerank模型怕显存不够。想问问有没有类似配置的朋友,BGE rerank-v2-m3在显存和速度上实际体验如何?或者有没有其他轻量级的精排方案?还是说问题其实出在prompt模板上,我该从哪个方向继续调?