最近用LangChain搭了一个本地知识库RAG,embedding用的bge-large-zh,向量库是Milvus,LLM接的Qwen2.5-7B。测试的时候发现,问一些跨章节的综合问题,比如“某项目的技术方案和预算对比”,检索出来的chunk明明包含相关数据,但最终回答总是漏掉预算那部分细节。我试过调top_k从3改到5,也试过换chunk_size从500改成300,效果还是不稳定。想问问大家,这种“检索到了但生成不全”的情况,一般是卡在rerank环节,还是模型本身的指令遵循能力不够?有没有比较实用的调优顺序?先谢过各位了。