最近在做一个基于本地知识库的问答机器人,用的LangChain+OpenAI,向量库是Chroma。我的文档是几十个PDF,主要是产品手册和技术规范。目前遇到一个问题:用户问“设备报警时如何处理”,检索出来的top-5文档里经常只有1-2个是相关的,而且相关的那几个内容还比较零散,导致最后LLM生成的答案很拉胯。我现在的分块是固定500字符,重叠50字符,用的bge-large-zh模型。想问问大家,这种情况是不是分块策略的问题?还是说检索方式(比如用MMR还是相似度)也有影响?有没有比较实用的调参经验,或者做混合检索的必要性?先谢谢各位了。