最近在做RAG项目,用的pipeline是PDF解析→固定512字符分块(重叠128)→bge-large-zh→存入Milvus,检索用的也是默认的余弦相似度。测试集是公司内部合同文档,大概200份,人工标注了50个问答对。现在top-5召回率只有62%左右,有些明明语义很接近的问题,召回来的片段却答非所问。我试过调小topk阈值,但精准率掉得更快。想问问有经验的前辈,这种场景下是不是不该用固定分块?还是说国产embedding模型在长尾专有名词上就是不如OpenAI的ada-002?另外,Milvus里的索引类型(IVF_FLAT还是HNSW)对召回率影响大吗?有点迷茫,希望有实战经验的大佬指点一下方向。