最近在用Milvus搭一个简单的RAG demo,文档是公司内部的一些技术手册,大概几千份。我直接用OpenAI的text-embedding-ada-002生成向量,然后建了IVF_FLAT索引。但测试的时候发现,top-k召回率(k=10)一直只有60%左右,查了查感觉可能是分块策略或者元数据过滤没用好。我试过调整nlist和nprobe参数,效果提升不大。想问下大家,这种场景下有没有什么调优经验?是不是应该先做文档分块后再embedding?或者换个索引类型?另外,milvus的标量过滤对召回率影响大吗?有点迷茫,求指点。