最近在做一个文档语义搜索的小项目,用Milvus + OpenAI的嵌入模型,索引类型用的IVF_FLAT。测试阶段,我手动标了100条相似文本做召回评估,结果top-10召回率只有60%左右。我已经调了nprobe(从8调到64),也试过重建索引、换不同距离度量(余弦 vs L2),但效果提升不明显。我的困惑是:是不是我选的嵌入模型维度太高(1536维)导致IVF_FLAT效果差?还是说100条样本太少、评估本身就有问题?或者干脆我应该换HNSW?另外,有没有快速诊断某个向量搜索任务瓶颈的通用思路?求有实战经验的老哥指点一下,谢谢。