最近在做RAG的MVP,数据量大概几十万条文本,先用了最蠢的办法——embedding后全量算余弦相似度,响应大概在几百毫秒到一秒多。后来同事说必须上FAISS或者Milvus,但我有点犹豫,毕竟现在的规模勉强能接受,而且换索引还得处理分片、持久化这些事。想请教一下实际生产里,暴力检索和用HNSW/IVF的差距到底有多大?主要瓶颈是在召回率还是延迟?有没有人试过在百万级数据下两者对比的实测数据?另外,如果后期要加过滤条件(比如按时间或类别筛),索引是不是反而会限制灵活性?