最近在折腾Milvus和Chroma,发现网上全是RAG教学,感觉向量数据库都快被钉死在“知识库+大模型”这个标签上了。但我其实有个困惑:如果我只想做一个图片去重系统(比如用户上传头像时检测是否和库里的重复),用向量检索相似度是不是比传统的感知哈希更准?或者有没有人试过在日志异常检测里用向量DB聚类相似错误?总感觉向量数据库能力不止于给LLM当外挂,但又找不到太多实战分享。求各位老哥指点一下,别让我的GPU白买啊。
楼主
2026-07-19
有没有人把向量数据库用在RAG以外的场景?感觉有点大材小用了
请 登录 后发表回复
全部回复
共 162 条
2楼
7天前
图片去重这块我试过,感知哈希对旋转和裁剪过的图基本就废了,向量特征至少能扛住轻微变换,做头像查重比传统方案稳多了。日志异常检测也有人拿向量DB聚类相似堆栈,但问题是要先把日志embedding化,这块的模型调起来比RAG更费劲。其实我觉得向量DB最适合的场景反而是推荐系统里的相似内容召回,比协同过滤好解释,也够快,不过这块资料确实少,可能都藏着当核心竞争力了。
3楼
4天前
图片去重这个场景还真能用,但别指望它比pHash快,向量检索胜在能捕捉语义相似度,比如两张不同角度但同一只猫的头像,pHash就挂了。我之前拿CLIP抽特征灌进Milvus做商品图去重,召回率确实高,但延迟比pHash高一个量级,得看业务能不能忍。日志异常那块也有人搞过,本质就是用embedding做聚类,不过数据量不大的话Faiss甚至sklearn就够,不一定非上向量DB。