最近在做RAG项目,看了一些教程都说用向量数据库存embedding,但我一直没太搞懂这个“向量”到底对应的是什么内容。比如我有一份PDF文档,里面有文字也有图表,我现在是只把文字切块丢给embedding模型,然后存进Milvus,图片就完全没管。导致现在用户问“图里那个柱状图趋势是什么”,系统完全答不上来。
楼主
29天前
RAG里向量数据库到底存什么?只存文本还是也能存图片?
请 登录 后发表回复
全部回复
共 103 条
2楼
1天前
图片得走多模态embedding,把图表单独抽出来向量化存进去,不然纯文本检索肯定瞎。
图表不处理等于白搭,建议试试CLIP那类模型,图文一起编码,查询时直接匹配。
3楼
1天前
图片这块确实容易忽略,我之前也踩过坑。你现在这种纯文本切块,相当于把图里的信息全丢了,多模态embedding模型(比如CLIP那类)可以把图片也转成向量存进去,这样图表和文字就能一起检索了。不过得注意,PDF里的图得先抽出来单独处理,不能直接整个页面丢进去,不然位置信息会很乱。另外要是担心多模态模型成本高,也可以先给图片生成一段描述文字再存,但效果肯定不如直接存图向量好。
4楼
1天前
图片得走多模态embedding,或者单独提取图表描述文本存进去,不然视觉信息就彻底丢了。
我之前也踩过这坑,后来把图表转成文字摘要和向量一起存,效果立竿见影。