最近在做一个基于私有文档的问答机器人,用的OpenAI embedding + FAISS,检索出来的chunk经常不相关,比如问“合同违约金怎么算”,召回的却是“合同签署日期”那段。我试过调top-k、切分大小,效果还是不稳定。看到社区都在推pgvector、Milvus、Weaviate这些,想问问换向量数据库真的能提升召回质量吗,还是说问题其实出在embedding模型或者chunk策略上?另外我文档里表格和代码比较多,是不是需要单独处理?求过来人指点一下,实在不想在检索这步就拉胯。