最近在做一个企业内部知识库的Agent,用LangChain搭的RAG pipeline,向量数据库用的Chroma。文档更新后重新embedding并替换了旧chunk,但Agent回答问题时还是经常引用老版本的内容,尤其是涉及版本号、政策条款这些细节时。我怀疑是检索时top-k返回了新旧混合的结果,或者rerank阶段没处理好时效性。尝试过加metadata过滤,但不确定最佳实践。想请教一下各位,有没有更优雅的方式来保证Agent只引用最新版本的知识?目前数据量不大,但以后可能扩展到上万份文档,希望方案能平滑扩展。
楼主
22小时前
RAG系统里的知识库更新后,Agent回答还是老内容,怎么破?
请 登录 后发表回复
全部回复
共 2 条
2楼
16小时前
试试在检索时加个时间戳过滤,按文档版本号排序取最新,比单纯靠metadata靠谱。
3楼
9小时前
试试在检索时把文档时间戳作为硬过滤条件,只查最新版本,效果比纯靠rerank靠谱。