最近在尝试用Cursor配合LangChain搭一个简单的RAG应用,用来回答公司内部文档的问题。我用的默认的text-embedding-ada-002,文档切成了512个chunk,检索top3。但测试了几个常见问题,比如“报销流程是什么”,返回的片段里居然有一条是“公司福利政策”,虽然也有“报销”这个词,但完全不相关。我试过调高top k,但噪音更多了。是不是embedding模型本身就不太适合这种长文档的语义匹配?还是说我的chunk大小或者检索策略有问题?有没有大佬用Cursor踩过类似的坑,求指点。
楼主
2小时前
用Cursor写RAG,向量化后检索总不准,是embedding模型问题吗?
请 登录 后发表回复
全部回复
共 1 条
2楼
57分钟前
老实说我觉得问题可能出在chunk策略上,512个字符对很多文档来说太粗糙了,“报销流程”和“公司福利政策”里都出现“报销”这个词,但语义上完全两码事。可以试试基于语义边界来切分,比如按段落或标题,别让一句话被硬生生拆开。另外ada-002对短文本匹配还行,但长文档里关键信息会被稀释,换个bge或e5这类专门优化的模型说不定效果会好很多。top k先别调太高,3-5个够用,重点还是把chunk质量提上去。