最近在尝试用Cursor配合LangChain搭一个简单的RAG应用,用来回答公司内部文档的问题。我用的默认的text-embedding-ada-002,文档切成了512个chunk,检索top3。但测试了几个常见问题,比如“报销流程是什么”,返回的片段里居然有一条是“公司福利政策”,虽然也有“报销”这个词,但完全不相关。我试过调高top k,但噪音更多了。是不是embedding模型本身就不太适合这种长文档的语义匹配?还是说我的chunk大小或者检索策略有问题?有没有大佬用Cursor踩过类似的坑,求指点。