最近在折腾一个本地知识库的RAG项目,用的LlamaIndex框架,文档是中文的技术手册。试了bge-large-zh-v1.5和text2vec-base-chinese,检索出来的top-5结果经常跟query语义对不上,比如问“GPU内存不足怎么解决”,反而给我匹配到“显存频率调整”。
我是先切块再embedding的,块大小设了256,重叠20%。也试过调chunk_size和top_k,但效果提升有限。
想问问大家:中文RAG的embedding模型选型有没有什么坑?是不是得先做同义词扩展或者query改写?还是说LlamaIndex的默认检索策略就不太适合中文?求分享点实战经验,感谢!