最近在做个人知识库的RAG项目,用的pgsql+pgvector。文档主要是PDF论文和技术博客,长短差异很大。我试过固定512/1024字符切分,也试过按段落分,但检索效果时好时坏。比如按512切会把一些长公式或代码块截断,按段落分又经常出现一个段落超长(几千字)导致向量化效果变差。看网上说用递归字符切分器,但重叠长度和分隔符优先级还是得拍脑袋。另外,我目前embedding用的是bge-large-zh,不知道跟chunk大小有没有匹配关系?有没有大佬分享下实际项目中调chunk的经验,或者判断检索好坏的标准?先谢谢了。