最近在折腾一个内部文档问答系统,基于RAG(检索增强生成)那种。我用的ChromaDB和OpenAI的ada-002,但发现如果chunk切得太小(比如128 tokens),检索出来的片段经常语义不完整,导致LLM回答得很碎。切大一点呢(比如512 tokens),召回率又下降,很多相关片段被漏掉了。想请教下大家,有没有比较实用的chunk大小和embedding模型的搭配经验?或者是不是我用的模型不太适合这种场景?还有,有没有必要对chunk做重叠处理?踩坑踩得有点懵,求指点。