最近在搭一个基于知识库的问答机器人,用的是常见的Embedding+向量库方案。目前遇到一个很现实的问题:我尝试了按256、512、1024字符切分文本,但检索出来的结果差异很大——有时候明明答案在文档里,却因为被切碎导致语义不完整;有时候切太大了,又把无关内容混进来,检索分数虚高。我知道要参考embedding模型的max_tokens,但具体怎么跟实际业务结合?比如技术文档和闲聊类文本的切分策略是不是应该不一样?有没有大佬分享下你们在生产环境里调chunk size的经验,或者有什么评估检索效果的工具?谢谢!