最近在用LangChain搭一个简单的RAG问答系统,处理的是公司内部的几十份技术文档。刚把基本流程跑通,但chunk size这个参数快把我整不会了。试了512、1024、2048,结果有的问句能答对,换一个类似的问题就答非所问。感觉不是简单的越大越好或越小越好,好像还得看文档结构?比如表格和代码块拆错了就很灾难。想问下社区的前辈们,大家在实际项目中是怎么确定chunk大小和重叠(overlap)的?有没有什么经验法则,或者需要先分析文档类型再决定?另外,chunk策略和embedding模型的选择有关系吗?在线等,挺急的。