最近在搭一个本地知识库问答,用的bge-m3做embedding,模型是qwen2.5-7b。我按网上的教程试了256、512、1024三种chunk_size,重叠设了50和100,结果检索出来的top5文档经常答非所问。比如问“报销流程”,它给我返回一堆关于发票真伪的段落。我用的是faiss做向量检索,也试过mmr重排,但效果还是飘。是不是chunk切分策略跟文档结构关系很大?我的文档是PDF转的文本,有些表格被切得稀碎。想问问各位实际项目里都是怎么定chunk的,有没有什么经验法则,还是说纯粹靠试?另外,用bge-m3的话,是不是中文场景下query和document的指令前缀必须要加?我直接裸embedding会差很多吗?