最近在搭一个本地知识库问答,用的Qwen2.5-7B加bge-m3做embedding,faiss存向量。现在卡在chunk大小上,试了512和256,512召回感觉更全但噪音多,256精准点但经常漏关键内容。而且发现中文长文本切分后语义容易断,比如一段讲“合同违约责任”的,切完一半讲甲方一半讲乙方。想问下各位,有没有比较实用的切分策略?还是说必须上重排序模型才能解决?顺便问下,bge-reranker-base这种重排序对本地部署的压力大不大?