最近在搭一个基于Llama 3的本地知识库问答系统,主要是看论文和文档。用的是Chroma做向量存储,但发现检索出来的结果经常跟问题对不上。比如我按512个字符切chunk,然后用all-MiniLM-L6-v2做embedding,感觉长文档里的关键信息会被稀释掉。换过更小的chunk(256),召回是高了,但上下文碎片化,模型理解起来反而更吃力。