最近在做公司内部的知识库问答,用的RAG方案。现在卡在选型上,有点迷茫。我们文档主要是产品手册和售后记录,中文为主,量大概几万篇。试了BGE-M3和OpenAI的text-embedding-3-large,但感觉检索出来的top k结果总是不太对味,有时候明明语义相近的句子,排序却靠后。LLM这边在纠结用ChatGLM3还是Qwen,公司要求私有化部署,所以还得考虑显存占用。有没有大佬说说,Embedding模型和生成模型是不是有某种“默契度”?还是说只要各自够强,拼起来就行?另外,chunk大小和重叠率一般怎么调?我现在是512/50,但感觉长文档有点丢信息。先谢过各位了。