最近在做一个文档问答的小项目,用的LangChain加FAISS,文档是几十份PDF技术手册。我按固定chunk_size=500,overlap=50来切分,embedding用的bge-large-zh。问题是检索回来的top5片段经常答非所问,比如问“如何配置GPU环境”,结果返回的是安装CUDA的步骤,感觉相关但不精准。也试过调top_k,改成3之后效果更差。我想知道这种“相关但不精准”是分块太碎导致语义断裂,还是embedding模型对长句理解不够?或者是不是该先做一下query改写?有没有做过类似项目的朋友给点调优思路,感谢!