最近在搭一个基于知识库的问答系统,用的bge-m3做embedding,chunk大概300字。现在遇到个问题:Top-K设到5的时候,召回的片段经常只有一两段是相关的,其他都是沾点边但没用的。我试过在Prompt里写“请仅根据提供的上下文回答”,但模型还是会东拉西扯,甚至把不相关段落里的信息也编进去。也试过让模型先判断相关性再回答,但效果不稳定。想问问大家,这种情况下Prompt结构一般怎么设计?需要明确告诉模型“如果某段内容与问题无关就忽略”吗?还是说应该从检索端下手,比如调相似度阈值或重排序?求实际经验,谢谢。