最近在做一个知识库问答的RAG项目,用的是GPT-4o。系统提示词已经写了三版,从“你是助手”改到“严格依据上下文回答”,再到加上“如果资料中没有请明确说不知道”。测试集就30个问题,但每次调完,总有几个刁钻问题答得牛头不对马嘴——要么漏细节,要么自己脑补。我试过把few-shot示例从3个加到8个,结果有些问题反而更啰嗦了。想问问有实战经验的朋友,你们是怎么系统性判断瓶颈在检索还是在prompt的?有没有什么比较科学的debug流程?我现在就是瞎试,改一句测一遍,快崩了。