最近在做一个客服Agent,用GPT-4o。一开始想着把各种对话场景都塞进System Prompt里,光示例对话就写了20多个,结果发现模型在简单问题上反而犹豫不决,甚至开始套用那些示例里的错误回复。去掉一半示例后,准确率反倒上去了。想请教一下大佬们,Prompt里示例的数量和分布有没有什么经验法则?是不是示例太多会把模型“框死”,导致它不再依赖自己的推理能力?还是说我那些示例本身质量有问题,比如场景太具体、不够多样?现在有点懵,求指点。