最近在做一个客服Agent,用GPT-4o。一开始想着把各种对话场景都塞进System Prompt里,光示例对话就写了20多个,结果发现模型在简单问题上反而犹豫不决,甚至开始套用那些示例里的错误回复。去掉一半示例后,准确率反倒上去了。想请教一下大佬们,Prompt里示例的数量和分布有没有什么经验法则?是不是示例太多会把模型“框死”,导致它不再依赖自己的推理能力?还是说我那些示例本身质量有问题,比如场景太具体、不够多样?现在有点懵,求指点。
最近在做一个客服Agent,用GPT-4o。一开始想着把各种对话场景都塞进System Prompt里,光示例对话就写了20多个,结果发现模型在简单问题上反而犹豫不决,甚至开始套用那些示例里的错误回复。去掉一半示例后,准确率反倒上去了。想请教一下大佬们,Prompt里示例的数量和分布有没有什么经验法则?是不是示例太多会把模型“框死”,导致它不再依赖自己的推理能力?还是说我那些示例本身质量有问题,比如场景太具体、不够多样?现在有点懵,求指点。
我踩过一模一样的坑,后来发现关键是示例太“齐”了,模型会把它当成模板去套,而不是当参考。尤其客服场景,20多个示例基本把意图空间堵死了,遇到没见过的问法它反而不敢自己判断。我现在的做法是只留3-5个覆盖不同意图类型的,剩下的靠指令描述边界,效果稳定很多。你那批示例可能不是质量问题,而是同质化太严重,模型学到的全是“照着念”。