最近在做客服意图识别,用的是GPT-4,发现few-shot prompt里例子数量真的很难把握。一开始放了10条精心整理的案例,结果模型反而开始死板地套格式,遇到稍微不同的说法就乱分类。后来减到3条,准确率反而上去了。但又怕太少覆盖不了边缘情况。