最近在做一个用GPT-4做客服意图识别的项目,一开始直接零样本效果还行,但老板要求把“退货”和“退款”这种细粒度意图分清楚。我试着加few-shot,找了20个真实对话样本塞进prompt里,结果准确率反而降了5个点。后来参考网上说的“按逻辑排序+标签说明”,把例子改成5个,每个都有详细解释,还是不稳定。最困惑的是,同一个prompt上午跑和下午跑结果都不一样。想问下各位,few-shot是不是应该把例子放在system里而不是user里?另外温度参数调整对这种分类任务影响大吗?我看有的教程说设0.2,有的说直接0,搞得很迷茫。