最近在做一个小项目,用GPT-4处理用户反馈的分类和摘要。我在Prompt里写了角色设定、输出格式、示例,还试了few-shot,但效果就是不稳定。同一批输入,有时候分类很准,有时候会漏掉某些字段,甚至偶尔输出JSON格式还会出错。温度调到0也不行。我看网上说要用CoT、要拆步骤,我也试了,但感觉就是碰运气。想问问大家,平时优化Prompt到底有没有一套可复用的方法论?还是说只能靠经验和感觉一点点试?另外,有没有什么工具能帮忙评估不同Prompt版本的效果差异?