最近在做一个内部工具,用GPT-4帮忙生成一些正则表达式和SQL,发现同样一个问题,换个说法效果天差地别。有时候给足上下文和例子,它一次就写对;有时候我明明把需求写得很详细了,它还是给我返回一个“看起来合理但跑不起来”的答案,得来回调好几轮。网上看了不少教程,什么角色扮演、思维链、few-shot,都试了,但感觉更多是碰运气。想问下各位,有没有一套比较系统的调试方法,比如怎么判断是模型问题还是我的指令问题?或者说,有没有什么可量化的指标,能帮助我评估当前提示词的质量?