最近在做一个用GPT-4批量生成产品摘要的小工具,按照网上教程写了套“角色+任务+格式+示例”的模板,一开始效果惊艳,后来换了个数据集,输出质量直线下降,经常出现格式错乱、漏掉关键字段。我试过调温度、加few-shot,甚至照搬了某大佬的完整prompt,但换个场景就失灵。现在很困惑:Prompt工程的核心到底是靠“技巧”还是靠“对模型的直觉”?还是说本质上就是玄学,得靠大量试错?有没有什么方法论能系统性地诊断prompt的问题,而不是每次都在瞎调?求过来人指点。