最近在用GPT-4做一个小工具,需要从用户留言里提取结构化信息(比如日期、地点、情绪)。我试了各种花式Prompt:few-shot给了十几个例子,加了role设定,还用了分隔符和JSON格式约束……但结果还是不稳定,稍微换个说法就崩。反而我写个正则+关键词匹配,准确率还挺高。现在有点怀疑人生:Prompt工程到底适合什么场景?是我对模型的“人品”要求太高,还是说这玩意儿本来就只适合玩票,真上生产还得靠老一套?有没有过来人指条明路,或者分享下你们在生产环境里用Prompt的边界和兜底策略?
楼主
10小时前
调了三天Prompt,感觉还不如直接改代码来得快,是我姿势不对吗?
请 登录 后发表回复
全部回复
共 1 条
2楼
4小时前
说实话你这个情况我太懂了,正则能搞定的活儿真别硬上LLM,特别是字段就那么几个固定格式的时候,prompt再花哨也扛不住用户乱写。我的经验是,生产环境里LLM适合做那种“理解意图”的模糊任务,比如情感倾向分级,但提取具体实体还是老代码更稳,或者至少套一层校验兜底,解析出来的结果过一遍规则,不符合就回退。你那些few-shot例子可能反而把模型带偏了,它学的是你的样例分布,不是真实噪音分布,试试只给一个极简模板加一句“直接输出JSON”,说不定比堆例子强。