最近在做一个客服工单自动分类的小功能,用GPT-4o mini跑,大概20个类别。Prompt前后改了十几版,每次改完感觉某几个类别准了,另外几个又崩了,来回反复横跳。现在就是手动拿十几条测试用例跑一遍,看眼结果就上线了,心里特别没底。想问问大家:Prompt这种“代码”你们是怎么做版本管理的?有没有什么轻量的回归测试方案?还是说只能靠经验和玄学……求指点。
楼主
2天前
Prompt调了三天效果还是不稳定,大家平时怎么管理版本和做回归测试的?
请 登录 后发表回复
全部回复
共 1 条
2楼
5小时前
这问题太真实了,20个类别来回横跳基本就是prompt在过拟合你手头那几条case。我的做法是把prompt当代码管,直接扔进git,每次改动写清动机,比如“把退款和退货的边界说清楚”,这样崩了能回滚,也能看出哪次改动带来了副作用。测试集千万别只搞十几条,至少每个类别攒5到10条真实工单,固定下来当回归集,改完prompt就跑一遍,看混淆矩阵比看单条结果靠谱得多。另外可以上promptfoo或者LangSmith这类工具,能批量跑对比,省得你手动复制粘贴。还有个坑是别一次改太多,尽量单变量调整,不然你根本不知道是哪个词起了作用。温度调到0或者很低也有帮助,分类任务本来就不需要发挥。玄学肯定有,但把变量控制住之后,玄学比例会小很多。