最近在做一个任务型Agent,用GPT-4做规划+工具调用。系统Prompt改了快三十版了,加了CoT、few-shot示例、输出格式约束,但效果还是忽好忽坏。同一个输入,有时候能正确拆解步骤调用API,有时候直接跳过推理环节胡编参数。温度已经调到0.2了,示例也覆盖了主要场景,但就是不稳定。想问问大家在实际Agent项目里,Prompt工程有什么系统性的方法论吗?还是说这玩意儿真的只能靠玄学和反复试?
最近在做一个任务型Agent,用GPT-4做规划+工具调用。系统Prompt改了快三十版了,加了CoT、few-shot示例、输出格式约束,但效果还是忽好忽坏。同一个输入,有时候能正确拆解步骤调用API,有时候直接跳过推理环节胡编参数。温度已经调到0.2了,示例也覆盖了主要场景,但就是不稳定。想问问大家在实际Agent项目里,Prompt工程有什么系统性的方法论吗?还是说这玩意儿真的只能靠玄学和反复试?
暂无回复,快来抢沙发吧