最近在做一些逻辑推理类的任务,看很多文章说Chain-of-Thought能显著提升复杂问题求解能力。但我在实际测试中遇到一个诡异现象:让GPT-4直接算一道包含多步运算的应用题,答案是对的;一旦我在prompt里加上“请一步一步思考”或者给出示例的推理格式,模型反而会在中间步骤里绕进去,甚至算错。我试过不同的触发词(Let‘s think step by step、逐步分析),也调整过temperature,结果都不太稳定。想请教下各位,CoT是不是对任务类型有特定要求?还是我的prompt结构有问题?比如是否需要把推理框架先定义得更严格一点?希望有经验的朋友指点下,谢谢。