最近在调一个数学应用题生成的模型(GPT-4和Claude都试了),发现一个奇怪现象:用简单的“直接回答”提示,模型偶尔能蒙对答案;但加上“请一步步思考”(CoT)之后,在需要多步计算的题目上准确率反而下降,甚至出现逻辑断裂,比如中间步骤自相矛盾。