Prompt Engineering调优实录:基于GPT-4o的电商评论情感分类Token开销与精度权衡
在电商评论情感分类任务中,我基于OpenAI GPT-4o(0613版本)设计了5组不同复杂度的Prompt,从零样本到带示例的思维链,对比了准确率、F1值、Token消耗与延迟。实验发现:一个包含3个示例和结构化输出约束的Prompt(约420 tokens)比零样本Prompt(约85 tokens)准确率提升12.3%,但成本增加4.9倍。通过动态示例筛选,最终在保持91.2%准确率的同时,
