智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
全部 AI AI开发实战 FastAPI/Flask LangChain/AutoGPT LoRA/QLoRA Milvus/Qdrant React/Vue asyncio 学习笔记 容器化部署 开发实战 开源推荐 技术博客 技术选型 提示词工程 检索增强生成 版本控制 踩坑记录
Prompt Engineering实测:同一商品摘要任务下6版Prompt的Token消耗与输出质量对比

Prompt Engineering实测:同一商品摘要任务下6版Prompt的Token消耗与输出质量对比

我用同一批200条电商评论,在GPT-4o mini和Qwen2.5-7B-Instruct上对比了6版Prompt,从零样本到Few-shot再到结构化约束。结果最“省Token”的版本反而质量最差,而一个加了JSON Schema和2个示例的中等长度Prompt,在准确率上比基线提升23%,单条Token成本只增加18%。这篇文章把全部Prompt、代码、踩坑和性能数据摊开讲清楚。

小许_ReactLab 6 0 0 1天前
我用6版Prompt把合同要素抽取准确率从71%做到94%:Token消耗与输出质量对比

我用6版Prompt把合同要素抽取准确率从71%做到94%:Token消耗与输出质量对比

同一个合同要素抽取任务,我写了6版Prompt,从“直接提问”到“角色+少样本+JSON Schema约束+自检”,在GPT-4o-mini(2024-07-18)上把字段准确率从71.3%提升到94.1%,但单次Token从312涨到1287,成本翻了4倍。本文给出每版Prompt的原文、可运行代码、踩坑记录和完整对比数据,帮你判断什么任务值得上复杂Prompt。

持续研究设计方法手册 20 1 0 5天前
我用7组Prompt对比测试商品评论情感分类:Token消耗差3.2倍,F1最高仅提升11%

我用7组Prompt对比测试商品评论情感分类:Token消耗差3.2倍,F1最高仅提升11%

为了验证Prompt Engineering在真实任务中的收益,我以电商商品评论三分类(正向/中性/负向)为例,在GPT-4o-mini与Qwen2.5-7B-Instruct上对比了7组Prompt方案,记录了准确率、F1、平均Token消耗与响应延迟。结果发现:加入Few-shot示例后F1从0.71提升到0.82,但Token消耗翻了3.2倍;过度堆砌角色设定反而让准确率下降4.6%。本文给

长期主义安全学习者 16 0 0 5天前
从78%到96%准确率:电商评论情感分类的Prompt Engineering实验对比与Token成本分析

从78%到96%准确率:电商评论情感分类的Prompt Engineering实验对比与Token成本分析

本文以电商评论三分类情感任务为例,系统对比了Zero-shot、Few-shot、Chain-of-Thought、结构化输出约束四种Prompt策略。在GPT-4o-mini(2024-07版)上,准确率从78.3%提升至96.1%,单次调用Token从42降至31,月成本从$18.7降至$4.2。文中包含完整可运行代码、温度参数调优、JSON模式踩坑记录,以及一份可直接复用的Prompt模板。

长期关注战略工具箱 16 0 0 6天前
Prompt Engineering 实测:同一分类任务 6 版提示词的 Token 消耗与准确率对比

Prompt Engineering 实测:同一分类任务 6 版提示词的 Token 消耗与准确率对比

我用 200 条真实工单数据,对同一个文本分类任务写了 6 个版本的 Prompt,从最朴素的“请分类”到带 Few-shot + 结构化输出 + 思维链的版本,在 gpt-4o-mini(2024-07-18)上做了完整对比。结果很有意思:准确率从 71.5% 提升到 94.5%,但单条 Token 从 58 涨到 412,成本翻了 7 倍。更关键的是,第 4 版和第 6 版准确率只差 1.5%

一只安全研究员手记 14 1 0 6天前
Prompt Engineering实测:同一任务5种提示词设计,Token消耗从1800降到420,输出质量反而更高

Prompt Engineering实测:同一任务5种提示词设计,Token消耗从1800降到420,输出质量反而更高

我用同一个商品评论结构化抽取任务,对比了5种不同Prompt设计在GPT-4o-mini和Qwen2.5-7B-Instruct上的表现。结果很反直觉:最啰嗦的“详细说明+多示例”Prompt单次消耗1800+ token,F1只有0.82;而精简后的结构化Prompt只花420 token,F1反而达到0.94。这篇文章完整记录了实验设计、代码实现、踩坑过程和最终数据,帮你搞清楚Prompt E

依赖等待重构的开发者 14 0 0 6天前
我用GPT-4o做合同信息抽取:6版Prompt对比,Token消耗降了58%

我用GPT-4o做合同信息抽取:6版Prompt对比,Token消耗降了58%

同一个合同字段抽取任务,我写了6版Prompt,从“裸问”到Few-shot+JSON Schema约束,准确率从61%提升到94%,单次Token消耗从1830降到768。本文完整记录了每版Prompt的设计思路、实测数据(含GPT-4o-2024-08-06与Claude 3.5 Sonnet对比)和踩坑过程,附可直接运行的Python代码。

一只金鱼每天复盘日记 19 1 0 6天前
我用Claude 3.5 Sonnet做结构化抽取:6版Prompt对比,Token从1200降到380,准确率反升12%

我用Claude 3.5 Sonnet做结构化抽取:6版Prompt对比,Token从1200降到380,准确率反升12%

最近在做一个合同关键信息抽取服务,需要从非结构化文本里稳定拿到甲乙方、金额、签署日期等8个字段。最初一版Prompt单次消耗约1200 tokens,字段准确率只有78%,且金额经常带出多余单位。我围绕同一批200条测试样本,迭代了6版Prompt,把输入从1200 tokens压到380 tokens,准确率提到90.3%,单条成本下降约68%。这篇文章完整记录了每版Prompt的设计思路、Cl

萤火虫会调Bug 21 1 0 7天前
我用 7 版 Prompt 把合同抽取准确率从 71% 提到 94%,Token 反而降了 38%

我用 7 版 Prompt 把合同抽取准确率从 71% 提到 94%,Token 反而降了 38%

同一个信息抽取任务,我拿 GPT-4o-mini 跑了 7 版 Prompt,从“直接问”到 few-shot、CoT、JSON Schema 约束、分步抽取,逐版对比准确率、输出稳定性和 token 消耗。最终第 7 版在 200 条测试集上字段准确率 94.2%,平均 token 从 1180 降到 731,单条成本降了约 38%。这篇记录了完整的实验过程、踩过的坑和可复用的模板代码。

长期关注内容实践笔记 15 0 0 8天前
从38%到94%准确率:一次文本分类任务的Prompt Engineering对比实验记录

从38%到94%准确率:一次文本分类任务的Prompt Engineering对比实验记录

本文以电商评论情感分类为具体任务,在同一测试集(500条)上对比了Zero-shot、Few-shot、Chain-of-Thought、角色扮演+结构化输出四种Prompt策略。实验基于GPT-4o-mini(2024-07-18版本),temperature=0,max_tokens=256。结果显示:Zero-shot准确率仅38.2%,Few-shot提升至71.6%,CoT达到83.4%

代码准备提交观察员 13 1 0 8天前
我用3种Prompt把GPT-4o准确率从61%拉到94%:一次结构化信息抽取的Token与质量对比实验

我用3种Prompt把GPT-4o准确率从61%拉到94%:一次结构化信息抽取的Token与质量对比实验

同一个信息抽取任务,我用三种不同粒度的Prompt在GPT-4o上做了对照实验:朴素指令、Few-shot示例、Schema约束+CoT。结果准确率从61.3%提升到94.0%,但平均Token消耗从218涨到742,单次成本翻了3.4倍。这篇文章完整记录了实验设计、可运行代码、踩过的坑,以及我最终如何在质量和成本之间做出取舍。

阿航Design 19 1 0 10天前
我用4版Prompt把JSON抽取准确率从72%拉到96%:一次token与质量对比实验

我用4版Prompt把JSON抽取准确率从72%拉到96%:一次token与质量对比实验

同一个"从电商评论中抽取结构化JSON"的任务,我写了4版Prompt,在gpt-4o-mini(2024-07-18)上各跑200条真实评论。V1直白提问:准确率72%,平均token 312,JSON解析失败率11%。V4引入字段定义、few-shot示例、输出约束和失败重试后:准确率96%,平均token 587,解析失败率降到0.5%。本文完整记录每版Prompt的写法、token账单、踩

大模型构建者 30 3 0 11天前
我用GPT-4o做合同信息抽取:7版Prompt迭代,Token从2100降到680,准确率反升到96%

我用GPT-4o做合同信息抽取:7版Prompt迭代,Token从2100降到680,准确率反升到96%

本文记录了我用GPT-4o从采购合同中抽取结构化字段的Prompt Engineering全过程。从最初的“一句话Prompt”到最终的结构化模板,我迭代了7个版本,输入Token从峰值2137降到684,单次成本下降约68%,字段抽取准确率却从78%提升到96%。文章包含完整可运行代码、每版Prompt的对比数据、temperature与response_format参数的取舍,以及JSON输出

刚入门的机器学习玩家日常 27 3 0 11天前
我用GPT-4o做合同要素抽取:6版Prompt迭代对比,Token从2100降到680

我用GPT-4o做合同要素抽取:6版Prompt迭代对比,Token从2100降到680

本文以“从采购合同中抽取甲乙方、金额、付款节点、违约条款”这一具体任务为例,记录了6版Prompt的完整迭代过程。测试集为50份真实中文合同,使用GPT-4o(2024-08-06版本)和text-embedding-3-small,温度设为0。结果:初版Prompt平均消耗2100 Token、字段准确率72%;最终版降到680 Token、准确率94%,单份成本从0.021美元降至0.0068

发布别催观察员 34 3 0 11天前
从78分到94分:一次电商评论情感分析Prompt工程优化记录

从78分到94分:一次电商评论情感分析Prompt工程优化记录

同一个情感分类任务,我用4版Prompt在GPT-4o-mini上做了对比实验。V1零样本准确率78.3%,V4加入角色设定、少样本示例和结构化输出后提升到94.1%,但token消耗从180涨到720。本文记录了完整的实验过程、每次迭代的思考、踩过的坑,以及准确率与成本之间的权衡数据,供正在做Prompt优化的同学参考。

深夜机器学习备忘录 29 3 0 11天前
Prompt Engineering实验:同一文本分类任务下6种提示词的Token消耗与输出质量对比

Prompt Engineering实验:同一文本分类任务下6种提示词的Token消耗与输出质量对比

本文用一个真实的中文情感分类任务(1000条外卖评论,3分类),对6种不同Prompt设计做了完整对比实验。模型选用gpt-4o-mini(2024-07-18)与qwen-plus(2024-09-19),温度统一设为0。实验记录了每种Prompt的输入Token、输出Token、准确率、格式合规率和单条成本。结果发现:带Few-shot的Prompt准确率从78.3%提升到91.6%,但Tok

猞猁喜欢开源日记 36 6 0 12天前
我用3轮实验把Prompt从78%优化到96%:提示词工程Token消耗与输出质量对比

我用3轮实验把Prompt从78%优化到96%:提示词工程Token消耗与输出质量对比

同一份商品评论情感分类任务,我写了3版Prompt做对比实验:零样本基线、角色扮演版、Few-shot+格式约束版。在gpt-4o-mini(2024-07-18)上跑200条测试集,准确率从78.5%提升到96.0%,但Token消耗从平均142涨到487,成本翻了3.4倍。本文完整记录了每版Prompt的设计思路、可运行代码、踩坑过程和真实数据,帮你判断什么场景值得为Prompt多花钱。

实战派大模型工具箱 30 4 0 12天前
我用GPT-4o做合同信息抽取:6版Prompt对比,Token从1200降到380,准确率反升到96%

我用GPT-4o做合同信息抽取:6版Prompt对比,Token从1200降到380,准确率反升到96%

本文以“合同关键信息抽取”为具体任务,在GPT-4o(2024-08-06版本)上对比了6版Prompt的设计效果。从最初的“直接提问”到结构化Few-shot + JSON Schema约束,单次调用Token从1200降到380,抽取准确率从72%提升到96%,单条成本下降约68%。文中包含完整可运行代码、参数配置、踩坑记录和实测数据,适合正在做信息抽取、RAG前置处理的开发者参考。

认真做数字化增长记 25 4 0 12天前
从62%到94%准确率:一次客服工单分类任务的Prompt Engineering对比实验与Token成本分析

从62%到94%准确率:一次客服工单分类任务的Prompt Engineering对比实验与Token成本分析

本文以电商客服工单自动分类为具体任务,在GPT-4o-mini(2024-07-18版本)上对比了Zero-shot、Few-shot、角色扮演+结构化输出、Chain-of-Thought四种Prompt方案的分类准确率与Token消耗。实验基于500条真实工单样本,最终CoT+结构化输出方案将准确率从62.4%提升至94.2%,单条平均Token从118升至287,成本增加约0.9元/千条。文

周末智能体进阶录 45 6 0 16天前
我用7组Prompt对比测试,把GPT-4o-mini合同抽取准确率从62%拉到94%

我用7组Prompt对比测试,把GPT-4o-mini合同抽取准确率从62%拉到94%

本文以「从采购合同中抽取甲方、乙方、金额、签署日期」为具体任务,在GPT-4o-mini(2024-07-18版本,temperature=0)上实测7组Prompt。对比了Zero-shot、Few-shot、CoT、JSON Schema约束、角色设定等写法,记录每组token消耗、字段准确率与延迟。最终用「角色+Schema+边界规则+2个Few-shot」把字段准确率从62%提升到94%,

小禾_Java手记 56 9 0 16天前

作者推荐