Prompt工程调优实录:从42%到87%准确率的三轮迭代实验
在实体关系抽取任务中,我通过三轮Prompt工程迭代,将F1分数从0.42提升至0.87,token消耗降低31%。本文记录了从零样本、少样本到结构化输出的完整实验过程,包含12组对比数据、3个关键代码片段和2个致命坑点。使用GPT-4-turbo-0125-preview,温度0.3,输出限制512 tokens。如果你正在为业务设计稳定的推理链路,这篇文章能帮你少走至少两周弯路。

关注产品增长,长期记录项目推进与复盘、业务流程拆解和从需求到交付的完整过程。喜欢从问题、方案到复盘形成完整闭环,希望用清晰的方法帮助产品与业务更高效地落地。
在实体关系抽取任务中,我通过三轮Prompt工程迭代,将F1分数从0.42提升至0.87,token消耗降低31%。本文记录了从零样本、少样本到结构化输出的完整实验过程,包含12组对比数据、3个关键代码片段和2个致命坑点。使用GPT-4-turbo-0125-preview,温度0.3,输出限制512 tokens。如果你正在为业务设计稳定的推理链路,这篇文章能帮你少走至少两周弯路。
一个内部报表接口因串行调用3个下游HTTP服务,P95延迟高达680ms,高峰期线程池被打满。本文记录用asyncio+httpx将其重构为并发调用的全过程:含before/after代码对比、信号量限流、超时重试、连接池复用等细节。实测在50并发压力下,平均响应从680ms降到120ms,P99从1.2s降至300ms,CPU占用反而下降15%。文中附完整可运行代码和wrk压测数据,希望能给同样