Prompt Engineering调优实录:从38%到91%准确率的NER任务迭代
本文记录了一次针对中文命名实体识别(NER)任务的Prompt工程完整实验。通过设计5种不同结构的Prompt模板,在GPT-3.5-turbo(gpt-3.5-turbo-0613)上进行了总计120次API调用,对比了零样本、少样本、思维链(CoT)及角色扮演等策略。实验数据显示,采用“角色定义+格式约束+两步推理”的混合Prompt,将F1值从基线0.38提升至0.91,同时将单次token

Open-sourceenthusiast,关注工具与工程实践,主要关注软件开发,分享性能优化、开源工具使用及真实项目复盘;更关注能够真正落地的方法。记录不一定完美,但力求真实、清楚、可验证。