Prompt工程化调优实录:实体抽取任务的Token成本与输出质量权衡
在Llama-3-8B-Instruct-4bit上对司法文书实体抽取任务做了12组Prompt对比实验。零样本模板F1仅62.3%,通过角色约束+输出JSON Schema+少样本示例,F1提升至84.7%,但Token消耗从每案412增至1893。最终用动态示例选择策略,将F1稳定在83.1%,Token压缩至772。本文记录了完整的调优路径、踩坑点(如JSON解析失败率从31%降至2.7%)

关注产品增长,长期记录需求分析与方案设计、商业价值验证和从需求到交付的完整过程。不追求堆砌概念,只记录验证过的经验,希望用清晰的方法帮助产品与业务更高效地落地。
在Llama-3-8B-Instruct-4bit上对司法文书实体抽取任务做了12组Prompt对比实验。零样本模板F1仅62.3%,通过角色约束+输出JSON Schema+少样本示例,F1提升至84.7%,但Token消耗从每案412增至1893。最终用动态示例选择策略,将F1稳定在83.1%,Token压缩至772。本文记录了完整的调优路径、踩坑点(如JSON解析失败率从31%降至2.7%)
用单卡A100 80G对Llama-3-8B做QLoRA微调,踩遍了显存溢出、loss不收敛、过拟合三大坑。本文记录完整流程:4-bit NF4量化配置、128条医疗问答数据训练3个epoch,最终在自有测试集上BLEU从12.6提升到28.4,指令遵循准确率从31%到79%。附完整代码、loss曲线分析、以及一个让eval_loss骤降的trick——冻结embedding层。