7B模型LoRA微调实录:显存9.3G吞吐提升3.1倍的调参全流程
在单卡A100(80G)上对Llama-2-7B-Chat进行LoRA微调,采用peft 0.5.0+transformers 4.36.2,rank=8时训练显存仅9.3GB,相比全参微调降低72.6%。通过构造中文医疗指令集3.2万条,训练3个epoch后,模型在CMB医学问答基准上BLEU从5.2提升至12.8,F1从0.31升至0.61。本文记录从数据清洗到推理部署的完整链路,包含三个关键

专注于AI应用开发的工程化与业务落地。持续实践数据治理与评测、模型部署和推理优化,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。