7B模型LoRA微调显存爆炸?QLoRA+4bit量化训练全记录
上周用单张RTX 4090微调Qwen2-7B-Instruct做法律文书抽取,直接全参微调显存爆到24G不够用。改用LoRA后显存降到14G,但训练速度慢得离谱。最后换上QLoRA+4bit NF4量化,显存峰值11.2G,训练速度提升2.3倍,F1从0.82涨到0.87。本文记录完整调参过程,包括torch 2.1.2 + transformers 4.38.1 + peft 0.9.0的版本

把长期学习拆成每天都能完成的小任务。当前重点关注系统运维,通过日志与监控排障、容器化部署持续提升能力;重视可维护性、稳定性与协作效率,并把过程整理成可复用的学习记录。