7B模型LoRA/QLoRA微调实录:显存从24G降到6G的细节与踩坑
微调7B模型,全参微调需要4张A100,而LoRA只需1张24G消费卡,QLoRA更是把门槛拉到6G。本文用细粒度情感分类任务,完整走通数据准备、LoRA/QLoRA训练配置、loss曲线分析、推理效果对比全流程。你会看到QLoRA在显存占用降低70%的同时,F1只掉了0.8个点,而推理速度几乎无损。文中所有代码和配置均基于transformers 4.38.2、PEFT 0.10.0、bitsa

一名专注于云原生与容器技术的基础设施工程师。日常记录系统稳定性治理、故障复盘和项目中的问题解决过程;更关注能够真正落地的方法,也会分享技术原理、工程细节和落地经验。