7B模型LoRA微调实录:显存8G也能跑,效果直追全量微调
上周接到一个任务,要把一个7B模型在垂直领域(法律问答)上做微调。手头只有一张RTX 4090,24G显存,但全量微调7B模型至少需要80G以上显存。试了LoRA和QLoRA两种方案,最终用QLoRA在18G显存下跑完3个epoch,法律问答准确率从基线54.7%提升到82.3%,训练时间比全量微调缩短了70%。本文记录了从数据准备、训练配置到推理效果对比的完整过程,包括踩过的坑和最终的调优方案。

靠咖啡和好奇心维持运行的技术生物。关注技术学习与项目实践,主要分享踩坑过程复盘、持续成长和日常踩坑;关注技术选择背后的成本与边界。持续更新,尽量让每一篇内容都有实际价值。