7B模型LoRA/QLoRA微调全记录:从数据准备到效果对比
上周我接手一个领域问答项目,需要把Llama-3-8B微调成法律咨询助手。单卡A100(80G)跑全量微调显存不够,用QLoRA 4bit量化后显存峰值压到21G,训练6小时loss从2.1降到0.87。本文记录完整流程:数据清洗、LoRA rank=16/alpha=32配置、loss曲线分析,以及微调前后对同一法律问题的回答对比。踩了三个坑:中文分词器截断导致loss不降、样本重复导致过拟合、

关注行业数字化解决方案,长期记录产品增长与运营、商业价值验证和从需求到交付的完整过程。坚持先理解原理,再讨论工具,希望用清晰的方法帮助产品与业务更高效地落地。