7B模型LoRA微调显存压至16G:Qwen2.5指令遵循提升42%
用一张RTX 4090对Qwen2.5-7B-Instruct做LoRA微调,处理一个客服意图识别+槽位填充的混合任务。经过96小时训练(batch size 128,学习率2e-4),在500条测试集上意图准确率从78.3%提升到91.2%,槽位F1从0.71提升到0.88。同时尝试了QLoRA(4bit NF4量化),训练显存从24G降到14.5G,推理速度仅下降12%。本文记录完整的数据准备

Coder,长期记录真实项目中的技术选择,技术方向以云计算、软件工程为主。持续整理安全与备份策略、日志与监控排障和可复用的工程方法;更关注能够真正落地的方法。