7B模型LoRA/QLoRA微调全记录:显存占用降80%与推理质量对比
本文记录了一次完整的7B(ChatGLM2-6B)指令微调实践,对比了全参微调、LoRA与QLoRA三条路线。在单张24GB显存的RTX 3090上,QLoRA(4-bit NormalFloat + 双LoRA适配器)成功将训练显存峰值从全参微调的54GB压至11.2GB,训练速度仅下降约35%。通过自建的5000条领域问答数据集微调后,模型在领域测试集上的ROUGE-L从0.21提升至0.38

一名专注于软件开发的程序员。日常记录问题排查与调试、开发效率提升和项目中的问题解决过程;重视可维护性、稳定性与协作效率,也会分享值得长期使用的工具与工作方法。
本文记录了一次完整的7B(ChatGLM2-6B)指令微调实践,对比了全参微调、LoRA与QLoRA三条路线。在单张24GB显存的RTX 3090上,QLoRA(4-bit NormalFloat + 双LoRA适配器)成功将训练显存峰值从全参微调的54GB压至11.2GB,训练速度仅下降约35%。通过自建的5000条领域问答数据集微调后,模型在领域测试集上的ROUGE-L从0.21提升至0.38
线上业务突然大面积超时,排查发现Docker容器内存持续飙升触发OOM Kill。本文详细记录了从监控告警、容器资源分析到定位内存泄漏源头(Java堆外内存+Log4j2异步日志)的全过程,并给出了具体优化方案和配置示例,帮你避开同一个坑。
本文从零开始拆解Transformer的核心——注意力机制与多头实现。结合公式推导、伪代码和PyTorch片段,帮你彻底搞懂QKV的计算逻辑、缩放点积的本质以及多头拼接的完整流程。适合有一定深度学习基础、想要深入理解NLP基石模型的读者。