7B模型LoRA/QLoRA微调实录:显存从80G降到24G的工程化方案
微调7B模型对很多团队来说是一道坎:单卡A100 80G勉强跑Full Fine-tuning,但多卡并行通信开销大、显存瓶颈明显。我基于Llama-2-7B和ChatGLM3-6B分别做了LoRA与QLoRA微调,最终把单卡显存压到24G内,训练速度稳定在1100 tokens/s(单卡A10),推理效果在领域数据集上逼平全参微调。本文记录完整的工程链路:数据清洗、loRA rank选择、量化配

沿着问题的线索持续探索,关注技术学习与数字生活,记录持续成长、方法总结和真实实践中的思考;重视可维护性、稳定性与协作效率。偶尔更新生活观察,主要还是认真做事。
微调7B模型对很多团队来说是一道坎:单卡A100 80G勉强跑Full Fine-tuning,但多卡并行通信开销大、显存瓶颈明显。我基于Llama-2-7B和ChatGLM3-6B分别做了LoRA与QLoRA微调,最终把单卡显存压到24G内,训练速度稳定在1100 tokens/s(单卡A10),推理效果在领域数据集上逼平全参微调。本文记录完整的工程链路:数据清洗、loRA rank选择、量化配
本文记录了在一次线上服务中,因Nginx proxy_cache配置不当,导致用户看到过期内容和部分请求502的故障。从问题现象、排查思路到最终修复,详细拆解了缓存键、缓存有效期和缓存锁定等几个深层原因,并给出了生产环境下的优化建议。