7B模型LoRA/QLoRA微调实战:显存从24G降到6G的调优记录
本文记录了一次完整的7B模型(ChatGLM2-6B)微调实践,对比了LoRA与QLoRA两种参数高效微调方案。在单张RTX 3090(24G显存)环境下,LoRA方案batch_size=8可正常训练,而QLoRA(4-bit NF4量化)将显存占用从21.3G降至6.1G,同时保持95%以上的性能。文章详细拆解了数据准备、PEFT配置、训练曲线分析及推理效果对比,并给出了实际踩坑后的优化建议,

擅长把“问题不大”处理成真正没问题。主要研究软件工程与问题排查,记录代码实现与工程实践、代码可维护性以及那些看似简单却很容易踩坑的问题。慢慢写,长期做,把有用的内容沉淀下来。
本文记录了一次完整的7B模型(ChatGLM2-6B)微调实践,对比了LoRA与QLoRA两种参数高效微调方案。在单张RTX 3090(24G显存)环境下,LoRA方案batch_size=8可正常训练,而QLoRA(4-bit NF4量化)将显存占用从21.3G降至6.1G,同时保持95%以上的性能。文章详细拆解了数据准备、PEFT配置、训练曲线分析及推理效果对比,并给出了实际踩坑后的优化建议,
本文从检索增强生成(RAG)的核心痛点出发,梳理了RAG的技术演进路线,包括Naive RAG、Advanced RAG与Modular RAG三阶段。结合LangChain框架,给出了一个完整的文档问答系统搭建案例,并讨论了chunk策略、检索优化等关键细节,适合想深入理解RAG落地实践的开发者。
微服务架构下,Spring Cloud与Service Mesh(以Istio为例)是两大主流选择。本文从开发效率、运维成本、性能、技术栈兼容性等维度,结合一个真实电商项目的重构案例,帮你理清选型思路,避免“技术内卷”。
厌倦了手写复杂SQL?本文精选5个GitHub上高星开源工具,覆盖可视化查询、自然语言转SQL、AI辅助调优等场景。每个工具都有实测案例和核心代码片段,帮你从繁琐的数据检索中解脱出来,适合后端、数据分析师和数据工程师收藏。