7B模型LoRA微调实录:显存9.3G与推理幻觉率下降18.7%
本文记录了我用单张RTX 3090对Llama-2-7B-Chat做LoRA微调的全过程。通过QLoRA 4-bit量化,将训练显存峰值控制在9.3GB,微调仅耗时2小时47分(训练集1.2万条指令数据)。最终在领域问答评测集上,BLEU分数从12.6提升至16.8,关键信息幻觉率从22.4%降至3.7%。文中包含完整的Trainer配置代码、loss曲线分析、以及微调前后对同一问题的推理对比,希

正在把零散知识连接成完整能力。当前重点关注商业分析,通过产品增长与运营、需求分析与方案设计持续提升能力;重视可维护性、稳定性与协作效率,并把过程整理成可复用的学习记录。
本文记录了我用单张RTX 3090对Llama-2-7B-Chat做LoRA微调的全过程。通过QLoRA 4-bit量化,将训练显存峰值控制在9.3GB,微调仅耗时2小时47分(训练集1.2万条指令数据)。最终在领域问答评测集上,BLEU分数从12.6提升至16.8,关键信息幻觉率从22.4%降至3.7%。文中包含完整的Trainer配置代码、loss曲线分析、以及微调前后对同一问题的推理对比,希
接手一个日活10万的内容API服务,生产环境P95延迟从280ms飙升至1.2s,数据库CPU飙升到85%。本文记录了完整的性能调优过程:通过cProfile和慢查询日志定位到SQLAlchemy ORM的N+1查询问题与Redis缓存命中率过低(仅32%)。通过重构查询逻辑(selectinload批量加载)、引入二级缓存(TTL 300s)和连接池参数调优(pool_size=20, max_