FastAPI 压测 3 倍性能提升:Profiling 定位与缓存落地实录
上周接手一个基于 FastAPI 的报表服务,线上 P99 延迟从 320ms 飙升至 1.2s,数据库连接池被打满。本文记录完整的调优过程:先用 py-spy 和 cProfile 定位到两个核心瓶颈——N+1 查询与重复计算;再通过 SQLAlchemy 2.0 的 `selectinload` 优化关联加载,结合 Redis 缓存热点数据;最后用 Locust 压测对比,QPS 从 420

专注于深度学习的工程化与业务落地。持续实践智能体工作流设计、数据治理与评测,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
上周接手一个基于 FastAPI 的报表服务,线上 P99 延迟从 320ms 飙升至 1.2s,数据库连接池被打满。本文记录完整的调优过程:先用 py-spy 和 cProfile 定位到两个核心瓶颈——N+1 查询与重复计算;再通过 SQLAlchemy 2.0 的 `selectinload` 优化关联加载,结合 Redis 缓存热点数据;最后用 Locust 压测对比,QPS 从 420
当50个功能分支同时涌向master,代码合并冲突平均耗时47分钟,CI构建排队超过2小时——这是我们团队在2023年遇到的真实困境。本文基于Git 2.39.1和GitLab 15.7,详细拆解了一套适配300人研发团队的Git工作流:从三线分支策略(master/staging/feature)到基于MR的强制Code Review流程,再到与Jenkins 2.387.1的流水线联动。文中提
上周用一张24G的4090微调Qwen2-7B做电商评论情感分类,采用QLoRA方案(4-bit NF4量化+LoRA rank=64)。训练集2.1万条,batch_size=4,梯度累积8步,学习率2e-4,cosine调度。最终在800步时loss降到0.31,验证集F1从基座的0.72提升到0.91。本文记录完整流程,包括bitsandbytes配置、PEFT参数选择、训练中遇到的loss