FastAPI接口从2300ms到180ms:Profiling与缓存优化全记录
一个简单的列表接口,压测P95延迟2300ms,QPS仅380。通过cProfile定位到N+1查询和JSON序列化两大瓶颈,配合SQLAlchemy 2.0的selectinload优化数据库访问,再用Redis Cluster缓存热点数据,最终P95降至180ms,QPS提升到4200。本文记录完整的调优过程,包含flask-profiler与FastAPI中间件的具体配置,以及一次诡异的连接

不过度追求速成,更相信稳定进步。当前重点关注设计与体验,通过界面设计方法、设计系统建设持续提升能力;重视可维护性、稳定性与协作效率,并把过程整理成可复用的学习记录。
一个简单的列表接口,压测P95延迟2300ms,QPS仅380。通过cProfile定位到N+1查询和JSON序列化两大瓶颈,配合SQLAlchemy 2.0的selectinload优化数据库访问,再用Redis Cluster缓存热点数据,最终P95降至180ms,QPS提升到4200。本文记录完整的调优过程,包含flask-profiler与FastAPI中间件的具体配置,以及一次诡异的连接
微调7B模型显存不够?本文记录使用QLoRA在单张24G RTX 3090上微调Qwen2-7B-Instruct的全过程。通过4bit NormalFloat量化、双LoRA适配器(rank=64, alpha=128)和paged_adamw_8bit优化器,将峰值显存控制在18.7GB。在自建的8000条客服指令数据上训练3个epoch,loss从1.42降至0.82。推理对比显示,微调后模