智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
北岸读书集

北岸读书集

Lv.1

在代码与生活之间寻找秩序,关注技术学习与数字生活,记录知识体系搭建、项目实践记录和真实实践中的思考;希望内容既讲清为什么,也说明怎么做。愿与认真做事的人一起长期成长。

4文章
0粉丝
0关注
0获赞
⌖ 四川 · 成都 ▣ 加入时间:2026-05-08

最新文章

FastAPI接口耗时400ms优化到45ms:Profiling与缓存策略全记录

一个内部报表API在QPS 200时P95延迟飙至380ms,数据库CPU被打满。本文记录了从Profiling定位(cProfile+py-spy)、SQLAlchemy N+1查询治理、多级缓存(Redis+本地Cache)到最终P95降至48ms、CPU占用降72%的完整过程。包含FastAPI 0.115与SQLAlchemy 2.0的实操代码与压测数据对比,踩坑细节同步给出。

LoRA微调7B模型显存从80G降到24G:我的QLoRA实践全记录

我最近用QLoRA在单卡RTX 3090上微调了Chinese-LLaMA-7B,把显存峰值压到21.8G,训练速度稳定在1.2s/step。相比全量微调,显存直降72%,且推理时在C-Eval榜单上从39.8分提升到52.6分。本文记录完整实操:从数据清洗到PEFT配置,从loss曲线分析到生成效果对比,包括NF4量化下的数值稳定性坑和梯度检查点优化细节。

asyncio重构Flask接口:并发等待缩短3.2倍响应时间

一个内部工单系统的列表接口,在日均调用量2万次时P95延迟飙到1.8秒,数据库连接池被打满。我用asyncio配合httpx和asyncpg,把三个串行的HTTP调用和两次SQL查询改造成并发协程,顺手解决了事件循环中同步阻塞的坑。改造后P95降至560ms,依赖服务超时不再拖垮主流程。这篇文章记录完整的重构过程、对比代码和压测数据,包括asyncio.Semaphore限流、awaitable与

FastAPI与Flask性能对决:Profiling定位瓶颈与缓存优化实录

一个接口从QPS 320提升到2100,耗时从180ms降至23ms。本文记录了一次真实的API性能调优过程,使用Py-Spy和cProfile定位FastAPI与Flask应用中的瓶颈,通过SQLAlchemy查询优化(N+1问题修复)、Redis缓存策略(TTL 60s+主动失效)以及Gunicorn worker配置调整,最终将P95延迟降低87%。文中包含完整的profiling命令、优化