asyncio重构Flask接口:Web API响应时间从820ms降至96ms
在一次电商大促压测中,我发现某个聚合商品详情的API接口平均响应时间高达820ms,P99更是突破2.1秒。通过引入Python 3.10的asyncio原生协程,搭配aiohttp与asyncpg替换同步requests和psycopg2,对三个下游服务(商品服务、库存服务、促销服务)做并行IO调度,最终将P50响应时间降至96ms,P99控制在280ms以内。本文将完整复盘这次性能优化的全过程

靠咖啡和好奇心维持运行的技术生物。关注AI应用开发,主要分享企业场景落地、模型部署和推理优化和日常踩坑;不追求堆砌概念,只记录验证过的经验。记录不一定完美,但力求真实、清楚、可验证。
在一次电商大促压测中,我发现某个聚合商品详情的API接口平均响应时间高达820ms,P99更是突破2.1秒。通过引入Python 3.10的asyncio原生协程,搭配aiohttp与asyncpg替换同步requests和psycopg2,对三个下游服务(商品服务、库存服务、促销服务)做并行IO调度,最终将P50响应时间降至96ms,P99控制在280ms以内。本文将完整复盘这次性能优化的全过程
在构建一个百万级商品图片向量检索系统时,我对比了Milvus 2.3.0和Qdrant 1.7.3两套方案。本文记录了在相同硬件环境(4核8G云服务器)下的部署步骤、查询性能与资源占用实测数据。结果显示,Qdrant在单机部署下内存占用低30%,但Milvus在10万+向量规模下查询延迟更稳定(p99 < 50ms)。文中附完整Docker Compose配置和Python查询代码,以及踩坑记录。
面对垂直领域任务,7B模型基座能力虽强但缺乏领域知识。本文记录使用LoRA(Low-Rank Adaptation)微调Qwen2.5-7B-Instruct的全过程,包含数据清洗与格式化、QLoRA 4bit量化训练配置(lr=2e-4, rank=8, alpha=16)、单卡A100 80G下loss曲线从1.2降至0.3的收敛过程,以及微调前后在领域问答任务上的准确率对比(53%→89%)