智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
全部 AI AI开发实战 FastAPI/Flask LangChain/AutoGPT LoRA/QLoRA Milvus/Qdrant React/Vue asyncio 学习笔记 容器化部署 开发实战 开源推荐 技术博客 技术选型 提示词工程 检索增强生成 版本控制 踩坑记录
FastAPI与Flask性能对决:Profiling驱动DB查询与Redis缓存优化实录

FastAPI与Flask性能对决:Profiling驱动DB查询与Redis缓存优化实录

在一次电商订单接口压测中,QPS从420惨跌至87,P99延迟飙至3.2秒。本文记录如何利用py-spy、cProfile定位FastAPI与Flask混合架构下的瓶颈——N+1查询与模板渲染阻塞,通过SQLAlchemy懒加载改造、Redis二级缓存及异步化重写,最终QPS稳定在2100,P99降至210ms。全文含完整代码、压测数据与真实踩坑记录,适合遇到性能瓶颈的Python Web开发者。

智能体实践者 935 213 0 26天前
FastAPI与Flask性能对决:Profile驱动调优从2s到120ms

FastAPI与Flask性能对决:Profile驱动调优从2s到120ms

某次线上服务接口在QPS 300时P99延迟飙升到2.1秒,数据库连接池被打满,CPU却只用了40%。本文记录了一次完整的API性能调优过程,使用cProfile和py-spy定位瓶颈,对比FastAPI(0.100)与Flask(2.3)在异步SQLAlchemy、Redis缓存、连接池复用等场景下的表现。通过将N+1查询合并为JOIN、引入二级缓存、调整gunicorn worker类型,最终

持续迭代安全修炼册 942 221 0 26天前
LangChain与AutoGPT双核驱动:手写Agent记忆与循环控制机制

LangChain与AutoGPT双核驱动:手写Agent记忆与循环控制机制

当AutoGPT的无限循环撞上LangChain的工具调用链,一个300行代码的Agent如何做到98.7%的意图识别准确率?本文记录了一次真实开发经历:在Python 3.11 + LangChain 0.1.0环境下,从零实现带短期记忆(BufferWindow)和长期记忆(SQLite向量检索)的Agent循环控制。重点拆解工具描述格式对LLM决策的影响——当工具描述从30字扩写到200字,

企业级数据科学应用札记 910 209 0 26天前
LoRA微调7B参数模型显存压测与推理效果对比实践

LoRA微调7B参数模型显存压测与推理效果对比实践

当业务需要把7B模型适配到特定领域时,全参微调需要近60GB显存,而LoRA只需16GB。本文基于Baichuan2-7B-Chat,使用PEFT+bitsandbytes完成QLoRA微调,在单张RTX 4090上从数据清洗到loss收敛全程记录。实测显存峰值15.7GB,训练3万步后,领域问答准确率从基线41.2%提升至78.6%,而单次推理延迟仅增加3ms。文中会给出可直接复跑的完整代码,并

每天进步一点商业成长记 841 199 0 26天前
FastAPI压测1200qps到4800qps:Profiling与缓存三层优化实录

FastAPI压测1200qps到4800qps:Profiling与缓存三层优化实录

一个内部报表API从1200qps提升至4800qps的完整调优记录。文章基于FastAPI+SQLAlchemy 2.0+Redis 7,通过py-spy和SlowQuery日志定位瓶颈,依次优化了N+1查询、JSON序列化开销和热点数据缓存。附完整代码片段和wrk压测对比数据,展示每个优化步骤的独立收益。适合被API性能困扰、想了解系统化调优方法的开发者。

小叶_Vue 812 198 0 26天前
Prompt模板迭代实录:从27%到91%的JSON抽取准确率提升

Prompt模板迭代实录:从27%到91%的JSON抽取准确率提升

在构建非结构化日志解析服务时,我针对OpenAI GPT-4o-mini设计了五版Prompt模板。通过控制变量法对比零样本、少样本与自校正提示词,最终将公司业务日志中关键字段的JSON抽取准确率从27%提升至91%,单次调用Token消耗从1842降至623。本文记录了完整的实验过程、失败教训与优化策略,包含可复现的代码与量化数据。

企业级向量库应用札记 856 217 0 26天前
7B模型LoRA微调实录:显存9.3G跑通中文医疗问答

7B模型LoRA微调实录:显存9.3G跑通中文医疗问答

微调7B大模型不再是A100专属。本文记录在单张RTX 3090(24G)上,用QLoRA对Qwen2-7B-Instruct进行中文医疗意图识别的完整过程。通过4-bit NF4量化,峰值显存仅9.3G;使用28万条病历对话数据,训练3个epoch后,医学问答BLEU提升22.7%,意图分类F1从0.61涨到0.88。文中提供可直接复用的LoRA配置、数据清洗脚本和推理对比样例,并踩平了PEFT

慢热开源爱好者日常 816 184 0 26天前
Docker Compose编排多服务容器化部署:健康检查与启动顺序实践

Docker Compose编排多服务容器化部署:健康检查与启动顺序实践

一个典型的Web项目往往包含前端、后端、数据库、缓存、消息队列等多个服务,手动docker run逐个启动不仅繁琐,而且难以管理依赖关系。本文基于Docker Compose 2.24+,分享一个包含Nginx、Spring Boot、PostgreSQL、Redis、RabbitMQ五服务的生产级编排配置,重点解决服务启动顺序、健康检查、数据卷持久化及自定义网络隔离问题。通过healthchec

向内求解设计学习者 729 190 0 26天前
7B模型单卡LoRA微调全记录:从QLoRA配置到损失收敛与推理对比

7B模型单卡LoRA微调全记录:从QLoRA配置到损失收敛与推理对比

上周用一张24G的4090微调Qwen2-7B做电商评论情感分类,采用QLoRA方案(4-bit NF4量化+LoRA rank=64)。训练集2.1万条,batch_size=4,梯度累积8步,学习率2e-4,cosine调度。最终在800步时loss降到0.31,验证集F1从基座的0.72提升到0.91。本文记录完整流程,包括bitsandbytes配置、PEFT参数选择、训练中遇到的loss

深度学习落地指南 878 214 0 26天前
向量数据库选型:Milvus 2.4与Qdrant 1.9在RAG场景下的实测对比

向量数据库选型:Milvus 2.4与Qdrant 1.9在RAG场景下的实测对比

在构建一个百万级商品向量检索的RAG系统时,我对比了Milvus 2.4.1与Qdrant 1.9.5。基于Docker Compose部署、HNSW索引、相同数据集与查询负载,实测Qdrant查询P99延迟为8.2ms,比Milvus低19%;但Milvus在批量写入吞吐上领先34%。内存占用方面,Qdrant在8GB堆外内存下稳定运行,而Milvus依赖其Knowhere引擎需12GB。本文记

隔壁云原生玩家手记 854 209 0 26天前
asyncio重构Flask接口:QPS从120到1800的并发改造实录

asyncio重构Flask接口:QPS从120到1800的并发改造实录

上周我负责的订单导出API在高峰期频繁超时,单机QPS只有120,客户端重试率高达15%。排查发现瓶颈是同步请求第三方物流API时线程阻塞。我用asyncio+httpx对核心逻辑做异步化改造,将串行等待改为并发IO,最终单机QPS提升到1800,P99延迟从2.3s降到180ms。本文记录完整改造过程,包括事件循环设计、信号量限流、以及一个坑:Flask与asyncio的兼容性陷阱。版本:Pyt

代码工具箱 871 207 0 26天前
Prompt工程化实践:从3.2%到41.7%准确率——实体抽取任务的提示词迭代实录

Prompt工程化实践:从3.2%到41.7%准确率——实体抽取任务的提示词迭代实录

在一次保险理赔实体抽取任务中,我通过四轮Prompt迭代,将GPT-4o-mini的F1分数从3.2%提升至41.7%,同时token消耗降低37%。本文记录了从零样本模板到结构化约束、从单一输出到多轮校验的完整过程,包含温度参数、system prompt分隔符、few-shot样本选择等细节对结果的影响。全文包含2个可复现代码块,所有实验数据基于OpenAI API 2024年8月版本。

深夜架构研究所 823 190 0 27天前
Prompt工程化调优实录:从42%到91%的RAG问答准确率跃迁

Prompt工程化调优实录:从42%到91%的RAG问答准确率跃迁

在构建基于GPT-4的私有知识库问答系统时,我发现默认Prompt的准确率仅有42%,且单次调用消耗高达2800 tokens。经过四轮结构化实验,对比了Zero-shot、Few-shot、Chain-of-Thought及自一致性(Self-Consistency)四种策略,最终确定了一套包含角色约束、格式锚定和推理链的复合Prompt,将准确率提升至91%,同时将平均响应Token消耗稳定控

小林LinuxLab 960 219 0 27天前
asyncio重构Flask接口,QPS从120翻倍到340的完整记录

asyncio重构Flask接口,QPS从120翻倍到340的完整记录

一个内部报表API,单次查询需聚合3张表、耗时1.8s,压测QPS仅120。我用asyncio+httpx将三个独立IO串行改并发,配合uvicorn部署,接口P95从1850ms降到620ms,QPS提升至340。本文记录完整重构过程,包含asyncio.Semaphore限流、gather异常隔离、事件循环避坑,以及一份可复用的异步爬虫/API模板。如果你正被同步IO阻塞折磨,这篇值得花5分钟

测试实验室 890 211 0 27天前
Prompt工程调优实录:从42%到89%准确率的RAG问答系统优化

Prompt工程调优实录:从42%到89%准确率的RAG问答系统优化

在构建基于GPT-4o-mini的RAG问答系统时,我通过系统性实验对比了7种Prompt模板,记录了从基础指令到结构化思维链的完整优化路径。实验数据显示:仅通过调整Prompt结构,无需更换模型或增加上下文长度,系统准确率就从42%提升至89%,单次查询Token消耗从1864降至1120。文中包含完整的代码实现、参数配置和失败案例复盘,希望能帮大家少走弯路。

生产级大模型炼金室 949 227 0 27天前
asyncio重构Flask API:并发吞吐提升320%的5个关键改动

asyncio重构Flask API:并发吞吐提升320%的5个关键改动

在一次电商大促压测中,我发现订单查询接口在500并发下P95延迟飙到4.2秒,数据库连接池被打满。通过asyncio+asyncpg将同步IO改为异步协程,配合Semaphore限流和连接池复用,最终P95降至1.1秒,吞吐量从380 req/s提升到1210 req/s。这篇文章完整记录了我的改造过程,包括before/after代码对比、三个隐藏的坑(事件循环阻塞、连接池耗尽、超时控制失效)以

计算机视觉工程手记 935 218 0 27天前
FastAPI慢查询治理:cProfile+SQL优化+Redis缓存三层提速方案

FastAPI慢查询治理:cProfile+SQL优化+Redis缓存三层提速方案

某电商订单API在QPS 200时P95延迟飙至3.8s,经cProfile定位到SQL N+1与重复计算两大病灶。通过SQLAlchemy selectinload批量加载、Redis多级缓存(本地+分布式)及异步改造,P95降至320ms,QPS提升至1800。文中提供完整profiling脚本与缓存装饰器实现,附压测对比数据,可直接复用于FastAPI/Flask项目。

键盘边修行 920 228 0 27天前
LoRA微调7B参数大模型全记录:从数据清洗到显存优化

LoRA微调7B参数大模型全记录:从数据清洗到显存优化

上周用单张4090把Llama-3-8B调成了法律问答助手,全程踩坑不断。本文记录完整实践:用QLoRA把显存压在11GB内,微调后模型在自建法律问答集上BLEU提升0.17,回答长度可控性大幅增强。你会看到具体的数据处理代码、训练配置、loss曲线分析,以及最终推理效果对比。关键词:QLoRA、bitsandbytes、PEFT、Llama-3-8B。

需求别催求生记 1017 240 0 27天前
QLoRA微调Qwen2-7B指令遵循:4bit量化下loss降至0.82

QLoRA微调Qwen2-7B指令遵循:4bit量化下loss降至0.82

微调7B模型显存不够?本文记录使用QLoRA在单张24G RTX 3090上微调Qwen2-7B-Instruct的全过程。通过4bit NormalFloat量化、双LoRA适配器(rank=64, alpha=128)和paged_adamw_8bit优化器,将峰值显存控制在18.7GB。在自建的8000条客服指令数据上训练3个epoch,loss从1.42降至0.82。推理对比显示,微调后模

认真成长设计修炼册 944 224 0 27天前
LangChain 0.3手写Agent:工具记忆与循环控制全拆解

LangChain 0.3手写Agent:工具记忆与循环控制全拆解

本文记录了我用LangChain 0.3.1和AutoGPT思想从零手写一个可运行的AI Agent全过程。重点解决三个痛点:自定义工具的参数校验(解决ToolException抛出后循环崩溃问题)、基于ConversationBufferWindow的滑动窗口记忆(控制token在4000以内)、以及带最大迭代次数(max_iterations=8)和异常降级的循环控制。最终在股票查询+天气查询

认真成长运维修炼册 864 214 0 27天前
上一页 1 2 3 ... 18 19 20 ... 25 26 27 下一页

作者推荐