用Spring AI+Qdrant实现可恢复的RAG增量索引服务
# 用Spring AI+Qdrant实现可恢复的RAG增量索引服务 ## 文章摘要 本文实现一个面向企业知识库的增量索引服务:通过文档Checksum和Chunk Hash识别变化,只对新增或修改片段生成Embedding;使用稳定Point ID写入Qdrant;通过版本状态实现新旧索引原子切换;失败任务可重试,删除操作可幂等执行。示例使用Spring Boot、Spring AI和Qdr
企业级RAG性能优化与质量治理(4):增量更新、版本治理、引用溯源与线上监控
# 企业级RAG性能优化与质量治理(4):增量更新、版本治理、引用溯源与线上监控 ## 文章摘要 企业RAG进入长期运行阶段后,真正困难的工作从“把文档放进向量库”转向知识生命周期治理:如何只更新变化内容、如何确保新旧版本不会同时生效、如何让每个答案追溯到具体文档与Chunk、如何发现线上召回过期内容,以及如何在更新失败时安全回滚。本文从数据模型、版本状态机、增量索引、删除传播、引用链路、缓存
用Docling+Spring AI搭建PDF解析与RAG入库管道:表格、Metadata和质量门禁
# 用Docling+Spring AI搭建PDF解析与RAG入库管道:表格、Metadata和质量门禁 ## 文章摘要 Spring AI提供DocumentReader、DocumentTransformer和VectorStore等ETL能力,但复杂PDF的版面、表格和OCR往往需要更专业的解析工具。Docling可以将PDF解析成包含页面、标题、段落、表格和图片信息的结构化文档。本文通
企业级RAG性能优化与质量治理(2):文档解析与Chunk工程决定知识库上限
# 企业级RAG性能优化与质量治理(2):文档解析与Chunk工程决定知识库上限 ## 文章摘要 很多团队把RAG效果差归因于Embedding模型、向量数据库或大模型,却忽略了最前面的文档解析与Chunk工程。PDF乱码、表格丢失、标题层级消失、旧版本混入和固定长度粗暴切分,会在数据进入向量库前就破坏知识。本文建立一套生产级文档管道:文件识别、结构解析、清洗、质量门禁、结构分块、父子Chun
用Spring AI+Qdrant实现混合检索服务:Dense、Sparse、RRF与权限过滤
# 用Spring AI+Qdrant实现混合检索服务:Dense、Sparse、RRF与权限过滤 ## 文章摘要 单一Dense向量检索擅长语义理解,却容易漏掉产品型号、合同编号和专业缩写;纯关键词检索能够精确命中术语,却难以理解自然语言。本文使用Spring Boot、Spring AI和Qdrant设计一个可复用的企业混合检索服务,完成Dense与Sparse双路召回、租户权限过滤、RR
企业级RAG性能优化与质量治理(3):混合检索、重排与权限过滤的生产级设计
# 企业级RAG性能优化与质量治理(3):混合检索、重排与权限过滤的生产级设计 ## 文章摘要 前两篇分别讨论了RAG质量问题的总体诊断,以及文档解析与Chunk工程。本篇进入检索核心:为什么企业知识库不能只依赖单一向量召回,Dense、Sparse、Metadata过滤、融合、重排和权限控制应如何组合,以及怎样通过黄金测试集和线上指标持续治理召回质量。本文给出一套可落地的生产级检索架构、数据
用Spring Boot搭建一个可版本化的Prompt模板管理器:加载、缓存、灰度与回滚
# 用Spring Boot搭建一个可版本化的Prompt模板管理器:加载、缓存、灰度与回滚 ## 文章摘要 企业AI项目中的Prompt不能长期散落在Java代码里。随着场景增加,需要解决模板版本、环境差异、审批、缓存、灰度、回滚和调用追踪。本文实现一个轻量级Spring Boot Prompt模板管理器:使用数据库保存模板元数据,通过Resource与StringTemplate渲染变量,
Spring AI企业级应用实战(2):ChatClient、Advisor与Prompt Template构建统一调用层
# Spring AI企业级应用实战(2):ChatClient、Advisor与Prompt Template构建统一调用层 ## 文章摘要 上一篇完成了Spring Boot 4.1、Spring AI 2.0与DeepSeek V4接入,但业务代码仍然只是直接调用ChatClient。真实企业项目需要统一管理System Prompt、模板变量、租户信息、请求日志、调用耗时和响应格式。本
AI 模型成本战:企业账单从月费百万到精打细算的生存指南
AI API价格暴跌93%但企业账单却飙升。六步省钱法:切模型立省50%、模型路由再省30%、语义缓存省25%、Prompt精简省20%、自建推理省80%、成本监控。$15000压到$1500。Gartner预测40%Agentic AI项目将因成本被取消。
AI 价格战白热化:三大巨头一周内集体降价,Oracle 暴跌 19%,首尔启动全球首个政府 MCP
OpenAI/Meta/SpaceXAI一周内集体推低价模型,API价格降至年初1/10。Oracle因AI基建债务1300亿被降级暴跌19%。首尔启动全球首个政府公共数据MCP服务。AI从稀缺资源变成基础设施。
AI 智能体商业落地实战:从技术原型到生产部署的完整路径
AI Agent从Demo到生产的完整指南:任务原子化拆分、模型路由+缓存+Prompt精简成本降99%、人机协作三级决策、企业集成架构。结合首钢秒级审核、京东2700降到10元、CSDN预判99%代码AI生成。
AI 端侧部署实战:模型量化、压缩与本地推理完整指南
把大模型部署到手机和边缘设备:模型量化原理、GPTQ/AWQ/GGUF三方案对比、4-bit压缩实测精度损失、Ollama本地推理完整流程、从54GB压到4GB。附量化前后性能对比。
GPT-5.6 接入实战:API 调用、成本预估与从 GPT-5.5 迁移的完整指南
明天GPT-5.6全量上线,今天准备好接入。三模型API调用方式、速度拨盘参数详解、成本预估公式、GPT-5.5迁移代码改动量、常见陷阱避坑。月费从473降到31-220元。
手搓生产级 AI Agent 系统(5):MCP 协议从零实现——打造 Agent 的应用商店
从零实现MCP协议:JSON-RPC通信、Server/Client架构、工具热插拔自动发现、安全沙箱隔离。Agent启动时自动拉取可用工具,零代码扩展。附与Function Calling的六维对比。
手搓生产级 AI Agent 系统(4):A2A 协议——让两个 Agent 互相通信
从零实现A2A协议:三种通信模式(广播/点对点/委托)、统一消息格式、任务分配策略、错误自动恢复。双Agent协作安全审查成功率90%,比单Agent高15%。
手搓生产级 AI Agent 系统(1):ReAct 核心循环深度实现——从原理到50行代码
不依赖框架从零手写ReAct核心循环。拆解三种输出解析策略失败率对比(JSON23%vs正则4%)、四层停止条件、工具描述质量5倍差异实测。50行代码跑通。
手搓生产级 AI Agent 系统(3):Agent 与工具系统完整集成——从 ReAct 到自主决策
将ReAct循环与工具系统完整集成:动态工具发现、四层停止条件、上下文管理、任务防漂移。20个任务端到端测试:成功率90%、比LangChain省38% Token。
AI API 网关实战:多模型统一调度、自动降级与成本追踪
从零实现 AI API 网关:统一 OpenAI/Claude/DeepSeek/GLM 多模型接口、按任务复杂度自动路由、主模型故障时自动降级到备用模型、实时成本追踪。附完整代码和月省80%费用的实测数据。
手搓生产级 AI Agent 系统(2):工具系统深度实战——从参数校验到沙箱安全
深入 AI Agent 工具系统设计:通用工具注册框架、参数 Schema 自动校验、工具描述对调用准确率的影响实测、危险操作沙箱隔离、失败恢复策略。附完整可运行代码。
AI Agent 架构深度解析:从原理到生产级实现的完整指南
万字长文拆解 AI Agent 完整架构。感知-决策-执行-记忆-反思五层模型、四种规划策略对比、工具系统设计、记忆架构实现、生产级部署要点。附可运行代码。