前言

很多Java开发者面对AI浪潮时有两个极端判断:

  1. 必须放弃Java,从头学习Python和模型训练;
  2. 只要会调用大模型API,就已经完成转型。

这两种判断都不准确。

大多数企业级AI项目不是从零训练基础模型,而是把模型能力接入ERP、CRM、仓储、客服、知识库、营销和数据分析平台。

这些系统仍然需要Java开发者熟悉的:

  • 服务治理;
  • 权限;
  • 数据库;
  • 消息队列;
  • 缓存;
  • 并发;
  • 日志;
  • 监控;
  • 部署;
  • 业务建模。

Java开发者真正需要补齐的是:

大模型应用层、知识检索层、Agent执行层和AI质量治理能力。


第一阶段:理解大模型应用基础

至少理解:

  • Token;
  • Context Window;
  • System/User/Assistant消息;
  • Temperature与Top-P;
  • Streaming;
  • Structured Output;
  • Function Calling;
  • Embedding;
  • Vector Store;
  • RAG;
  • Agent;
  • MCP。

不要求一开始学习Transformer数学推导,但要理解模型边界:

  • 模型可能幻觉;
  • 模型输出不稳定;
  • 模型不知道企业私有数据;
  • 模型不能真正执行工具;
  • 长上下文会增加成本;
  • 更大模型不一定适合所有任务。

先使用Java HTTP客户端完成:

普通调用
流式调用
异常处理
超时
重试
Token统计

目的是理解底层协议,而不是长期手写所有能力。


第二阶段:掌握Spring AI

推荐学习顺序:

ChatModel
→ ChatClient
→ Prompt Template
→ Advisor
→ Chat Memory
→ Structured Output
→ Tool Calling
→ RAG
→ MCP

重点理解:

  • ChatClient如何组织调用链;
  • Advisor如何统一增强请求;
  • Memory和数据库消息记录有什么区别;
  • Tool Calling为什么需要执行循环;
  • RAG上下文在哪里注入;
  • 多模型如何路由;
  • 如何与Spring Security结合。

建议完成一个真实项目:

企业知识库+工具型Agent+用户权限+调用成本统计。


第三阶段:补齐Python最低能力

Java开发者不需要立刻转型为算法工程师,但建议具备基础Python能力:

  • 阅读Python代码;
  • 创建虚拟环境;
  • 安装依赖;
  • 运行FastAPI;
  • 调用模型SDK;
  • 使用Jupyter;
  • 处理JSON和CSV;
  • 阅读主流AI开源项目。

合理分工:

Java负责企业业务与系统工程
Python负责模型服务、实验和数据处理

第四阶段:掌握RAG工程

普通RAG Demo:

上传PDF
→ 分块
→ Embedding
→ 向量检索
→ 拼接Prompt

企业RAG真正困难的是:

  • PDF解析质量;
  • 表格和扫描件;
  • 文档分块;
  • 混合检索;
  • Reranker;
  • 权限过滤;
  • 文档版本;
  • 增量更新;
  • 引用溯源;
  • 自动化评测。

建议学习:

文档处理

  • Apache Tika;
  • PDF解析;
  • OCR;
  • Markdown;
  • 元数据设计。

检索

  • BM25;
  • Embedding;
  • pgvector;
  • Milvus;
  • Elasticsearch;
  • Reranker。

质量

  • 召回率;
  • 相关性;
  • 忠实度;
  • 答案准确率;
  • 黄金测试集。

第五阶段:掌握Agent与Tool Calling

Agent不是“会聊天的机器人”,而是受约束的任务执行系统:

任务输入
→ 规划
→ 选择工具
→ 参数生成
→ 权限校验
→ 执行工具
→ 结果返回模型
→ 判断是否继续
→ 最终答案

Java开发者有天然优势,因为工具往往就是现有企业服务:

  • 查询订单;
  • 查询库存;
  • 创建工单;
  • 生成报表;
  • 发送通知;
  • 调用审批;
  • 更新业务状态。

需要补齐:

  • JSON Schema;
  • 工具参数校验;
  • 幂等;
  • 超时;
  • 重试;
  • 人工审批;
  • 最大执行步数;
  • 断点恢复;
  • 审计日志。

第六阶段:学习MCP

重点学习:

  • MCP Client;
  • MCP Server;
  • Tools;
  • Resources;
  • Prompts;
  • Streamable HTTP;
  • stdio;
  • OAuth;
  • 用户身份传递;
  • 工具权限;
  • 调用审计。

可以把数据库查询、ERP接口、CRM接口、文档资源和审批系统封装成标准MCP能力。

但MCP只是协议,不会自动解决权限和安全。


第七阶段:补齐LLMOps与质量保障

传统软件测试强调确定性,大模型输出具有概率性,因此需要新的质量方法:

  • Prompt版本;
  • 测试数据集;
  • LLM-as-a-Judge;
  • RAG评测;
  • Agent任务完成率;
  • 工具调用准确率;
  • A/B测试;
  • 线上质量漂移;
  • 用户反馈闭环。

监控指标至少包括:

请求量
成功率
首Token延迟
总响应时间
输入Token
输出Token
费用
重试次数
工具调用次数
用户差评

AI应用不能只监控CPU和内存。


第八阶段:部署与推理基础

即使主要调用云API,也应理解:

  • Ollama;
  • vLLM;
  • SGLang;
  • GPU显存;
  • 量化;
  • KV Cache;
  • Continuous Batching;
  • 模型并发;
  • Kubernetes GPU调度。

不要求每个Java开发者都成为CUDA专家,但要能回答:

  • 为什么模型服务很慢;
  • 为什么显存不足;
  • 为什么并发上不去;
  • 自建和API哪个更便宜;
  • 什么任务适合本地模型。

一条可执行的12周路线

第1—2周:模型API基础

完成Java调用模型、同步与流式输出、超时、重试和简单聊天页面。

第3—4周:Spring AI

完成ChatClient、Prompt Template、Advisor、Chat Memory和Structured Output。

第5—6周:RAG

完成文档解析、向量库、检索、引用来源和权限过滤。

第7—8周:Agent

完成Tool Calling、多工具、人工审批、失败重试和审计日志。

第9周:MCP

完成Java MCP Server、数据库工具、REST API工具和MCP Client。

第10周:质量评测

完成黄金测试集、Prompt回归、RAG评测和Agent成功率统计。

第11周:部署治理

完成Docker、Nginx流式配置、JWT、限流和Token成本统计。

第12周:综合项目

建议项目:

企业知识库Agent系统

功能包括:

  • 用户登录;
  • 文档上传;
  • 多租户知识库;
  • RAG问答;
  • 引用溯源;
  • 订单/库存工具;
  • 高风险操作审批;
  • 调用链和成本看板;
  • Docker部署。

Java开发者初期不必投入什么

不必立即投入:

  • 从零训练大模型;
  • 高深矩阵推导;
  • CUDA内核开发;
  • 分布式训练;
  • RLHF训练系统;
  • 自研Transformer框架。

除非目标岗位是算法或模型基础设施工程师。


最容易踩的5个坑

1. 只会调用API

能够返回文本不等于能够上线。

2. 过度依赖框架

不理解底层HTTP、消息、工具循环和检索链路,出现问题时无法排查。

3. 只做聊天机器人

企业价值通常来自数据、流程、工具、权限和自动化。

4. 不做评测

Prompt改了、模型换了,却不知道质量提高还是下降。

5. 忽视成本和安全

没有限流、额度、权限、脱敏和审计的AI系统,很难进入生产。


最终建议

Java开发者的优势没有因为AI出现而消失。模型能力进入企业系统后,更需要熟悉复杂业务和工程治理的人。

建议形成“T型能力”:

横向:
Java、Spring、数据库、中间件、微服务、云原生

纵向:
Spring AI、RAG、Agent、MCP、评测、LLMOps

真正有竞争力的不是“会不会调用某个模型”,而是:

能否把不稳定、昂贵、具有概率性的模型能力,变成安全、可控、可观测、可维护的企业应用。