前言
很多Java开发者面对AI浪潮时有两个极端判断:
- 必须放弃Java,从头学习Python和模型训练;
- 只要会调用大模型API,就已经完成转型。
这两种判断都不准确。
大多数企业级AI项目不是从零训练基础模型,而是把模型能力接入ERP、CRM、仓储、客服、知识库、营销和数据分析平台。
这些系统仍然需要Java开发者熟悉的:
- 服务治理;
- 权限;
- 数据库;
- 消息队列;
- 缓存;
- 并发;
- 日志;
- 监控;
- 部署;
- 业务建模。
Java开发者真正需要补齐的是:
大模型应用层、知识检索层、Agent执行层和AI质量治理能力。
第一阶段:理解大模型应用基础
至少理解:
- Token;
- Context Window;
- System/User/Assistant消息;
- Temperature与Top-P;
- Streaming;
- Structured Output;
- Function Calling;
- Embedding;
- Vector Store;
- RAG;
- Agent;
- MCP。
不要求一开始学习Transformer数学推导,但要理解模型边界:
- 模型可能幻觉;
- 模型输出不稳定;
- 模型不知道企业私有数据;
- 模型不能真正执行工具;
- 长上下文会增加成本;
- 更大模型不一定适合所有任务。
先使用Java HTTP客户端完成:
普通调用
流式调用
异常处理
超时
重试
Token统计
目的是理解底层协议,而不是长期手写所有能力。
第二阶段:掌握Spring AI
推荐学习顺序:
ChatModel
→ ChatClient
→ Prompt Template
→ Advisor
→ Chat Memory
→ Structured Output
→ Tool Calling
→ RAG
→ MCP
重点理解:
- ChatClient如何组织调用链;
- Advisor如何统一增强请求;
- Memory和数据库消息记录有什么区别;
- Tool Calling为什么需要执行循环;
- RAG上下文在哪里注入;
- 多模型如何路由;
- 如何与Spring Security结合。
建议完成一个真实项目:
企业知识库+工具型Agent+用户权限+调用成本统计。
第三阶段:补齐Python最低能力
Java开发者不需要立刻转型为算法工程师,但建议具备基础Python能力:
- 阅读Python代码;
- 创建虚拟环境;
- 安装依赖;
- 运行FastAPI;
- 调用模型SDK;
- 使用Jupyter;
- 处理JSON和CSV;
- 阅读主流AI开源项目。
合理分工:
Java负责企业业务与系统工程
Python负责模型服务、实验和数据处理
第四阶段:掌握RAG工程
普通RAG Demo:
上传PDF
→ 分块
→ Embedding
→ 向量检索
→ 拼接Prompt
企业RAG真正困难的是:
- PDF解析质量;
- 表格和扫描件;
- 文档分块;
- 混合检索;
- Reranker;
- 权限过滤;
- 文档版本;
- 增量更新;
- 引用溯源;
- 自动化评测。
建议学习:
文档处理
- Apache Tika;
- PDF解析;
- OCR;
- Markdown;
- 元数据设计。
检索
- BM25;
- Embedding;
- pgvector;
- Milvus;
- Elasticsearch;
- Reranker。
质量
- 召回率;
- 相关性;
- 忠实度;
- 答案准确率;
- 黄金测试集。
第五阶段:掌握Agent与Tool Calling
Agent不是“会聊天的机器人”,而是受约束的任务执行系统:
任务输入
→ 规划
→ 选择工具
→ 参数生成
→ 权限校验
→ 执行工具
→ 结果返回模型
→ 判断是否继续
→ 最终答案
Java开发者有天然优势,因为工具往往就是现有企业服务:
- 查询订单;
- 查询库存;
- 创建工单;
- 生成报表;
- 发送通知;
- 调用审批;
- 更新业务状态。
需要补齐:
- JSON Schema;
- 工具参数校验;
- 幂等;
- 超时;
- 重试;
- 人工审批;
- 最大执行步数;
- 断点恢复;
- 审计日志。
第六阶段:学习MCP
重点学习:
- MCP Client;
- MCP Server;
- Tools;
- Resources;
- Prompts;
- Streamable HTTP;
- stdio;
- OAuth;
- 用户身份传递;
- 工具权限;
- 调用审计。
可以把数据库查询、ERP接口、CRM接口、文档资源和审批系统封装成标准MCP能力。
但MCP只是协议,不会自动解决权限和安全。
第七阶段:补齐LLMOps与质量保障
传统软件测试强调确定性,大模型输出具有概率性,因此需要新的质量方法:
- Prompt版本;
- 测试数据集;
- LLM-as-a-Judge;
- RAG评测;
- Agent任务完成率;
- 工具调用准确率;
- A/B测试;
- 线上质量漂移;
- 用户反馈闭环。
监控指标至少包括:
请求量
成功率
首Token延迟
总响应时间
输入Token
输出Token
费用
重试次数
工具调用次数
用户差评
AI应用不能只监控CPU和内存。
第八阶段:部署与推理基础
即使主要调用云API,也应理解:
- Ollama;
- vLLM;
- SGLang;
- GPU显存;
- 量化;
- KV Cache;
- Continuous Batching;
- 模型并发;
- Kubernetes GPU调度。
不要求每个Java开发者都成为CUDA专家,但要能回答:
- 为什么模型服务很慢;
- 为什么显存不足;
- 为什么并发上不去;
- 自建和API哪个更便宜;
- 什么任务适合本地模型。
一条可执行的12周路线
第1—2周:模型API基础
完成Java调用模型、同步与流式输出、超时、重试和简单聊天页面。
第3—4周:Spring AI
完成ChatClient、Prompt Template、Advisor、Chat Memory和Structured Output。
第5—6周:RAG
完成文档解析、向量库、检索、引用来源和权限过滤。
第7—8周:Agent
完成Tool Calling、多工具、人工审批、失败重试和审计日志。
第9周:MCP
完成Java MCP Server、数据库工具、REST API工具和MCP Client。
第10周:质量评测
完成黄金测试集、Prompt回归、RAG评测和Agent成功率统计。
第11周:部署治理
完成Docker、Nginx流式配置、JWT、限流和Token成本统计。
第12周:综合项目
建议项目:
企业知识库Agent系统
功能包括:
- 用户登录;
- 文档上传;
- 多租户知识库;
- RAG问答;
- 引用溯源;
- 订单/库存工具;
- 高风险操作审批;
- 调用链和成本看板;
- Docker部署。
Java开发者初期不必投入什么
不必立即投入:
- 从零训练大模型;
- 高深矩阵推导;
- CUDA内核开发;
- 分布式训练;
- RLHF训练系统;
- 自研Transformer框架。
除非目标岗位是算法或模型基础设施工程师。
最容易踩的5个坑
1. 只会调用API
能够返回文本不等于能够上线。
2. 过度依赖框架
不理解底层HTTP、消息、工具循环和检索链路,出现问题时无法排查。
3. 只做聊天机器人
企业价值通常来自数据、流程、工具、权限和自动化。
4. 不做评测
Prompt改了、模型换了,却不知道质量提高还是下降。
5. 忽视成本和安全
没有限流、额度、权限、脱敏和审计的AI系统,很难进入生产。
最终建议
Java开发者的优势没有因为AI出现而消失。模型能力进入企业系统后,更需要熟悉复杂业务和工程治理的人。
建议形成“T型能力”:
横向:
Java、Spring、数据库、中间件、微服务、云原生
纵向:
Spring AI、RAG、Agent、MCP、评测、LLMOps
真正有竞争力的不是“会不会调用某个模型”,而是:
能否把不稳定、昂贵、具有概率性的模型能力,变成安全、可控、可观测、可维护的企业应用。