Spring AI企业级应用实战(10):多模型路由、预算控制与故障降级

文章摘要

在统一调用层之上实现模型能力目录、策略路由、预算守卫、Fallback和路由审计。

一、本篇目标

  • 注册多个ChatClient
  • 按业务选择模型
  • 预估与结算费用
  • 受控执行Fallback
  • 追踪实际模型

二、为什么Demo方案无法直接进入生产

单一模型无法同时满足成本、能力、延迟和可用性要求。

生产系统需要把模型调用放入完整控制面,而不是让Controller直接拼Prompt、选择模型并处理异常。

三、总体架构

业务Service → RoutingFacade → PolicyRouter → BudgetGuard → ClientRegistry

4、模型能力目录

模型能力目录是本篇生产架构的关键组成部分,需要显式定义输入、输出、状态、错误边界和观测字段。

public RouteDecision route(AiTask task, TenantPolicy policy) {
    if (task.highRisk()) return RouteDecision.powerful("高风险任务");
    if (policy.remainingBudgetRatio() = 7
            ? RouteDecision.powerful("复杂任务")
            : RouteDecision.balanced("默认路由");
}

5、策略路由器

策略路由器是本篇生产架构的关键组成部分,需要显式定义输入、输出、状态、错误边界和观测字段。

public RouteDecision route(AiTask task, TenantPolicy policy) {
    if (task.highRisk()) return RouteDecision.powerful("高风险任务");
    if (policy.remainingBudgetRatio() = 7
            ? RouteDecision.powerful("复杂任务")
            : RouteDecision.balanced("默认路由");
}

6、预算守卫

预算守卫是本篇生产架构的关键组成部分,需要显式定义输入、输出、状态、错误边界和观测字段。

public RouteDecision route(AiTask task, TenantPolicy policy) {
    if (task.highRisk()) return RouteDecision.powerful("高风险任务");
    if (policy.remainingBudgetRatio() = 7
            ? RouteDecision.powerful("复杂任务")
            : RouteDecision.balanced("默认路由");
}

7、Fallback控制器

Fallback控制器是本篇生产架构的关键组成部分,需要显式定义输入、输出、状态、错误边界和观测字段。

public RouteDecision route(AiTask task, TenantPolicy policy) {
    if (task.highRisk()) return RouteDecision.powerful("高风险任务");
    if (policy.remainingBudgetRatio() = 7
            ? RouteDecision.powerful("复杂任务")
            : RouteDecision.balanced("默认路由");
}

8、生产治理要求

  • 配置、Prompt、模型和数据版本必须进入Trace
  • 权限、预算和风险规则由业务代码强制执行
  • 外部调用设置全链路Deadline
  • 重试与副作用隔离
  • 所有关键失败形成可回放样本

9、测试策略

  1. 确定性领域逻辑单元测试
  2. 外部Provider契约测试
  3. 黄金数据集质量评测
  4. 限流、超时和宕机故障注入
  5. 灰度与回滚演练

10、上线检查清单

□ 接口契约稳定
□ 租户隔离通过攻击测试
□ 版本可追踪
□ 成本与质量可观测
□ 异常有降级和人工兜底

阶段性验收标准

本篇围绕“Spring AI企业级应用实战(10):多模型路由、预算控制与故障降级”建设的能力,应通过以下验收后再进入下一阶段:

核心接口契约稳定
关键状态可以持久化和恢复
租户、用户和权限边界通过攻击测试
外部超时、限流和宕机有明确降级
模型、Prompt、工具和数据版本可追踪
质量、延迟、成本和错误均可观测

除正常流程外,还应覆盖重复请求、并发更新、部分失败、服务重启、回调乱序、权限撤销和配置回滚。对于包含真实副作用的步骤,必须证明重试和恢复不会重复执行。

生产运行中的持续治理

系统上线后要把线上失败、人工接管和用户负反馈持续回流到测试集。每次模型、Prompt、工具或索引变化都运行同一基线,并通过影子流量或金丝雀验证真实分布。

建议按周复盘高成本任务、重复调用、低置信输出和人工修订原因;按月复审权限、数据保留、模型能力目录和降级策略。企业AI工程不是一次性开发,而是一套持续测量、修正和演进的运行体系。

总结

多模型系统的核心不是模型数量,而是可执行、可解释、可审计的路由决策。

下一篇将继续实现:

Spring AI企业级应用实战(11):权限感知RAG、多租户过滤与引用治理

延伸阅读

如果你正在关注企业级 AI 应用、Spring AI、RAG、Agent 与大模型工程化落地,欢迎访问 智元界

https://www.zyentor.com/

智元界将持续分享可运行的技术实战、架构设计、问题排查与企业应用案例。