生成式 AI 流量正在改写 API 网关的底层假设。资料指出,传统微服务网关处理的是毫秒级、无状态、基于 URL/Header 的短请求;而 LLM 工作负载带来四个变化:交互变成 SSE 流式长连接,可能持续几十秒到数分钟;路由依据从 HTTP Method/Path 转向 JSON Body 中的 model 字段;限流单位从 QPS 转向 TPM 与 RPM;公有云 API 价格差异大且偶发 429/超时,需要语义缓存、智能权重调度与无感降级容灾。这是讨论大模型网关选型的前提。

一、Higress:三合一架构与 AI 原生能力
资料称,Higress 源自阿里巴巴内部经过大规模并发检验的网关核心,后基于 Envoy 与 Istio 标准化重构并捐赠开源。架构上强调“三合一”:安全网关、流量网关与微服务网关合并,网络跳数由 3 降为 1,硬件资源消耗削减 50% 以上。数据面基于 C++ Envoy,控制面深度集成 Istio Pilot 与 Kubernetes 原生体系,支持 Kubernetes Gateway API 与 Ingress 规范;配置变更通过 xDS 毫秒级热下发,避免 Nginx Reload 导致的长连接抖动。扩展层全面采用 WebAssembly,支持 Go/TinyGo、Rust、C++ 等语言,具备无损热加载、内存隔离与较低执行开销。

AI 能力方面,资料列出六项:
1. 统一协议归一化:上游按 OpenAI 兼容协议调用,网关在入方向与出方向转换 OpenAI、Anthropic Claude、通义千问、DeepSeek、Moonshot、Ollama 等协议体。
2. SSE 流式优化:实现零拷贝 Chunk 透传,将代理层引入的 TTFT 增量降至毫秒级;支持客户端断开检测,终端取消生成时向下游发送断开信号,中止上游推理。
3. Token 治理:支持按租户、API Key、客户端 IP 配置 TPM 与 RPM 双滑动窗口限流,以及多租户 Quota 预扣减与审计,流式结束后统计 Input/Output Tokens。
4. 多模型智能路由与容灾:可在主模型与备选模型间按权重调度;主力通道返回 429 或超时后,自动在备选 Provider 间无感重试。
5. 语义缓存:联合 Milvus、Redis Vector 等向量库,对 Prompt 实时向量化,语义相似度超过设定阈值(如 0.92)时直接返回缓存响应,资料称首字响应可缩减至 50ms 以内。
6. 内容安全:内置安全 Wasm 过滤器,入站检测 Prompt 越狱与注入,出站做敏感词过滤与 PII 脱敏。

二、Kong AI Gateway:插件矩阵与架构边界
资料称,Kong 在 3.6+ 版本发布 AI Gateway 套件,基于 Nginx + OpenResty 底座,通过专有 AI 插件赋能。核心插件包括:ai-proxy 转换 OpenAI、Anthropic、Cohere、Azure OpenAI、AWS Bedrock 等后端格式;ai-prompt-template 注入系统变量与上下文;ai-prompt-guard 基于规则或正则拦截恶意 Prompt;ai-prompt-decorator 在请求头尾注入 System Prompt;ai-rate-limiting-advanced 按 Token 消耗限流;ai-semantic-cache 配合 Redis 实现向量语义缓存。

Kong 的优势被归纳为两点:一是企业级插件生态极深,已有大量认证、鉴权、日志、监控插件,非 AI 流量托管在 Kong 上的企业开启 AI 插件学习成本低;二是多云与非 Kubernetes 友好,支持 VM、裸金属、混合云乃至边缘设备。潜在瓶颈则包括:OpenResty/Lua 协程在超长 SSE 流式与 64k~128k Tokens 大上下文下,内存开销与碎片化管理比 C++ 原生更脆弱;配置管理主要基于 Admin API、decK 或 KIC,在大规模 K8s 集群中 CRD 声明式与动态热更新体验相比 Envoy xDS 略重;自定义插件主要依赖 Lua,外部 Go/Python 插件存在 IPC 开销,难以兼具 Wasm 的多语言与沙箱性能。

三、Envoy 与 Istio:官方路线正在补位
资料明确回答:Envoy 和 Istio 官方不仅有 LLM 代理方向,而且分为“七层大模型路由代理”与“底层 GPU 推理集群调度”两条阵线。Envoy 社区发起了 Envoy AI Gateway,并随 Agent 浪潮演进为 Agent Router。其核心设计包括:基于 ext-proc 协议解耦,通过高性能 gRPC 与 AI Processing 进程通信,完成 OpenAI JSON 解析、model 字段提取、Prompt 注入检查与 Token 统计;与 Envoy Gateway 深度集成,定义 AIGatewayRoute、AIServiceBackend 等 CRD,声明不同模型后端与权重降级策略;最新 Agent Router 还探索将 Anthropic 提出的 MCP 工具协议纳入网关代理治理。

资料还提到 Kubernetes SIG-Network 的 Gateway API Inference Extension,定位是面向私有 Kubernetes 集群中用 GPU 部署 vLLM、TGI、Triton 等推理服务的场景。但输入资料在此处截断,未给出该扩展的完整 CRD、能力细节与版本信息,因此无法据此展开更具体的配置断言。

四、工程分析与选型维度
以下为工程分析,不属于资料事实。若企业已大量使用 Kong 且非全容器化,Kong AI Gateway 的插件复用与多云部署优势更直接;若追求 Kubernetes 原生、xDS 热更新、Wasm 插件隔离与 SSE 长连接治理,Higress 的架构叙事更贴合;若已有 Envoy Gateway/Kubernetes Gateway API 体系,并希望跟随 CNCF 官方路线,Envoy AI Gateway/Agent Router 值得纳入观察清单。

压测与验证可围绕:首字延迟 TTFT 增量、并发 SSE 连接数与内存曲线、TPM/RPM 限流精度与多租户配额一致性、语义缓存命中率与成本节省、429/超时后的故障切换时延、插件热更新对长连接的影响、以及 Token 审计与成本归因的准确性。需要提醒的是,当前输入资料没有提供可直接复现的 YAML/CRD 配置示例与压测数据,落地配置应以各项目官方文档为准。