最近在折腾MCP(Model Context Protocol)落地的项目,想把我们内部训练的PyTorch模型通过MCP server暴露给外部Agent调用。现在卡在数据流设计上:模型推理要传tensor,但MCP走的是JSON-RPC,只能传序列化数据。我目前是前端把numpy数组转base64塞进JSON里,后端再解码,但感觉这样好笨重,而且图片这种大体积数据一多延迟就上来了。看官方文档只讲了工具调用和资源映射,没具体说怎么跟推理服务(比如Triton或Ray Serve)衔接。想问问大家生产环境里是怎么处理的?是直接在MCP server里内嵌模型,还是设计成代理转发到推理集群?有没有延迟和吞吐还不错的模式?新人求指点。