最近在折腾把本地训练好的模型封装成MCP服务器给LLM调用,但遇到个选择困难。我的推理代码是PyTorch写的,但看MCP官方文档里示例大多是TensorFlow Serving或者ONNX Runtime。直接上PyTorch的TorchServe吧,感觉和MCP的tool/schema对接有点绕,还得自己写不少胶水代码。另外模型是动态图,导出成TorchScript总报版本兼容问题。想问下大家实际生产环境里,MCP这边的深度学习推理一般用什么方案?是硬上ONNX统一格式,还是干脆容器里直接跑Python脚本走HTTP?另外有没有现成的MCP-server包装PyTorch模型的库,能省掉自己撸协议转换的?求指条明路,孩子快被各种runtime搞疯了。