最近在折腾MCP(模型上下文协议)和PyTorch的集成,想把本地训练好的模型通过MCP暴露给外部工具调用。但发现一个问题:MCP的消息格式基本是JSON,而模型输入输出都是张量,直接序列化效率很低,尤其是大模型推理时,一个embedding就是几千维的浮点数组,JSON字符串化之后又慢又占带宽。