最近在折腾MCP(Model Context Protocol),想把本地训练好的PyTorch模型包装成MCP服务,给前端或者Agent调用。目前用了官方的Python SDK,但感觉文档有点简略,尤其是怎么优雅地管理模型生命周期、处理并发请求这块。我自己写了个简单的server,但一遇到多轮对话或者并发调用就经常超时,显存也感觉没释放干净。搜了一圈社区,大部分都是讲LLM API的,像这种自定义PyTorch模型的例子很少。想问问有没有已经趟过坑的朋友,你们是直接用FastMCP还是自己封装了底层HTTP?模型加载是常驻内存还是按需加载?还有没有推荐的序列化方式,或者直接走ONNX/量化来提速?求指点,谢谢!