最近在折腾把PyTorch训练好的模型封装成MCP server给LLM调用,遇到个头疼的问题。模型本身是带状态的(比如RNN的hidden state,或者需要维护用户session的特征缓存),但MCP的tool调用感觉是无状态的,每次请求都从零开始推。我试过把状态存到全局dict里,但并发一高就乱套,而且多轮对话里模型记忆和LLM自身的上下文感觉是割裂的。想问下大家,现在做AI Agent调用本地模型服务时,这种带状态的推理场景是应该自己写个session管理中间层,还是干脆把逻辑拆成纯函数、把状态丢给外部数据库?另外,MCP的资源(Resource)能不能用来干这个,或者你们一般用什么模式解决?求个思路,有点绕进去了。