最近在搞一个实验,想把MCP(Model Context Protocol)服务器接到现有的PyTorch训练流程里,让外部工具能动态调整超参。折腾了两天终于跑通了,但发现一个诡异的问题:加了MCP之后,每个step的耗时从原来的0.8s涨到了1.5s,几乎翻倍。我看日志里MCP的请求量也不大,就是每10步调一次learning rate,按理说这点开销不至于啊。我怀疑是不是因为MCP的异步回调阻塞了CUDA stream,或者跟DataLoader的worker有锁竞争?有没有大佬遇到过类似情况,或者有推荐的MCP接入方式,比如走独立进程还是线程池?求指点,这性能损耗我有点顶不住了。