最近在调一个LLM推理的demo,用的HuggingFace的transformers,显存老是不够,看网上说torch.compile能提升不少,但我试了一下,第一次跑编译特别慢,而且有的算子报错不支持,回退到eager模式了。想问下各位大佬,对于像我这种做应用开发的,不是专门搞框架优化的,torch.compile是必须掌握的吗?还是说靠vLLM、TensorRT这些现成方案就够了?顺便问下,大家平时用torch.compile多吗,还是主要用纯PyTorch?有点迷茫,感觉新东西学不完。