最近在调一个LLM的推理代码,模型是7B的,用PyTorch 2.0的torch.compile优化后,反而比eager模式慢了20%左右。我用的还是默认模式,没加任何特殊配置。看官方博客说compile能提速,但实测下来完全相反。网上查了下,有人说需要配合CUDA graphs,有人说是动态shape导致的recompile开销。想问问各位,实际生产环境里大家真的在开compile吗?还是说只对特定模型尺寸/批大小有效?另外我的输入长度是变化的,是不是这个原因?有没有什么经验性的选择标准,比如什么条件下才值得花时间调compile?谢谢。