最近在试着用LLaMA-7B做点微调后的推理优化,看到PyTorch 2.0的torch.compile宣传得很猛,说是能显著减少kernel launch开销。但我自己在A100上测了一下,同样是fp16推理,用inductor模式反而比eager模式慢了大概15%,而且显存占用还高了。是不是我哪里设置不对?还是说compile对动态shape(比如beam search里的变长序列)不友好?另外,看到有些项目在推vLLM或者TensorRT-LLM,是不是对这种生成式任务,现阶段压根就不该指望torch.compile?求有实战经验的大佬指点一下,别让我再瞎折腾了。