最近在试torch.compile跑一个7B的LLM做流式生成,用的贪心解码。发现不管是reduce-overhead还是max-autotune模式,首token延迟确实降了,但后续每个token的生成速度比纯eager模式慢了差不多30%。我理解编译应该对静态图有优化,但自回归生成每一步输入长度都在变,是不是这种动态shape场景根本不适合用torch.compile?还是说需要配合cudagraphs或者把KV cache的tensor固定shape才行?有没有大佬实际在生产环境里用编译模式跑过LLM推理的,求指点一下正确的调优姿势,谢谢!