最近在做一个端侧部署的小项目,模型是ResNet18改的,训练时用PyTorch,FP16大概2ms一张图。转成ONNX后用onnxruntime跑,CPU和GPU都试了,结果比PyTorch直接推理慢了将近一倍,简直离谱。我试过opset_version从11调到17,也试过optimize=True,甚至关了dynamic_axes,还是没改善。网上说ONNX有图优化,但我看日志好像很多fusion都没触发。有没有人遇到过类似情况?是不是我导出的时候漏了什么参数,或者runtime的session配置有问题?求指点,谢谢!