最近在部署一个分割模型(DeepLabV3+,backbone是ResNet50),PyTorch里跑测试集mIOU有0.78,转成ONNX后拿onnxruntime验证精度几乎没掉,但用trtexec转成TensorRT FP16后,输出mask明显有噪点,边界也不对。我试过调整dynamic shape范围和batch size,也关了FP16用FP32,问题还是存在。有人说可能是某些算子在TRT里实现有差异,也有人让我检查一下预处理里的归一化是不是被融合掉了。有没有大佬踩过类似的坑?是不是必须得用onnx-simplifier或者手动改网络结构才行?求个排查思路,谢谢!