刚入坑深度学习没多久,做一个小目标检测模型(YOLOv5s改的),在PyTorch里用FP16推理一张图大概8ms,转成TensorRT(FP16)后反而变成12ms了,直接裂开。我查了一下,有人说可能是模型太小,TensorRT的优化对计算密集型任务才有用,但我这个模型也就几十层卷积,难道真不适合?还是说我导出时哪里没配置对?目前用的onnx转trt,动态batch设了1,有没有老哥指点一下排查思路?另外,如果模型小的话,是不是用onnxruntime或者openvino更合适?提前谢谢了。