추론 벤치마크
NVIDIA L4 및 Jetson Orin NX에서 RF-DETR, YOLOv8, ResNet, ViT 모델의 처리량을 측정하고, ONNX와 TensorRT를 비교합니다.
마지막 업데이트
도움이 되었나요?
NVIDIA L4 및 Jetson Orin NX에서 RF-DETR, YOLOv8, ResNet, ViT 모델의 처리량을 측정하고, ONNX와 TensorRT를 비교합니다.
이 페이지에는 다양한 하드웨어 플랫폼에서 Inference로 실행되는 여러 모델의 성능 벤치마크가 포함되어 있습니다.
객체 탐지 모델의 성능 벤치마크로, 표준 ONNX 런타임과 TensorRT 최적화 어댑터를 비교합니다:
rfdetr-nano
384x384
103.5
299.5
2.9
rfdetr-small
512x512
57.4
253.4
4.4
rfdetr-medium
576x576
62.8
201.8
3.2
rfdetr-large
704x704
36.9
160.5
4.3
rfdetr-xlarge
700x700
18.1
96.1
5.3
rfdetr-2xlarge
880x880
17.4
74.1
4.3
인스턴스 분할 모델의 성능 벤치마크:
rfdetr-seg-nano
312x312
51.9
105.3
2.0
rfdetr-seg-small
384x384
57.5
126.7
2.2
rfdetr-seg-medium
432x432
39.7
99.7
2.5
rfdetr-seg-large
504x504
32.8
93.2
2.8
rfdetr-seg-xlarge
624x624
17
68.8
4.0
rfdetr-seg-2xlarge
768x768
10.7
59
5.5
분류 모델의 성능 벤치마크:
ResNet50
224x224
358.6
600.8
1.7
ViT
224x224
238
306.5
1.3
Jetson Orin NX에서의 객체 탐지 모델 성능 벤치마크:
rfdetr-nano
384x384
21.2
78.5
3.7
rfdetr-small
512x512
13.9
52.5
3.8
rfdetr-medium
576x576
11
44
4.0
yolov8n-640
640x640
35.6
89
2.5
yolov8s-640
640x640
26.3
69.5
2.6
yolov8m-640
640x640
13.5
44.5
3.3
yolov8l-640
640x640
9
32.5
3.6
yolov8x-640
640x640
6.4
22
3.4
모든 벤치마크는 다음을 사용하여 수행되었습니다. Inference CLI, 단일 이미지(배치 크기 1, -bs 1) 500회 반복에 걸쳐 (-bi 500).
초당 추론 수(ONNX) - 표준 ONNX 런타임, 다음을 사용해 측정:
초당 추론 수(TRT) - TensorRT 최적화 어댑터(다음에서 지원: 추론 1.0 이상), 다음을 사용해 측정:
마지막 업데이트
도움이 되었나요?
도움이 되었나요?
inference benchmark python-package-speed -m [model]USE_INFERENCE_MODELS=TRUE inference benchmark python-package-speed -m [model]