For the complete documentation index, see llms.txt. This page is also available as Markdown.

추론 벤치마크

NVIDIA L4 및 Jetson Orin NX에서 RF-DETR, YOLOv8, ResNet, ViT 모델의 처리량을 측정하고, ONNX와 TensorRT를 비교합니다.

이 페이지에는 다양한 하드웨어 플랫폼에서 Inference로 실행되는 여러 모델의 성능 벤치마크가 포함되어 있습니다.

NVIDIA L4 GPU

객체 탐지

객체 탐지 모델의 성능 벤치마크로, 표준 ONNX 런타임과 TensorRT 최적화 어댑터를 비교합니다:

모델 유형
크기
초당 추론 수(ONNX)
초당 추론 수(TRT)
성능 향상 배수

rfdetr-nano

384x384

103.5

299.5

2.9

rfdetr-small

512x512

57.4

253.4

4.4

rfdetr-medium

576x576

62.8

201.8

3.2

rfdetr-large

704x704

36.9

160.5

4.3

rfdetr-xlarge

700x700

18.1

96.1

5.3

rfdetr-2xlarge

880x880

17.4

74.1

4.3

분할

인스턴스 분할 모델의 성능 벤치마크:

모델 유형
크기
초당 추론 수(ONNX)
초당 추론 수(TRT)
성능 향상 배수

rfdetr-seg-nano

312x312

51.9

105.3

2.0

rfdetr-seg-small

384x384

57.5

126.7

2.2

rfdetr-seg-medium

432x432

39.7

99.7

2.5

rfdetr-seg-large

504x504

32.8

93.2

2.8

rfdetr-seg-xlarge

624x624

17

68.8

4.0

rfdetr-seg-2xlarge

768x768

10.7

59

5.5

분류

분류 모델의 성능 벤치마크:

모델 유형
크기
초당 추론 수(ONNX)
초당 추론 수(TRT)
성능 향상 배수

ResNet50

224x224

358.6

600.8

1.7

ViT

224x224

238

306.5

1.3

Jetson Orin NX

객체 탐지

Jetson Orin NX에서의 객체 탐지 모델 성능 벤치마크:

모델 유형
크기
초당 추론 수(ONNX)
초당 추론 수(TRT)
성능 향상 배수

rfdetr-nano

384x384

21.2

78.5

3.7

rfdetr-small

512x512

13.9

52.5

3.8

rfdetr-medium

576x576

11

44

4.0

yolov8n-640

640x640

35.6

89

2.5

yolov8s-640

640x640

26.3

69.5

2.6

yolov8m-640

640x640

13.5

44.5

3.3

yolov8l-640

640x640

9

32.5

3.6

yolov8x-640

640x640

6.4

22

3.4

벤치마크 방법론

모든 벤치마크는 다음을 사용하여 수행되었습니다. Inference CLI, 단일 이미지(배치 크기 1, -bs 1) 500회 반복에 걸쳐 (-bi 500).

  • 초당 추론 수(ONNX) - 표준 ONNX 런타임, 다음을 사용해 측정:

  • 초당 추론 수(TRT) - TensorRT 최적화 어댑터(다음에서 지원: 추론 1.0 이상), 다음을 사용해 측정:

마지막 업데이트

도움이 되었나요?