For the complete documentation index, see llms.txt. This page is also available as Markdown.

Workflows 벤치마크

워크플로에 래핑된 동일한 모델과 비교한 직접 모델 추론의 지연 시간입니다.

이 페이지는 비교합니다 직접 모델 추론 지연 시간 대 워크플로우로 감싼 추론 지연 시간을 인기 있는 탐지 모델들에 대해 비교합니다. 목표는 Workflows 실행 엔진이 도입하는 오버헤드를 정량화하는 것입니다.

자가 호스팅 결과

모든 시간 단위는 밀리초. 벤치마크는 서버급 NVIDIA GPU에서 TensorRT로 최적화된 모델을 사용해 실행되었으며, 모델은 inference Python 패키지를 통해 직접 호출되었습니다. 각 모델은 측정 전에 워밍업되었고, 이후 10회 반복으로 측정되었습니다.

모델
직접 평균(ms)
워크플로우 평균(ms)
워크플로우 오버헤드(ms)

rfdetr-nano

2.65

4.40

1.75

rfdetr-small

3.17

4.62

1.45

rfdetr-medium

3.79

5.38

1.59

rfdetr-large

4.87

7.46

2.59

rfdetr-xlarge

8.44

10.65

2.21

yolo26n-640

2.42

4.07

1.65

yolo26s-640

3.25

5.48

2.23

yolo26m-640

4.56

6.29

1.73

yolo26l-640

5.76

8.01

2.25

yolo26x-640

7.75

9.36

1.61

핵심 요점

  • 워크플로우 오버헤드는 최소입니다 - 보통 모델 크기와 관계없이 직접 추론 위에 1.5~2.6ms 정도만 추가됩니다.

  • 더 큰 모델의 경우(예: rfdetr-xlarge), 워크플로우 오버헤드는 모델 추론 시간에 비해 작습니다(~26%).

  • 더 작고 빠른 모델의 경우(예: yolo26n-640), 오버헤드는 비례적으로 더 크지만 절대값으로는 여전히 2ms 미만입니다.

  • 워크플로우 오버헤드는 CPU에 묶여 있습니다(그래프 스케줄링, 입력 준비, 출력 라우팅). 반면 모델 추론 자체는 일반적으로 GPU에서 실행됩니다(사용 가능한 경우). 그 결과, GPU 속도와 관계없이 오버헤드는 비교적 일정하게 유지됩니다.

방법론

  • GPU 가속 추론(결과는 하드웨어에 따라 달라질 수 있습니다).

  • 워밍업: 각 모델과 워크플로우 엔진은 측정 시작 전에 한 번의 추론 호출로 워밍업됩니다.

  • 반복 횟수: 모델별, 방법별로 10회 측정합니다.

  • 직접 추론: get_model() 을 사용하고 model.infer() 를 직접 호출합니다.

  • 워크플로우 추론: 동일한 모델을 최소 단일 단계 워크플로우로 감싸서 실행 엔진.

벤치마크 스크립트를 펼치려면 클릭

클라우드 호스팅 결과

다음 결과는 호스팅된 Serverless Cloud API. 몇 가지 참고 사항:

  • 자가 호스팅 결과와 비교하면, Serverless 서버는 워크플로우 스키마와 모델 가중치도 가져와야 합니다(반면 Serverless 모델 추론은 가중치만 가져옵니다)

  • 워크플로우에는 고정적인 10~50ms 지연 오버헤드가 있습니다

Serverless 벤치마크 워크플로우

마지막 업데이트

도움이 되었나요?