For the complete documentation index, see llms.txt. This page is also available as Markdown.

추론 벤치마크 실행

inference benchmark로 Inference Server 또는 inference Python 패키지의 처리량과 지연 시간을 측정하세요.

추론 벤치마크 설정에서 추론 성능을 쉽게 확인할 수 있는 방법을 제공합니다. 이 명령은 추론 서버와 추론 Python 패키지.

다음 항목의 벤치마킹 추론 Python 패키지

다음 명령을 사용하여 기본 벤치마크를 실행할 수 있습니다:

inference benchmark python-package-speed \
  -m {your_model_id} \
  -d {사전 구성된 데이터셋 이름 또는 이미지가 있는 디렉터리 경로} \
  -o {출력_디렉터리}

이 명령은 지정한 모델을 사용해 지정된 횟수의 추론을 실행하고, 통계(벤치마크 매개변수, 처리량, 지연 시간, 오류, 플랫폼 세부 정보 포함)를 지정한 디렉터리에 저장합니다.

추론 서버 벤치마킹

로컬 추론 서버의 API 벤치마크를 실행하기 전에 서버가 실행 중인지 확인하세요:

inference server start

다음 명령을 사용하여 기본 벤치마크를 실행할 수 있습니다:

이 명령은 지정한 모델을 사용해 지정된 횟수의 추론을 실행하고, 통계(벤치마크 매개변수, 처리량, 지연 시간, 오류, 플랫폼 세부 정보 포함)를 지정한 디렉터리에 저장합니다.

이 벤치마크는 HTTP API 프로파일링의 다양한 방식을 지원하기 위해 더 많은 구성 옵션을 제공합니다. 기본 모드에서는 단일 클라이언트가 생성되어 요청을 하나씩 순차적으로 보냅니다. 특정 경우에는 이것이 최적이 아닐 수 있으므로, 다음 옵션을 사용해 동시 클라이언트 수를 지정할 수 있습니다: -c {클라이언트 수} 옵션. 각 클라이언트는 이전 요청이 처리되면 다음 요청을 보냅니다.

이 옵션으로도 모든 테스트 시나리오를 다 다루지는 못합니다. 예를 들어, x 개의 요청을 매초 보낼 수 있는데, 이는 여러 클라이언트가 동시에 요청을 보내는 프로덕션 환경에 더 가깝습니다. 이 시나리오에서는 --rps {값} 옵션을 사용할 수 있으며( -c 는 무시됩니다). 제공된 --rps 생성되는 요청 수를 지정합니다 매초 이전 요청의 처리 완료를 기다리지 않고요. I/O 집약적인 벤치마크 시나리오에서는 이 명령을 여러 개의 별도 프로세스와 가능하면 여러 호스트에서 실행할 것을 권장합니다.

다음을 참조하세요 추론 벤치마크 이 명령으로 측정된 공개 결과를 보려면.

마지막 업데이트

도움이 되었나요?