For the complete documentation index, see llms.txt. This page is also available as Markdown.

Inference のベンチマーク

inference benchmark を使って、Inference Server または inference Python パッケージのスループットとレイテンシを測定します。

推論ベンチマーク お使いの環境でInferenceの性能を簡単に確認する方法を提供します。このコマンドは、Inference Serverと 推論 Pythonパッケージ。

〜のベンチマーク 推論 Pythonパッケージ

基本的なベンチマークは、次のコマンドで実行できます:

inference benchmark python-package-speed \
  -m {your_model_id} \
  -d {事前設定済みのデータセット名、または画像が入ったディレクトリへのパス} \
  -o {出力ディレクトリ}

このコマンドは、指定したモデルを使用して指定回数の推論を実行し、統計情報(ベンチマークのパラメータ、スループット、レイテンシー、エラー、プラットフォームの詳細を含む)を指定したディレクトリに保存します。

Inference Serverのベンチマーク

ローカルのInference ServerでAPIベンチマークを実行する前に、サーバーが起動して稼働していることを確認してください:

inference server start

基本的なベンチマークは、次のコマンドで実行できます:

このコマンドは、指定したモデルを使用して指定回数の推論を実行し、統計情報(ベンチマークのパラメータ、スループット、レイテンシー、エラー、プラットフォームの詳細を含む)を指定したディレクトリに保存します。

このベンチマークには、HTTP APIのさまざまなプロファイリング方法に対応するための、より多くの設定オプションがあります。デフォルトモードでは、1つのクライアントが生成され、1件ずつ順番にリクエストを送信します。特定のケースでは最適でない場合があるため、次のオプションを使用して同時クライアント数を指定できます: -c {クライアント数} オプション。各クライアントは、前のリクエストが処理されると次のリクエストを送信します。

このオプションでも、すべてのテストシナリオをカバーできるわけではありません。たとえば、 x 毎秒リクエストを送信したい場合があります。これは、複数のクライアントが同時にリクエストを送る本番環境により近い挙動です。このシナリオでは、 --rps {値} オプションを使用できます(また -c は無視されます)。 --rps は、何件のリクエストを生成するかを指定します 毎秒 前のリクエストの処理を待たずに実行されます。I/O集約型のベンチマークシナリオでは、コマンドを複数の別プロセス、場合によっては複数ホストから実行することを推奨します。

参照 Inference Benchmarks このコマンドで測定された公開済み結果を確認してください。

最終更新

役に立ちましたか?