For the complete documentation index, see llms.txt. This page is also available as Markdown.

Inference ライブラリ

サーバーや HTTP の往復なしで、`inference` パッケージを使って自分の Python プロセス内で直接モデルを実行します。

その 推論 Python パッケージはモデルを読み込み、あなた自身のプロセス内で実行します。起動するコンテナも、あなたのコードとモデルの間の HTTP リクエストもないため、セルフホストでは最も低遅延で、既存の Python アプリケーションに組み込むのも最も簡単です。

アプリケーションが Python で、モデルと同じマシン上で動作する場合に使ってください。複数のクライアント、言語、または動画ストリームに対して予測が必要な場合や、モデルをアプリケーションの依存関係から分離したい場合は、 Inference Server 代わりに Inference Server を使ってください。どちらも同じ model_id 値を受け付けるため、後から切り替えるのは小さな変更で済みます。

インストール

pip install inference

NVIDIA GPU をお持ちの場合は、代わりに inference-gpu をインストールしてください:

pip install --extra-index-url https://download.pytorch.org/whl/cu124 inference-gpu

合わせてください --extra-index-url を OS にインストールされている CUDA のバージョンに: https://download.pytorch.org/whl/cu<major><minor>、たとえば https://download.pytorch.org/whl/cu130 CUDA 13.0 用です。GPU のインストールには OS 上の CUDA が必要です。 Linux または Windows 環境に必要な依存関係がない場合は、CUDA インストールガイドを参照してください。

から 推論 1.2.0 では、新しい推論エンジン(inference-models)がデフォルトです。TensorRT を含む複数のモデルバックエンドをサポートし、お使いのハードウェアで利用可能な最速のものを選択します。 推論 がインストールするものは torchonnx モデルに必要なものです。その他のバックエンドはパッケージの extras から利用できます:

pip install inference-models[trt10]

Windows では CUDA のセットアップに追加手順があります。参照: Windows に Bare Metal Inference GPU をインストールする.

モデルを実行する

from inference import get_model

image = "https://media.roboflow.com/inference/people-walking.jpg"
model = get_model(model_id="rfdetr-small")
results = model.infer(image)

get_model() は、初回使用時にモデルの重みをダウンロードしてキャッシュし、その後ローカルで推論を実行します。 model_id は、事前学習済みのエイリアス、独自にファインチューニングしたモデル、または Universe モデルのいずれかです。参照: モデル ID。ファインチューニング済みモデルと Universe モデルには API キー.

結果を可視化する

インストール Supervision を使って予測に注釈を付けます:

動画とワークフロー

ほとんどの動画アプリケーションでは、 Inference Server を実行し、 Inference SDK WebRTC クライアントでモデルまたは Workflow をストリーミングします.

意図的に Python プロセス内で Inference Library を実行する場合は、 InferencePipeline は、サーバーなしでウェブカメラ、RTSP カメラ、または動画ファイルを処理できます。この直接ライブラリ API により、プロセスはフレーム、カスタム推論ロジック、およびシンクにアクセスできます。参照: Inference Pipeline.

さらに進む

最終更新

役に立ちましたか?