For the complete documentation index, see llms.txt. This page is also available as Markdown.

Linux にインストール

Inference CLI、Docker、または Docker Compose を使って、CPU、GPU、または TensorRT 上で Roboflow Inference Server を Linux にインストールして実行します。

お使いのマシンに適した正しいコンテナを、良いデフォルト設定(キャッシュ用ボリュームと、安全な非特権実行モード)で起動する最も簡単な方法は、CLI に選択させて次で起動することです inference server start. Docker をインストール まず:

pip install inference-cli
inference server start

コンテナを手動で起動する

コンテナー設定をさらに細かく制御したい場合は、自分で起動してください。

コア CPU Docker イメージには、onnxruntime を介した x64 CPU 上での OpenVINO アクセラレーションのサポートが含まれています。SAM2 のような重いモデルは、実用にならないほど遅く(画像 1 枚あたり数十秒)、もし必要なら CUDA 対応 GPU を使用してください。

CPU 推論の主なユースケースは、静止画像の処理(たとえばアップロードの NSFW 分類や書類の検証)や、動画からのフレームのまれなサンプリング(たとえば駐車場の混雑状況の追跡)です。

CPU 推論を始めるには、を使用してください roboflow/roboflow-inference-server-cpu:latest コンテナー。

sudo docker run -d \\
    --name inference-server \\
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-cpu:latest

GPU コンテナは、NVIDIA-Docker を介して CUDA をサポートするカードにハードウェアアクセラレーションを追加します。以下に従ってください NVIDIA Container Toolkit のインストールガイド、その後に --gpus alldocker run コマンド:

sudo docker run -d \\
    --name inference-server \\
    --gpus all \
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-gpu:latest

GPU コンテナーでは、必要に応じて TensorRT、NVIDIA のモデル最適化ランタイムを有効にできます。各モデルを初めて読み込む際に重いコンパイルと最適化の工程(場合によっては 15 分以上)が発生する代わりに、モデルの速度を大幅に向上させます。

次を追加して TensorRT を有効にします TensorrtExecutionProviderONNXRUNTIME_EXECUTION_PROVIDERS 環境変数を有効にできます。

Docker Compose

アプリケーションで Docker Compose を使う場合、同等の YAML は次のとおりです。

Roboflow Enterprise プランでは次が追加されます Helm チャート Kubernetes デプロイメント、OT ネットワーク向けのネットワークソリューション、およびカスタマイズされたサポートとインストールパッケージ向けです。 営業チームにお問い合わせください 詳細はこちら。

次の手順

最終更新

役に立ちましたか?