For the complete documentation index, see llms.txt. This page is also available as Markdown.

Linux에 설치

Inference CLI, Docker 또는 Docker Compose를 사용해 CPU, GPU 또는 TensorRT에서 Linux에 Roboflow 추론 서버를 설치하고 실행하세요.

기기에 맞는 올바른 컨테이너를 시작하는 가장 쉬운 방법은, 좋은 기본 설정(캐시 볼륨과 안전한 비권한 실행 모드)과 함께 CLI가 선택하고 시작하도록 하는 것입니다. 다음을 사용하여 inference server start. Docker를 설치한 다음 먼저:

pip install inference-cli
inference server start

컨테이너를 수동으로 시작하기

컨테이너 설정을 더 세부적으로 제어하려면 직접 시작하세요.

핵심 CPU Docker 이미지는 onnxruntime를 통해 x64 CPU에서 OpenVINO 가속을 지원합니다. SAM2와 같은 무거운 모델은 실용적이지 않을 정도로 느리게 실행될 수 있습니다(이미지당 수십 초). 이러한 모델이 필요하면 CUDA를 지원하는 GPU를 사용하세요.

CPU 추론의 주요 사용 사례는 정지 이미지 처리(예: 업로드의 NSFW 분류 또는 문서 검증) 또는 비디오 프레임의 비정기적 샘플링(예: 주차장의 점유 현황 추적)입니다.

CPU 추론을 시작하려면 다음을 사용하세요 roboflow/roboflow-inference-server-cpu:latest 컨테이너.

sudo docker run -d \\
    --name inference-server \\
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-cpu:latest

GPU 컨테이너는 NVIDIA-Docker를 통해 CUDA를 지원하는 카드에 하드웨어 가속을 추가합니다. 다음을 따르세요. NVIDIA Container Toolkit 설치 가이드한 다음, 다음을 추가하세요 --gpus alldocker run 명령:

sudo docker run -d \\
    --name inference-server \\
    --gpus all \\
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-gpu:latest

GPU 컨테이너에서는 선택적으로 다음을 활성화할 수 있습니다 TensorRT를 활성화할 수 있습니다. 이는 NVIDIA의 모델 최적화 런타임입니다. 각 모델을 처음 로드할 때 무거운 컴파일 및 최적화 단계(때로는 15분 이상)가 필요하므로, 모델 속도를 크게 향상시키는 대신 비용이 발생합니다.

다음을 추가하여 TensorRT를 활성화하세요 TensorrtExecutionProviderONNXRUNTIME_EXECUTION_PROVIDERS 환경 변수.

Docker Compose

애플리케이션에 Docker Compose를 사용하는 경우, 이에 해당하는 YAML은 다음과 같습니다:

Roboflow Enterprise 요금제에는 Kubernetes 배포용 Helm 차트 Kubernetes 배포, OT 네트워크용 네트워킹 솔루션, 그리고 맞춤형 지원 및 설치 패키지를 위한 영업팀에 문의하세요 자세한 내용을 알아보세요.

다음 단계

마지막 업데이트

도움이 되었나요?