> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/ko/self-hosted/inference-server/install/linux.md).

# Linux에 설치

기기에 맞는 올바른 컨테이너를 시작하는 가장 쉬운 방법은, 좋은 기본 설정(캐시 볼륨과 안전한 비권한 실행 모드)과 함께 CLI가 선택하고 시작하도록 하는 것입니다. 다음을 사용하여 `inference server start`. [Docker를 설치한 다음](https://docs.docker.com/engine/install/) 먼저:

```bash
pip install inference-cli
inference server start
```

## 컨테이너를 수동으로 시작하기

컨테이너 설정을 더 세부적으로 제어하려면 직접 시작하세요.

{% tabs %}
{% tab title="CPU" %}
핵심 CPU Docker 이미지는 onnxruntime를 통해 x64 CPU에서 OpenVINO 가속을 지원합니다. SAM2와 같은 무거운 모델은 실용적이지 않을 정도로 느리게 실행될 수 있습니다(이미지당 수십 초). 이러한 모델이 필요하면 CUDA를 지원하는 GPU를 사용하세요.

CPU 추론의 주요 사용 사례는 정지 이미지 처리(예: 업로드의 NSFW 분류 또는 문서 검증) 또는 비디오 프레임의 비정기적 샘플링(예: 주차장의 점유 현황 추적)입니다.

CPU 추론을 시작하려면 다음을 사용하세요 `roboflow/roboflow-inference-server-cpu:latest` 컨테이너.

```bash
sudo docker run -d \\
    --name inference-server \\
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-cpu:latest
```

{% endtab %}

{% tab title="GPU" %}
GPU 컨테이너는 NVIDIA-Docker를 통해 CUDA를 지원하는 카드에 하드웨어 가속을 추가합니다. 다음을 따르세요. [NVIDIA Container Toolkit 설치 가이드](https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/install-guide.html)한 다음, 다음을 추가하세요 `--gpus all` 를 `docker run` 명령:

```bash
sudo docker run -d \\
    --name inference-server \\
    --gpus all \\
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-gpu:latest
```

{% endtab %}

{% tab title="TensorRT" %}
GPU 컨테이너에서는 선택적으로 다음을 활성화할 수 있습니다 [TensorRT](https://developer.nvidia.com/tensorrt)를 활성화할 수 있습니다. 이는 NVIDIA의 모델 최적화 런타임입니다. 각 모델을 처음 로드할 때 무거운 컴파일 및 최적화 단계(때로는 15분 이상)가 필요하므로, 모델 속도를 크게 향상시키는 대신 비용이 발생합니다.

다음을 추가하여 TensorRT를 활성화하세요 `TensorrtExecutionProvider` 를 `ONNXRUNTIME_EXECUTION_PROVIDERS` 환경 변수.

```bash
sudo docker run -d \\
    --name inference-server \\
    --gpus all \\
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    -e ONNXRUNTIME_EXECUTION_PROVIDERS="[TensorrtExecutionProvider,CUDAExecutionProvider,OpenVINOExecutionProvider,CPUExecutionProvider]" \
    roboflow/roboflow-inference-server-gpu:latest
```

{% endtab %}
{% endtabs %}

## Docker Compose

애플리케이션에 Docker Compose를 사용하는 경우, 이에 해당하는 YAML은 다음과 같습니다:

{% tabs %}
{% tab title="CPU" %}

```yaml
version: "3.9"

services:
  inference-server:
    container_name: inference-server
    image: roboflow/roboflow-inference-server-cpu:latest

    read_only: true
    ports:
      - "9001:9001"

    volumes:
      - "${HOME}/.inference/cache:/tmp:rw"

    security_opt:
      - no-new-privileges
    cap_drop:
      - ALL
    cap_add:
      - NET_BIND_SERVICE
```

{% endtab %}

{% tab title="GPU" %}

```yaml
version: "3.9"

services:
  inference-server:
    container_name: inference-server
    image: roboflow/roboflow-inference-server-gpu:latest

    read_only: true
    ports:
      - "9001:9001"

    volumes:
      - "${HOME}/.inference/cache:/tmp:rw"

    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]

    security_opt:
      - no-new-privileges
    cap_drop:
      - ALL
    cap_add:
      - NET_BIND_SERVICE
```

{% endtab %}

{% tab title="TensorRT" %}

```yaml
version: "3.9"

services:
  inference-server:
    container_name: inference-server
    image: roboflow/roboflow-inference-server-gpu:latest

    read_only: true
    ports:
      - "9001:9001"

    volumes:
      - "${HOME}/.inference/cache:/tmp:rw"

    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]

    environment:
      ONNXRUNTIME_EXECUTION_PROVIDERS: "[TensorrtExecutionProvider,CUDAExecutionProvider,OpenVINOExecutionProvider,CPUExecutionProvider]"

    security_opt:
      - no-new-privileges
    cap_drop:
      - ALL
    cap_add:
      - NET_BIND_SERVICE
```

{% endtab %}
{% endtabs %}

{% hint style="info" %}
Roboflow Enterprise 요금제에는 [Kubernetes 배포용 Helm 차트](https://github.com/roboflow/inference/tree/main/inference/enterprise/helm-chart) Kubernetes 배포, OT 네트워크용 네트워킹 솔루션, 그리고 맞춤형 지원 및 설치 패키지를 위한 [영업팀에 문의하세요](https://roboflow.com/sales) 자세한 내용을 알아보세요.
{% endhint %}

## 다음 단계

* [모델 실행](/deployment/ko/self-hosted/self-hosted.md#run-a-model) 를 새 서버에 대해.
* [Docker 구성 옵션](/deployment/ko/self-hosted/inference-server/configuration/docker-configuration.md) 포트, 캐싱 및 모델 제한용.
* [자가 호스팅 서버 보안 설정](/deployment/ko/self-hosted/inference-server/configuration/security.md) 로컬호스트를 넘어 공개하기 전에.
