> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/hi/self-hosted/inference-server/install/linux.md).

# Linux पर इंस्टॉल करें

अपनी मशीन के लिए सही कंटेनर को, अच्छे डिफ़ॉल्ट सेटिंग्स (एक कैश वॉल्यूम और एक सुरक्षित, गैर-विशेषाधिकार प्राप्त निष्पादन मोड) के साथ, शुरू करने का सबसे आसान तरीका है CLI को इसे चुनने और इसे इसके साथ शुरू करने देना `inference server start`. [पहले Docker इंस्टॉल करें](https://docs.docker.com/engine/install/) पहले:

```bash
pip install inference-cli
inference server start
```

## कंटेनर को मैन्युअल रूप से शुरू करना

यदि आप कंटेनर सेटिंग्स पर अधिक नियंत्रण चाहते हैं, तो इसे स्वयं शुरू करें।

{% tabs %}
{% tab title="CPU" %}
मुख्य CPU Docker इमेज onnxruntime के माध्यम से x64 CPUs पर OpenVINO acceleration के लिए समर्थन शामिल करती है। SAM2 जैसे भारी मॉडल बहुत धीमे चल सकते हैं (प्रति image कई दर्जन सेकंड) जिससे वे व्यावहारिक नहीं रहते; यदि आपको उनकी आवश्यकता है, तो CUDA-सक्षम GPU का उपयोग करें।

CPU inference के प्राथमिक उपयोग-केस स्थिर चित्रों को प्रोसेस करना (उदाहरण के लिए uploads का NSFW classification या document verification) या वीडियो से frames का कम-आवृत्ति sampling करना (उदाहरण के लिए parking lot की occupancy tracking) हैं।

CPU inference शुरू करने के लिए, उपयोग करें `roboflow/roboflow-inference-server-cpu:latest` कंटेनर।

```bash
sudo docker run -d \\
    --name inference-server \\
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-cpu:latest
```

{% endtab %}

{% tab title="GPU" %}
GPU कंटेनर NVIDIA-Docker के माध्यम से CUDA को सपोर्ट करने वाले कार्डों पर हार्डवेयर एक्सेलेरेशन जोड़ता है। अनुसरण करें [NVIDIA कंटेनर टूलकिट स्थापना मार्गदर्शिका](https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/install-guide.html), फिर जोड़ें `--gpus all` को `docker run` कमांड:

```bash
sudo docker run -d \\
    --name inference-server \\
    --gpus all \
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-gpu:latest
```

{% endtab %}

{% tab title="TensorRT" %}
GPU कंटेनर के साथ आप वैकल्पिक रूप से सक्षम कर सकते हैं [TensorRT](https://developer.nvidia.com/tensorrt)NVIDIA का मॉडल अनुकूलन रनटाइम। यह भारी संकलन और अनुकूलन चरण (कभी-कभी 15+ मिनट) की कीमत पर आपके मॉडल की गति को बहुत बढ़ा देता है, जो आप प्रत्येक मॉडल को पहली बार लोड करते समय होता है।

TensorRT सक्षम करें यह जोड़कर `TensorrtExecutionProvider` को `ONNXRUNTIME_EXECUTION_PROVIDERS` पर्यावरण चर।

```bash
sudo docker run -d \\
    --name inference-server \\
    --gpus all \
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    -e ONNXRUNTIME_EXECUTION_PROVIDERS="[TensorrtExecutionProvider,CUDAExecutionProvider,OpenVINOExecutionProvider,CPUExecutionProvider]" \
    roboflow/roboflow-inference-server-gpu:latest
```

{% endtab %}
{% endtabs %}

## Docker Compose

यदि आप अपने एप्लिकेशन के लिए Docker Compose का उपयोग करते हैं, तो समकक्ष YAML है:

{% tabs %}
{% tab title="CPU" %}

```yaml
version: "3.9"

सेवाएँ:
  inference-server:
    container_name: inference-server
    image: roboflow/roboflow-inference-server-cpu:latest

    read_only: true
    पोर्ट्स:
      - "9001:9001"

    वॉल्यूम्स:
      - "${HOME}/.inference/cache:/tmp:rw"

    security_opt:
      - no-new-privileges
    cap_drop:
      - ALL
    cap_add:
      - NET_BIND_SERVICE
```

{% endtab %}

{% tab title="GPU" %}

```yaml
version: "3.9"

सेवाएँ:
  inference-server:
    container_name: inference-server
    image: roboflow/roboflow-inference-server-gpu:latest

    read_only: true
    पोर्ट्स:
      - "9001:9001"

    वॉल्यूम्स:
      - "${HOME}/.inference/cache:/tmp:rw"

    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]

    security_opt:
      - no-new-privileges
    cap_drop:
      - ALL
    cap_add:
      - NET_BIND_SERVICE
```

{% endtab %}

{% tab title="TensorRT" %}

```yaml
version: "3.9"

सेवाएँ:
  inference-server:
    container_name: inference-server
    image: roboflow/roboflow-inference-server-gpu:latest

    read_only: true
    पोर्ट्स:
      - "9001:9001"

    वॉल्यूम्स:
      - "${HOME}/.inference/cache:/tmp:rw"

    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]

    environment:
      ONNXRUNTIME_EXECUTION_PROVIDERS: "[TensorrtExecutionProvider,CUDAExecutionProvider,OpenVINOExecutionProvider,CPUExecutionProvider]"

    security_opt:
      - no-new-privileges
    cap_drop:
      - ALL
    cap_add:
      - NET_BIND_SERVICE
```

{% endtab %}
{% endtabs %}

{% hint style="info" %}
Roboflow Enterprise योजनाएँ जोड़ती हैं [एक Helm chart](https://github.com/roboflow/inference/tree/main/inference/enterprise/helm-chart) Kubernetes परिनियोजनों, OT नेटवर्क के लिए नेटवर्किंग समाधानों, और अनुकूलित सहायता तथा स्थापना पैकेजों के लिए। [बिक्री टीम से संपर्क करें](https://roboflow.com/sales) अधिक जानने के लिए।
{% endhint %}

## अगले चरण

* [मॉडल चलाएँ](/deployment/hi/self-hosted/self-hosted.md#run-a-model) अपने नए सर्वर के विरुद्ध।
* [Docker कॉन्फ़िगरेशन विकल्प](/deployment/hi/self-hosted/inference-server/configuration/docker-configuration.md) पोर्ट, कैशिंग, और मॉडल सीमाओं के लिए।
* [self-hosted सर्वर को सुरक्षित करना](/deployment/hi/self-hosted/inference-server/configuration/security.md) उसे localhost से बाहर उजागर करने से पहले।
