> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/hi/self-hosted/inference-library.md).

# Inference Library

द `इन्फरेंस` Python पैकेज मॉडल लोड करता है और उन्हें आपके अपने प्रोसेस के अंदर चलाता है। शुरू करने के लिए कोई कंटेनर नहीं होता और आपके कोड तथा मॉडल के बीच कोई HTTP अनुरोध नहीं होता, इसलिए यह self-host करने का सबसे कम-लेटेंसी वाला तरीका है और किसी मौजूदा Python एप्लिकेशन में एम्बेड करने का सबसे सरल तरीका है।

इसे तब उपयोग करें जब आपका एप्लिकेशन Python में हो और मॉडल के समान मशीन पर चलता हो। यदि कई क्लाइंट, भाषाएँ, या वीडियो स्ट्रीम्स को पूर्वानुमान चाहिए, या आप मॉडलों को अपने एप्लिकेशन की dependencies से अलग रखना चाहते हैं, तो चलाएँ [इन्फरेंस सर्वर](/deployment/hi/self-hosted/inference-server.md) इसके बजाय। दोनों एक ही `model_id` मान स्वीकार करते हैं, इसलिए बाद में बदलना एक छोटा-सा बदलाव है।

## इंस्टॉल करें

```bash
pip install inference
```

यदि आपके पास NVIDIA GPU है, तो `inference-gpu` इंस्टॉल करें:

```bash
pip install --extra-index-url https://download.pytorch.org/whl/cu124 inference-gpu
```

मिलाएँ `--extra-index-url` को आपके OS में इंस्टॉल किए गए CUDA संस्करण के साथ: `https://download.pytorch.org/whl/cu<major><minor>`, उदाहरण के लिए `https://download.pytorch.org/whl/cu130` CUDA 13.0 के लिए। GPU इंस्टॉलेशन के लिए OS में CUDA आवश्यक है। यदि आपके environment में dependencies नहीं हैं, तो [Linux](https://docs.nvidia.com/cuda/cuda-installation-guide-linux/) या [Windows](https://docs.nvidia.com/cuda/cuda-installation-guide-microsoft-windows/) के CUDA इंस्टॉलेशन गाइड देखें।

से शुरू होकर `इन्फरेंस` 1.2.0, नया inference engine (`inference-models`) डिफ़ॉल्ट है। यह TensorRT सहित कई model backends को सपोर्ट करता है, और आपके हार्डवेयर के लिए उपलब्ध सबसे तेज़ वाले को चुनता है। `इन्फरेंस` वही इंस्टॉल करता है जो `torch` और `onnx` मॉडल्स को चाहिए; अन्य backends package extras से आते हैं:

```bash
pip install inference-models[trt10]
```

Windows पर, CUDA सेटअप में अतिरिक्त चरण होते हैं: देखें [Windows पर Bare Metal Inference GPU इंस्टॉल करें](/deployment/hi/self-hosted/inference-library/bare-metal-gpu-windows.md).

## मॉडल चलाएँ

```python
from inference import get_model

image = "https://media.roboflow.com/inference/people-walking.jpg"
model = get_model(model_id="rfdetr-small")
results = model.infer(image)
```

`get_model()` पहली बार उपयोग पर मॉडल वेट्स डाउनलोड करता है और कैश करता है, फिर स्थानीय रूप से inference चलाता है। `model_id` एक pre-trained alias, आपका अपना fine-tuned model, या Universe model हो सकता है: देखें [मॉडल ID](/deployment/hi/self-hosted/self-hosted.md#model-ids). Fine-tuned और Universe models के लिए एक [API कुंजी](https://docs.roboflow.com/reference/authentication/authentication/find-your-roboflow-api-key).

## परिणामों को विज़ुअलाइज़ करें

इंस्टॉल करें [Supervision](https://supervision.roboflow.com) पूर्वानुमानों को एनोटेट करने के लिए:

```bash
pip install -U supervision
```

```python
import supervision as sv
from inference import get_model

image = sv.load_image_from_url("https://media.roboflow.com/inference/people-walking.jpg")

model = get_model(model_id="rfdetr-medium")
results = model.infer(image)[0]

detections = sv.Detections.from_inference(results)

annotated_image = sv.BoxAnnotator().annotate(scene=image, detections=detections)
annotated_image = sv.LabelAnnotator().annotate(scene=annotated_image, detections=detections)

sv.plot_image(annotated_image)
```

## वीडियो और वर्कफ़्लोज़

अधिकांश वीडियो एप्लिकेशन के लिए, एक चलाएँ [इन्फरेंस सर्वर](/deployment/hi/self-hosted/inference-server.md) और इसमें एक model या Workflow को इसके माध्यम से stream करें with the [Inference SDK WebRTC क्लाइंट](https://docs.roboflow.com/reference/inference/inference-sdk/webrtc).

यदि आप जानबूझकर Inference Library को अपने Python प्रोसेस के अंदर चलाते हैं, `InferencePipeline` बिना सर्वर के वेबकैम, RTSP कैमरा, या वीडियो फ़ाइल को प्रोसेस कर सकता है। यह direct-library API आपके प्रोसेस को frames, custom inference logic, और sinks तक पहुँच देता है। देखें [Inference Pipeline](https://docs.roboflow.com/reference/inference/inference-python/inference-pipeline).

## आगे बढ़ते हुए

* [Inference Python Package संदर्भ](https://docs.roboflow.com/reference/inference/inference-python) - पूरा API surface।
* [मूल Python API](https://docs.roboflow.com/reference/inference/inference-python/native-python-api) - सर्वर के बिना मॉडल लोड करें और Workflows चलाएँ।
* [मॉडल वेट्स डाउनलोड](https://docs.roboflow.com/reference/inference/inference-python/offline-weights) - ऑफ़लाइन और air-gapped hosts के लिए वेट्स कैश करें।
* [Inference बेंचमार्क्स](https://docs.roboflow.com/reference/inference/inference-python/benchmarks) - मॉडल और हार्डवेयर के अनुसार मापा गया throughput।
