For the complete documentation index, see llms.txt. This page is also available as Markdown.

Inference Library

कोई server और कोई HTTP hop के बिना, inference package के साथ अपने स्वयं के Python process में सीधे models चलाएँ।

इन्फरेंस Python पैकेज मॉडल लोड करता है और उन्हें आपके अपने प्रोसेस के अंदर चलाता है। शुरू करने के लिए कोई कंटेनर नहीं होता और आपके कोड तथा मॉडल के बीच कोई HTTP अनुरोध नहीं होता, इसलिए यह self-host करने का सबसे कम-लेटेंसी वाला तरीका है और किसी मौजूदा Python एप्लिकेशन में एम्बेड करने का सबसे सरल तरीका है।

इसे तब उपयोग करें जब आपका एप्लिकेशन Python में हो और मॉडल के समान मशीन पर चलता हो। यदि कई क्लाइंट, भाषाएँ, या वीडियो स्ट्रीम्स को पूर्वानुमान चाहिए, या आप मॉडलों को अपने एप्लिकेशन की dependencies से अलग रखना चाहते हैं, तो चलाएँ इन्फरेंस सर्वर इसके बजाय। दोनों एक ही model_id मान स्वीकार करते हैं, इसलिए बाद में बदलना एक छोटा-सा बदलाव है।

इंस्टॉल करें

pip install inference

यदि आपके पास NVIDIA GPU है, तो inference-gpu इंस्टॉल करें:

pip install --extra-index-url https://download.pytorch.org/whl/cu124 inference-gpu

मिलाएँ --extra-index-url को आपके OS में इंस्टॉल किए गए CUDA संस्करण के साथ: https://download.pytorch.org/whl/cu<major><minor>, उदाहरण के लिए https://download.pytorch.org/whl/cu130 CUDA 13.0 के लिए। GPU इंस्टॉलेशन के लिए OS में CUDA आवश्यक है। यदि आपके environment में dependencies नहीं हैं, तो Linux या Windows के CUDA इंस्टॉलेशन गाइड देखें।

से शुरू होकर इन्फरेंस 1.2.0, नया inference engine (inference-models) डिफ़ॉल्ट है। यह TensorRT सहित कई model backends को सपोर्ट करता है, और आपके हार्डवेयर के लिए उपलब्ध सबसे तेज़ वाले को चुनता है। इन्फरेंस वही इंस्टॉल करता है जो torch और onnx मॉडल्स को चाहिए; अन्य backends package extras से आते हैं:

pip install inference-models[trt10]

Windows पर, CUDA सेटअप में अतिरिक्त चरण होते हैं: देखें Windows पर Bare Metal Inference GPU इंस्टॉल करें.

मॉडल चलाएँ

from inference import get_model

image = "https://media.roboflow.com/inference/people-walking.jpg"
model = get_model(model_id="rfdetr-small")
results = model.infer(image)

get_model() पहली बार उपयोग पर मॉडल वेट्स डाउनलोड करता है और कैश करता है, फिर स्थानीय रूप से inference चलाता है। model_id एक pre-trained alias, आपका अपना fine-tuned model, या Universe model हो सकता है: देखें मॉडल ID. Fine-tuned और Universe models के लिए एक API कुंजी.

परिणामों को विज़ुअलाइज़ करें

इंस्टॉल करें Supervision पूर्वानुमानों को एनोटेट करने के लिए:

वीडियो और वर्कफ़्लोज़

अधिकांश वीडियो एप्लिकेशन के लिए, एक चलाएँ इन्फरेंस सर्वर और इसमें एक model या Workflow को इसके माध्यम से stream करें with the Inference SDK WebRTC क्लाइंट.

यदि आप जानबूझकर Inference Library को अपने Python प्रोसेस के अंदर चलाते हैं, InferencePipeline बिना सर्वर के वेबकैम, RTSP कैमरा, या वीडियो फ़ाइल को प्रोसेस कर सकता है। यह direct-library API आपके प्रोसेस को frames, custom inference logic, और sinks तक पहुँच देता है। देखें Inference Pipeline.

आगे बढ़ते हुए

अंतिम अपडेट

क्या यह उपयोगी था?