For the complete documentation index, see llms.txt. This page is also available as Markdown.

Deployment विकल्प चुनना

Roboflow के deployment विकल्पों - Serverless Cloud API, Dedicated Deployments, Batch Processing, Self-Hosted Inference, और edge devices - की तुलना करें और अपने use case के लिए सही विकल्प चुनें।

Roboflow आपके मॉडलों को चलाने के कई तरीके प्रदान करता है और वर्कफ़्लोज़पूरी तरह प्रबंधित क्लाउड API से लेकर अपने स्वयं के हार्डवेयर पर इन्फ़रेंस तक। सही विकल्प इस पर निर्भर करता है कि आपका वर्कलोड रीयल-टाइम है या बल्क, आप कितनी लेटेंसी सह सकते हैं, आपका डेटा कहाँ रह सकता है, और आप कितनी इन्फ्रास्ट्रक्चर प्रबंधन करना चाहते हैं।

विकल्पों की एक नज़र में तुलना करने के लिए तालिकाओं का उपयोग करें, फिर संकुचित करने के लिए नीचे दिए निर्णय प्रवाह का पालन करें।

Roboflow क्लाउड

Roboflow इन्फ्रास्ट्रक्चर चलाता है। आप डेटा एक API एंडपॉइंट को भेजते हैं और बदले में पूर्वानुमान प्राप्त करते हैं।

यह कहाँ चलता है

Roboflow क्लाउड (serverless.roboflow.com)

Roboflow-प्रबंधित निजी क्लाउड सर्वर (*.roboflow.cloud)

Roboflow क्लाउड, जिसमें प्रत्येक जॉब के लिए इन्फ्रास्ट्रक्चर स्वतः प्राविजन होता है

GPU

हाँ: GPU-त्वरित और स्वतः-स्केलिंग

CPU (dev-cpu / prod-cpu) या GPU (dev-gpu / prod-gpu)

CPU या GPU, जॉब के आधार पर चुना जाता है

लेटेंसी प्रोफ़ाइल

रीयल-टाइम, समकालिक। किसी मॉडल के लिए पहला अनुरोध, जो पहले से लोड नहीं है, कई सेकंड का वार्मअप लेता है; फिर बाद के अनुरोध तेज़ होते हैं जबकि मॉडल कैश में रहता है।

सुसंगत, समर्पित प्रदर्शन। निष्क्रियता की अवधि के बाद डिप्लॉयमेंट स्वतः विराम लेते हैं (के लिए 1 घंटे पर निर्धारित dev-cpu / dev-gpu) और जब आप अनुरोध भेजते हैं तब फिर से शुरू होते हैं।

असमकालिक, रीयल-टाइम के लिए उपयुक्त नहीं। संसाधन उपलब्ध होने पर मशीनें प्राविजन की जाती हैं, आमतौर पर कुछ मिनटों के बाद, और आरंभ समय की सटीक गारंटी नहीं होती।

मूल्य निर्धारण

प्रसंस्करण समय के आधार पर, प्रत्येक इन्फ़रेंस के लिए क्रेडिट में मीटर किया जाता है। देखें roboflow.com/credits और सर्वरलेस मूल्य निर्धारण.

प्रति घंटा भुगतान, 1-मिनट के अंतराल में बिलिंग: GPU 1 क्रेडिट/घंटा, CPU 0.25 क्रेडिट/घंटा। अनुरोध-आधारित बिलिंग अनुरोध पर उपलब्ध है।

CPU और GPU दरें अलग हैं; GPU जॉब तेज़ होती हैं लेकिन अधिक महंगी। देखें मूल्य निर्धारण पृष्ठ.

क्षेत्र

सेल्स से संपर्क करें बेस API के लिए। वीडियो स्ट्रीमिंग API समर्थन करता है us, eu, ap.

केवल US-आधारित डेटा सेंटर।

प्लान उपलब्धता

Core और Enterprise। देखें मूल्य निर्धारण.

Growth और Enterprise।

के लिए सर्वोत्तम

रीयल-टाइम एकल-छवि या Workflow इन्फ़रेंस के लिए तेज़ी से शुरुआत करने और स्वचालित रूप से स्केल करने के लिए, जब डिप्लॉयमेंट डिवाइस के पास स्थायी इंटरनेट कनेक्शन हो।

पूर्वानुमेय या प्रोडक्शन वर्कलोड, संसाधन पृथक्करण, और बड़े मॉडल जिन्हें GPU त्वरण की आवश्यकता होती है (जैसे: Florence-2, SAM2)।

Workflow के साथ संग्रहीत छवियों और वीडियो की बड़ी मात्रा का लागत-प्रभावी प्रसंस्करण।

स्व-होस्टेड

आप अपने स्वयं के हार्डवेयर पर इन्फ़रेंस चलाते हैं, इसलिए डेटा को कभी भी आपका नेटवर्क छोड़ना नहीं पड़ता।

यह कहाँ चलता है

आपका अपना हार्डवेयर: एज डिवाइस, ऑन-प्रिम सर्वर, या आपका अपना क्लाउड (Docker या pip)

आपके एज डिवाइस, जिन्हें Roboflow द्वारा रिमोटली प्रबंधित किया जाता है

GPU

CPU, CUDA GPU, या NVIDIA Jetson

डिवाइस पर निर्भर करता है (NVIDIA Jetson, NVIDIA GPU के साथ x86, या Roboflow-प्रदत्त हार्डवेयर)

लेटेंसी प्रोफ़ाइल

स्थानीय, कम लेटेंसी, बिना नेटवर्क राउंड-ट्रिप के; पर्याप्त हार्डवेयर पर रीयल-टाइम सक्षम।

स्थानीय एज, रीयल-टाइम। रिमोट प्रबंधन और निगरानी के लिए डिवाइसों को निरंतर इंटरनेट पहुँच चाहिए।

मूल्य निर्धारण

मुफ़्त और ओपन सोर्स: इन्फ्रास्ट्रक्चर आप प्रदान और प्रबंधित करते हैं। निजी मॉडलों के लिए TensorRT-अनुकूलित पैकेज Enterprise की आवश्यकता होती है।

क्षेत्र

कहीं भी (आपका इन्फ्रास्ट्रक्चर).

आपके डिवाइस स्थान।

प्लान उपलब्धता

सभी प्लान (ओपन सोर्स)। एक से अधिक डिवाइस पर चलाने के लिए TensorRT निजी-मॉडल पैकेज और लाइसेंसिंग हेतु Enterprise आवश्यक है।

केवल Enterprise.

के लिए सर्वोत्तम

ऑन-प्रिम, एज, एयर-गैप्ड, या VPC-सीमित वर्कलोड जहाँ आप परिवेश और लेटेंसी पर अधिकतम नियंत्रण चाहते हैं।

स्केल पर एज डिवाइसों के एक बेड़े को सेट अप करना, डिप्लॉय करना और मॉनिटर करना।

एक नज़र में क्षमताएँ

Serverless
Dedicated
स्व-होस्टेड

फाइन-ट्यून किए गए और प्री-ट्रेंड मॉडल

हाँ

हाँ

हाँ

वर्कफ़्लोज़

हाँ

हाँ

हाँ

भारी फाउंडेशन मॉडल (SAM2, Florence-2, PaliGemma)

नहीं

हाँ

हाँ

क्लाउड-होस्टेड VLMs (GPT, Claude, Gemini blocks)

हाँ

हाँ

हाँ

वीडियो स्ट्रीमिंग

नहीं

हाँ

हाँ

कस्टम Python ब्लॉक्स और अतिरिक्त निर्भरताएँ

नहीं

हाँ

हाँ

ऑफ़लाइन चलता है

नहीं

नहीं

हाँ

बिलिंग

प्रति कॉल

प्रति घंटा

मुफ़्त + मीटर किया गया क्लाउड सुविधाएँ

स्केल-अप व्यवहार भी अलग है: Serverless Cloud API निष्क्रिय होने पर शून्य तक स्केल हो जाता है और लोड आने पर कुछ सेकंड के कोल्ड स्टार्ट के साथ फिर से ऊपर स्केल करता है, जबकि Dedicated Deployment को शुरू होने में एक या दो मिनट लगते हैं। क्षणिक dev-cpu और dev-gpu डिप्लॉयमेंट छोटे सत्रों तक सीमित होते हैं और उच्च-प्राथमिकता वाले काम के लिए क्षमता चाहिए होने पर हटाए जा सकते हैं; स्थायी prod-* प्रकारों में गारंटीकृत क्षमता होती है और कोई सत्र सीमा नहीं होती।

अपना खुद का क्लाउड लाएँ

यदि अनुपालन नीतियों के लिए वर्कलोड को आपके अपने इन्फ्रास्ट्रक्चर के भीतर रहना आवश्यक है, तो आप अपने स्वयं के AWS, Azure, या GCP खाते पर Inference चला सकते हैं: देखें अपने स्वयं के क्लाउड में डिप्लॉय करें। बिलिंग एज डिवाइस पर स्व-होस्टिंग जैसी ही है, और आप मशीन के लिए अपने क्लाउड प्रदाता को भुगतान करते हैं।

निर्णय प्रवाह

  1. रीयल-टाइम या बल्क? यदि आपको डेटा आते ही परिणाम चाहिए — लाइव वीडियो, इंटरैक्टिव ऐप्स, प्रति-रिक्वेस्ट इन्फ़रेंस — तो रीयल-टाइम मार्ग अपनाएँ। यदि आप संग्रहीत छवियों या वीडियो के बड़े बैकलॉग को प्रोसेस कर रहे हैं, तो उपयोग करें बैच प्रोसेसिंग.

  2. सिंक या असिंक? रीयल-टाइम इन्फ़रेंस समकालिक होता है: आप अनुरोध भेजते हैं और उत्तर प्राप्त करते हैं। बैच प्रोसेसिंग असमकालिक होती है: आप एक जॉब सबमिट करते हैं और उसके समाप्त होने पर परिणाम एकत्र करते हैं, इसलिए सटीक आरंभ समय पर निर्भर न रहें।

  3. क्लाउड या ऑन-प्रिम? यदि आपका डेटा आपका नेटवर्क छोड़ सकता है और आप प्रबंधन के लिए शून्य इन्फ्रास्ट्रक्चर चाहते हैं, तो Roboflow-होस्टेड क्लाउड विकल्प का उपयोग करें। यदि आपका वर्कलोड ऑन-प्रिम, एज, या एयर-गैप्ड रहना चाहिए, तो चलाएँ स्व-होस्टेड इन्फ़रेंस.

  4. प्रबंधित या स्व-प्रबंधित?

एक बार जब आपने विकल्प चुन लिया, तो देखें प्रोडक्शन रेडीनेस चेकलिस्ट त्रुटि प्रबंधन, पुनः प्रयास, दर सीमाएँ, और प्रतिकृति आकार निर्धारण के लिए।

Inference बनाम अन्य डिप्लॉयमेंट स्टैक

Roboflow Inference कई अन्य टूल्स के साथ ओवरलैप करता है। यह तालिका बताती है कि कब कोई अन्य स्टैक बेहतर फिट होता है, और उसे चुनने पर आप क्या छोड़ते हैं।

इन्फ़रेंस सर्वर

टूल
यह कैसे तुलना करता है
इसे चुनें यदि

NVIDIA Triton

स्केल पर डिप्लॉय करने वाले ML विशेषज्ञों के लिए एक ताकतवर विकल्प, जो NVIDIA हार्डवेयर पर अत्यधिक अनुकूलित पाइपलाइनों पर केंद्रित है। यह सरलता और इटरेशन गति को कच्ची गति के बदले देता है, और इसके मॉडल एन्सेम्बल Workflows की तुलना में अधिक कठोर हैं।

आप एक ML विशेषज्ञ हैं, एक कड़ाई से परिभाषित परियोजना पर, जो NVIDIA GPUs पर गति को सबसे ऊपर महत्व देती है।

Lightning LitServe

हल्का, अनुकूलन योग्य, और कार्य-निरपेक्ष (NLP, ऑडियो, टैबुलर के साथ-साथ विज़न), इसलिए यह कंप्यूटर विज़न के लिए उतना फीचर-समृद्ध नहीं है और इसमें बिल्ट-इन वीडियो स्ट्रीमिंग या मॉडल-चेनिंग एब्स्ट्रैक्शन नहीं है।

आप सामान्य-उद्देश्य ML कार्यों पर काम कर रहे हैं और अपना सर्वर खुद बनाने के बजाय एक फीचर-समृद्ध शुरुआती बिंदु चाहते हैं।

TensorFlow Serving

यदि आप विभिन्न मोडैलिटीज़ में TensorFlow में गहराई से निवेशित हैं, तो यह अच्छा है। इसे सेट अप करना जटिल हो सकता है और इसमें प्री- और पोस्ट-प्रोसेसिंग जैसी बुनियादी सुविधाएँ नहीं होतीं, जिनके लिए अक्सर कस्टम कोड की आवश्यकता होती है।

TensorFlow इकोसिस्टम आपके लिए बहुत महत्वपूर्ण है और आप आवश्यक मेहनत करने को तैयार हैं।

TorchServe

PyTorch समकक्ष, जो विज़न, NLP, टैबुलर डेटा और ऑडियो में PyTorch मॉडलों को सर्व करने के लिए अनुकूलित है। बड़े पैमाने के क्लाउड डिप्लॉयमेंट के लिए डिज़ाइन किया गया और वीडियो स्ट्रीमिंग जैसी विज़न-विशिष्ट सुविधाओं में सीमित।

आप PyTorch मॉडल डिप्लॉयमेंट को स्केल और अनुकूलित करना चाहते हैं और विज़न-विशिष्ट कार्यक्षमता की आवश्यकता नहीं है।

FastAPI or Flask

खुद बनाना। Inference का अपना HTTP इंटरफ़ेस FastAPI पर बना है, इसलिए शून्य से शुरुआत करने का मतलब है पहले से सुलझी समस्याओं को फिर से बनाना।

आपका मुख्य लक्ष्य एक इन्फ़रेंस सर्वर बनाने की बारीकियाँ सीखना है।

एज डिप्लॉयमेंट

टूल
यह कैसे तुलना करता है
इसे चुनें यदि

Edge Impulse

बहुत कम-ऊर्जा वाले एज डिवाइसों और एम्बेडेड सिस्टम पर केंद्रित, और माइक्रोकंट्रोलरों के साथ विशेष रूप से अच्छा। इसका TinyML फोकस इसे वीडियो प्रोसेसिंग और आधुनिक अत्याधुनिक मॉडलों के लिए कम उपयुक्त बनाता है, और इसमें Workflows जैसा कुछ नहीं है।

आप एक IoT या वेयरेबल डिवाइस बना रहे हैं जो अधिक शक्तिशाली मॉडल नहीं चला सकता।

NVIDIA DeepStream

TensorRT और CUDA का उपयोग करके अत्यधिक अनुकूलित वीडियो पाइपलाइनों के लिए NVIDIA का प्लेटफ़ॉर्म, जो Inference जैसी कई समस्याओं को लक्षित करता है। इसकी सीखने की गति कठिन है, NVIDIA टूलिंग से परिचित होना आवश्यक है, और यह ओपन सोर्स नहीं है।

आप एक विशेषज्ञ हैं जो एक ही परियोजना को अनुकूलित करने में भारी निवेश करने को तैयार हैं, जहाँ थ्रूपुट प्राथमिक उद्देश्य है.

अंतिम अपडेट

क्या यह उपयोगी था?