> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/hi/choosing-a-deployment.md).

# Deployment Option चुनना

Roboflow के deployment options - Serverless Cloud API, Dedicated Deployments, Batch Processing, Self-Hosted Inference, और edge devices - की तुलना करें और अपने use case के लिए सही विकल्प चुनें।

Roboflow आपके मॉडल चलाने के कई तरीके प्रदान करता है और [वर्कफ़्लोज़](https://docs.roboflow.com/workflows)पूर्णतः प्रबंधित क्लाउड API से लेकर अपने स्वयं के हार्डवेयर पर इन्फ़रेंस तक। सही विकल्प इस बात पर निर्भर करता है कि आपका वर्कलोड रीयल-टाइम है या बल्क, आप कितनी लेटेंसी सह सकते हैं, आपका डेटा कहाँ रहने की अनुमति है, और आप कितनी इन्फ्रास्ट्रक्चर का प्रबंधन करना चाहते हैं।

विकल्पों की एक नज़र में तुलना करने के लिए तालिकाओं का उपयोग करें, फिर संकीर्ण करने के लिए नीचे दिए गए निर्णय प्रवाह का पालन करें।

## Roboflow क्लाउड

Roboflow इन्फ्रास्ट्रक्चर चलाता है। आप डेटा को एक API एंडपॉइंट पर भेजते हैं और बदले में प्रेडिक्शन प्राप्त करते हैं।

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/deployment/hi/roboflow/serverless-api.md">सर्वरलेस क्लाउड API</a></td><td><a href="/deployment/hi/roboflow/dedicated-deployments.md">समर्पित डिप्लॉयमेंट्स</a></td><td><a href="/deployment/hi/roboflow/batch-processing.md">बैच प्रोसेसिंग</a></td></tr><tr><td>यह कहाँ चलता है</td><td>Roboflow क्लाउड (<code>serverless.roboflow.com</code>)</td><td>Roboflow-प्रबंधित निजी क्लाउड सर्वर (<code>*.roboflow.cloud</code>)</td><td>Roboflow क्लाउड, जिसमें प्रति जॉब इन्फ्रास्ट्रक्चर स्वतः प्रावधानित होती है</td></tr><tr><td>GPU</td><td>हाँ: GPU-त्वरित और स्वतः-स्केल होने वाला</td><td>CPU (<code>dev-cpu</code> / <code>prod-cpu</code>) या GPU (<code>dev-gpu</code> / <code>prod-gpu</code>)</td><td>CPU या GPU, प्रति जॉब चयनित</td></tr><tr><td>लेटेंसी प्रोफ़ाइल</td><td>रीयल-टाइम, सिंक्रोनस। ऐसे मॉडल पर पहला अनुरोध जो पहले से लोड नहीं है, कई सेकंड का वार्मअप लेता है, फिर बाद के अनुरोध तेज़ होते हैं जबकि मॉडल कैश में रहता है।</td><td>सुसंगत, समर्पित प्रदर्शन। डिप्लॉयमेंट निष्क्रियता के एक समय के बाद स्वतः-पॉज़ हो जाते हैं (के लिए 1 घंटे पर निश्चित <code>dev-cpu</code> / <code>dev-gpu</code>) और जब आप अनुरोध भेजते हैं तो फिर से शुरू हो जाते हैं।</td><td>असिंक्रोनस, रीयल-टाइम के लिए उपयुक्त नहीं। संसाधन उपलब्ध होने पर मशीनें प्रावधानित की जाती हैं, आमतौर पर कुछ मिनटों के बाद, बिना किसी गारंटीकृत सटीक प्रारंभ समय के।</td></tr><tr><td>मूल्य निर्धारण</td><td>मॉडल द्वारा निर्धारित दर पर क्रेडिट्स में प्रति छवि मीटर किया जाता है। देखें <a href="/deployment/hi/roboflow/serverless-api/model-pricing.md">मॉडल मूल्य निर्धारण</a>.</td><td>प्रति घंटे भुगतान, 1-मिनट के अंतराल में बिल किया जाता है: GPU 1 क्रेडिट/घंटा, CPU 0.25 क्रेडिट/घंटा। अनुरोध पर अनुरोध-आधारित बिलिंग उपलब्ध है।</td><td>CPU और GPU दरें अलग हैं; GPU जॉब तेज़ होते हैं लेकिन अधिक महंगे। देखें <a href="https://roboflow.com/pricing">मूल्य निर्धारण पेज</a>.</td></tr><tr><td>क्षेत्र</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a> बेस API के लिए। <a href="/deployment/hi/roboflow/serverless-api/serverless-video-streaming-api.md">वीडियो स्ट्रीमिंग API</a> समर्थन करता है <code>us</code>, <code>eu</code>, <code>ap</code>.</td><td>केवल US-आधारित डेटा सेंटर।</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td></tr><tr><td>योजना उपलब्धता</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td><td>Core और Enterprise। देखें <a href="https://roboflow.com/pricing">मूल्य निर्धारण</a>.</td><td>Growth और Enterprise।</td></tr><tr><td>के लिए सर्वोत्तम</td><td>तेज़ी से शुरू करना और रीयल-टाइम सिंगल-इमेज या Workflow इन्फ़रेंस के लिए स्वतः स्केल होना, जब डिप्लॉयमेंट डिवाइस के पास स्थायी इंटरनेट कनेक्शन हो।</td><td>पूर्वानुमेय या प्रोडक्शन वर्कलोड, संसाधन पृथक्करण, और बड़े मॉडल जिन्हें GPU त्वरण की आवश्यकता है (उदा.: Florence-2, SAM2)।</td><td>Workflow के साथ बड़ी मात्रा में संग्रहीत छवियों और वीडियो का किफ़ायती प्रोसेसिंग।</td></tr></tbody></table>

## स्व-होस्टेड

आप अपने स्वयं के हार्डवेयर पर इन्फ़रेंस चलाते हैं, इसलिए डेटा को कभी भी आपका नेटवर्क छोड़ने की ज़रूरत नहीं होती।

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/deployment/hi/self-hosted/self-hosted.md">स्व-होस्टेड इन्फ़रेंस</a></td><td><a href="/deployment/hi/self-hosted/enterprise/deployment-manager.md">एज (डिप्लॉयमेंट मैनेजर)</a></td></tr><tr><td>यह कहाँ चलता है</td><td>आपका अपना हार्डवेयर: एज डिवाइस, ऑन-प्रेम सर्वर, या आपका अपना क्लाउड (Docker या <code>pip</code>)</td><td>आपके एज डिवाइस, जिन्हें Roboflow दूरस्थ रूप से प्रबंधित करता है</td></tr><tr><td>GPU</td><td>CPU, CUDA GPU, या NVIDIA Jetson</td><td>डिवाइस पर निर्भर करता है (NVIDIA Jetson, NVIDIA GPU के साथ x86, या Roboflow-प्रदत्त हार्डवेयर)</td></tr><tr><td>लेटेंसी प्रोफ़ाइल</td><td>नेटवर्क राउंड-ट्रिप के बिना स्थानीय, कम लेटेंसी; पर्याप्त हार्डवेयर पर रीयल-टाइम सक्षम।</td><td>स्थानीय एज, रीयल-टाइम। दूरस्थ प्रबंधन और निगरानी के लिए डिवाइसों को निरंतर इंटरनेट एक्सेस की आवश्यकता होती है।</td></tr><tr><td>मूल्य निर्धारण</td><td>मुफ़्त और ओपन सोर्स: आप इन्फ्रास्ट्रक्चर प्रदान करते हैं और प्रबंधित करते हैं। निजी मॉडल्स के लिए TensorRT-अनुकूलित पैकेज Enterprise की आवश्यकता रखते हैं।</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td></tr><tr><td>क्षेत्र</td><td>कहीं भी (आपकी इन्फ्रास्ट्रक्चर)।</td><td>आपके डिवाइसों के स्थान।</td></tr><tr><td>योजना उपलब्धता</td><td>सभी योजनाएँ (ओपन सोर्स)। TensorRT निजी-मॉडल पैकेज और एक से अधिक डिवाइस पर चलाने के लिए लाइसेंसिंग के लिए Enterprise आवश्यक है।</td><td>केवल Enterprise।</td></tr><tr><td>के लिए सर्वोत्तम</td><td>ऑन-प्रेम, एज, एयर-गैप्ड, या VPC-बाउंड वर्कलोड जहाँ आप वातावरण और लेटेंसी पर अधिकतम नियंत्रण चाहते हैं।</td><td>बड़े पैमाने पर एज डिवाइसों के बेड़े को सेट अप करना, डिप्लॉय करना और मॉनिटर करना।</td></tr></tbody></table>

## एक नज़र में क्षमताएँ

|                                                  | सर्वरलेस  | समर्पित    | स्व-होस्टेड                                                        |
| ------------------------------------------------ | --------- | ---------- | ------------------------------------------------------------------ |
| फ़ाइन-ट्यून्ड और प्री-ट्रेन्ड मॉडल               | हाँ       | हाँ        | हाँ                                                                |
| वर्कफ़्लोज़                                      | हाँ       | हाँ        | हाँ                                                                |
| भारी फाउंडेशन मॉडल (SAM2, Florence-2, PaliGemma) | नहीं      | हाँ        | हाँ                                                                |
| क्लाउड-होस्टेड VLMs (GPT, Claude, Gemini blocks) | हाँ       | हाँ        | हाँ                                                                |
| वीडियो स्ट्रीमिंग                                | नहीं      | हाँ        | हाँ                                                                |
| कस्टम Python ब्लॉक और अतिरिक्त निर्भरताएँ        | नहीं      | हाँ        | हाँ                                                                |
| ऑफ़लाइन चलता है                                  | नहीं      | नहीं       | हाँ                                                                |
| बिलिंग                                           | प्रति कॉल | प्रति घंटा | मुफ़्त प्लस [मीटर्ड](https://roboflow.com/pricing) क्लाउड सुविधाएँ |

स्केल-अप व्यवहार भी अलग है: सर्वरलेस क्लाउड API निष्क्रिय होने पर शून्य तक स्केल करता है और लोड आने पर कुछ सेकंड के कोल्ड स्टार्ट के साथ वापस ऊपर जाता है, जबकि एक समर्पित डिप्लॉयमेंट शुरू होने में एक या दो मिनट लेता है। क्षणिक `dev-cpu` और `dev-gpu` डिप्लॉयमेंट्स छोटे सत्रों तक सीमित होते हैं और उच्च-प्राथमिकता वाले काम के लिए क्षमता की आवश्यकता होने पर बाहर किया जा सकते हैं; स्थायी `prod-*` प्रकारों के लिए गारंटीकृत क्षमता होती है और कोई सत्र सीमा नहीं होती।

## अपना क्लाउड लाएँ

यदि अनुपालन नीतियाँ वर्कलोड को आपके अपने इन्फ्रास्ट्रक्चर के अंदर रहने की आवश्यकता करती हैं, तो आप अपने स्वयं के AWS, Azure, या GCP खाते पर Inference चला सकते हैं: देखें [अपने स्वयं के क्लाउड में डिप्लॉय करें](/deployment/hi/self-hosted/inference-server/install/cloud.md). बिलिंग एज डिवाइस पर सेल्फ-होस्टिंग जैसी ही है, और मशीन के लिए आप अपने क्लाउड प्रदाता को भुगतान करते हैं।

## निर्णय प्रवाह

1. **रीयल-टाइम या बल्क?** यदि आपको डेटा आते ही परिणाम चाहिए - लाइव वीडियो, इंटरैक्टिव ऐप्स, प्रति-रिक्वेस्ट इन्फ़रेंस - तो रीयल-टाइम पथ लें। यदि आप संग्रहीत छवियों या वीडियो के बड़े बैकलॉग को प्रोसेस कर रहे हैं, तो उपयोग करें [बैच प्रोसेसिंग](/deployment/hi/roboflow/batch-processing.md).
2. **सिंक या असिंक?** रीयल-टाइम इन्फ़रेंस सिंक्रोनस होता है: आप अनुरोध भेजते हैं और प्रतिक्रिया प्राप्त करते हैं। बैच प्रोसेसिंग असिंक्रोनस है: आप जॉब सबमिट करते हैं और उसके समाप्त होने पर परिणाम एकत्र करते हैं, इसलिए सटीक प्रारंभ समय पर निर्भर न रहें।
3. **क्लाउड या ऑन-प्रेम?** यदि आपका डेटा आपका नेटवर्क छोड़ सकता है और आप प्रबंधित करने के लिए शून्य इन्फ्रास्ट्रक्चर चाहते हैं, तो Roboflow-होस्टेड क्लाउड विकल्प का उपयोग करें। यदि आपका वर्कलोड ऑन-प्रेम, एज, या एयर-गैप्ड रहना चाहिए, तो चलाएँ [स्व-होस्टेड इन्फ़रेंस](/deployment/hi/self-hosted/self-hosted.md).
4. **प्रबंधित या स्व-प्रबंधित?**
   * क्लाउड में, चुनें [समर्पित डिप्लॉयमेंट्स](/deployment/hi/roboflow/dedicated-deployments.md) जब आपको पूर्वानुमेय समर्पित प्रदर्शन या पिन्ड GPU प्रकार की आवश्यकता हो; अन्यथा [सर्वरलेस क्लाउड API](/deployment/hi/roboflow/serverless-api.md) सबसे सरल डिफ़ॉल्ट है।
   * अपने स्वयं के हार्डवेयर पर, उपयोग करें [डिप्लॉयमेंट मैनेजर](/deployment/hi/self-hosted/enterprise/deployment-manager.md) (Enterprise) जब आप चाहते हैं कि Roboflow आपके लिए एज डिवाइसों के बेड़े का प्रबंधन और निगरानी करे; अन्यथा [स्व-होस्टेड इन्फ़रेंस](/deployment/hi/self-hosted/self-hosted.md) सर्वर स्वयं प्रबंधित करें।

एक बार जब आप विकल्प चुन लें, तो देखें [प्रोडक्शन रेडीनेस चेकलिस्ट](/deployment/hi/production-checklist.md) त्रुटि हैंडलिंग, पुनः प्रयास, दर सीमाएँ, और रेप्लिका आकार निर्धारण के लिए।

## इन्फ़रेंस बनाम अन्य डिप्लॉयमेंट स्टैक

Roboflow Inference कई अन्य टूल्स के साथ ओवरलैप करता है। यह तालिका संक्षेप में बताती है कि कब कोई अन्य स्टैक बेहतर फिट है, और उसे चुनने पर आप क्या छोड़ देते हैं।

### इन्फ़रेंस सर्वर

| टूल                    | यह कैसे तुलना करता है                                                                                                                                                                                                                                                 | इसे चुनें यदि                                                                                                                  |
| ---------------------- | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------ |
| **NVIDIA Triton**      | ML विशेषज्ञों के लिए एक शक्तिशाली विकल्प जो बड़े पैमाने पर डिप्लॉय करते हैं, और NVIDIA हार्डवेयर पर अत्यंत अनुकूलित पाइपलाइनों पर केंद्रित है। यह सरलता और iteration speed की कीमत पर कच्ची गति देता है, और इसके मॉडल एंसेंबल्स Workflows की तुलना में अधिक कठोर हैं। | आप एक ML विशेषज्ञ हैं, एक सख्ती से परिभाषित प्रोजेक्ट पर काम कर रहे हैं जो NVIDIA GPUs पर गति को हर चीज़ से ऊपर महत्व देता है। |
| **Lightning LitServe** | हल्का, अनुकूलन योग्य, और कार्य-अज्ञेयवादी (NLP, ऑडियो, टेबलर, साथ ही विज़न), इसलिए यह कंप्यूटर विज़न के लिए उतना फीचर-समृद्ध नहीं है और इसमें बिल्ट-इन वीडियो स्ट्रीमिंग या मॉडल-चेनिंग एब्स्ट्रैक्शन नहीं है।                                                        | आप सामान्य-उद्देश्य ML कार्यों पर काम कर रहे हैं और अपना सर्वर स्वयं बनाने के बजाय एक फीचर-समृद्ध शुरुआती बिंदु चाहते हैं।     |
| **TensorFlow Serving** | यदि आप कई मोडैलिटीज़ में TensorFlow में गहराई से निवेशित हैं, तो यह अच्छा है। इसे सेट अप करना जटिल हो सकता है और इसमें प्री- और पोस्ट-प्रोसेसिंग जैसी बुनियादी सुविधाओं की कमी है, जिनके लिए अक्सर कस्टम कोड की आवश्यकता होती है।                                     | TensorFlow इकोसिस्टम आपके लिए बहुत महत्वपूर्ण है और आप मेहनत करने के लिए तैयार हैं।                                            |
| **TorchServe**         | PyTorch समकक्ष, जो विज़न, NLP, टेबलर डेटा, और ऑडियो में PyTorch मॉडल्स को सर्व करने के लिए अनुकूलित है। बड़े पैमाने के क्लाउड डिप्लॉयमेंट के लिए डिज़ाइन किया गया है और वीडियो स्ट्रीमिंग जैसी विज़न-विशिष्ट सुविधाओं में हल्का है।                                   | आप PyTorch मॉडल डिप्लॉयमेंट को स्केल और कस्टमाइज़ करना चाहते हैं और विज़न-विशिष्ट कार्यक्षमता की आवश्यकता नहीं है।             |
| **FastAPI या Flask**   | अपना खुद का बनाना। Inference का अपना HTTP इंटरफ़ेस FastAPI पर बना है, इसलिए शुरुआत से शुरू करने का मतलब है पहले से हल की गई समस्याओं को फिर से बनाना।                                                                                                                 | आपका मुख्य लक्ष्य इन्फ़रेंस सर्वर बनाने की बारीकियाँ सीखना है।                                                                 |

### एज डिप्लॉयमेंट

| टूल                   | यह कैसे तुलना करता है                                                                                                                                                                                                                                       | इसे चुनें यदि                                                                                                                   |
| --------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------- |
| **Edge Impulse**      | बहुत कम-शक्ति वाले एज डिवाइसों और एम्बेडेड सिस्टम्स पर केंद्रित, और माइक्रोकंट्रोलर्स के साथ विशेष रूप से अच्छा। इसका TinyML फोकस इसे वीडियो प्रोसेसिंग और आधुनिक स्टेट-ऑफ़-द-आर्ट मॉडल्स के लिए कम उपयुक्त बनाता है, और इसका कोई Workflows समकक्ष नहीं है। | आप एक IoT या वियरेबल डिवाइस बना रहे हैं जो अधिक शक्तिशाली मॉडल नहीं चला सकती।                                                   |
| **NVIDIA DeepStream** | TensorRT और CUDA का उपयोग करके अत्यधिक अनुकूलित वीडियो पाइपलाइनों के लिए NVIDIA का प्लेटफ़ॉर्म, जो Inference जैसी ही कई समस्याओं को लक्षित करता है। इसका सीखने का वक्र तेज़ है, NVIDIA टूलिंग से परिचित होने की आवश्यकता होती है, और यह ओपन सोर्स नहीं है।  | आप एक विशेषज्ञ हैं जो थ्रूपुट को प्राथमिक लक्ष्य मानते हुए एकल प्रोजेक्ट को अनुकूलित करने में भारी निवेश करने के लिए तैयार हैं। |
