> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/hi/choosing-a-deployment.md).

# Deployment विकल्प चुनना

Roboflow आपके मॉडलों को चलाने के कई तरीके प्रदान करता है और [वर्कफ़्लोज़](https://docs.roboflow.com/workflows)पूरी तरह प्रबंधित क्लाउड API से लेकर अपने स्वयं के हार्डवेयर पर इन्फ़रेंस तक। सही विकल्प इस पर निर्भर करता है कि आपका वर्कलोड रीयल-टाइम है या बल्क, आप कितनी लेटेंसी सह सकते हैं, आपका डेटा कहाँ रह सकता है, और आप कितनी इन्फ्रास्ट्रक्चर प्रबंधन करना चाहते हैं।

विकल्पों की एक नज़र में तुलना करने के लिए तालिकाओं का उपयोग करें, फिर संकुचित करने के लिए नीचे दिए निर्णय प्रवाह का पालन करें।

## Roboflow क्लाउड

Roboflow इन्फ्रास्ट्रक्चर चलाता है। आप डेटा एक API एंडपॉइंट को भेजते हैं और बदले में पूर्वानुमान प्राप्त करते हैं।

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/pages/272138ff80660391515e3b7eab0368854a6594f6">सर्वरलेस क्लाउड API</a></td><td><a href="/pages/45b4dbf0174baf60cefa01532fb06212644178f1">समर्पित डिप्लॉयमेंट</a></td><td><a href="/pages/12f21787213c9b810dd11248c8666e86379d0249">बैच प्रोसेसिंग</a></td></tr><tr><td>यह कहाँ चलता है</td><td>Roboflow क्लाउड (<code>serverless.roboflow.com</code>)</td><td>Roboflow-प्रबंधित निजी क्लाउड सर्वर (<code>*.roboflow.cloud</code>)</td><td>Roboflow क्लाउड, जिसमें प्रत्येक जॉब के लिए इन्फ्रास्ट्रक्चर स्वतः प्राविजन होता है</td></tr><tr><td>GPU</td><td>हाँ: GPU-त्वरित और स्वतः-स्केलिंग</td><td>CPU (<code>dev-cpu</code> / <code>prod-cpu</code>) या GPU (<code>dev-gpu</code> / <code>prod-gpu</code>)</td><td>CPU या GPU, जॉब के आधार पर चुना जाता है</td></tr><tr><td>लेटेंसी प्रोफ़ाइल</td><td>रीयल-टाइम, समकालिक। किसी मॉडल के लिए पहला अनुरोध, जो पहले से लोड नहीं है, कई सेकंड का वार्मअप लेता है; फिर बाद के अनुरोध तेज़ होते हैं जबकि मॉडल कैश में रहता है।</td><td>सुसंगत, समर्पित प्रदर्शन। निष्क्रियता की अवधि के बाद डिप्लॉयमेंट स्वतः विराम लेते हैं (के लिए 1 घंटे पर निर्धारित <code>dev-cpu</code> / <code>dev-gpu</code>) और जब आप अनुरोध भेजते हैं तब फिर से शुरू होते हैं।</td><td>असमकालिक, रीयल-टाइम के लिए उपयुक्त नहीं। संसाधन उपलब्ध होने पर मशीनें प्राविजन की जाती हैं, आमतौर पर कुछ मिनटों के बाद, और आरंभ समय की सटीक गारंटी नहीं होती।</td></tr><tr><td>मूल्य निर्धारण</td><td>प्रसंस्करण समय के आधार पर, प्रत्येक इन्फ़रेंस के लिए क्रेडिट में मीटर किया जाता है। देखें <a href="https://roboflow.com/credits">roboflow.com/credits</a> और <a href="/pages/6f45bf1790e0137b832f05b8d235674f46eea1dc">सर्वरलेस मूल्य निर्धारण</a>.</td><td>प्रति घंटा भुगतान, 1-मिनट के अंतराल में बिलिंग: GPU 1 क्रेडिट/घंटा, CPU 0.25 क्रेडिट/घंटा। अनुरोध-आधारित बिलिंग अनुरोध पर उपलब्ध है।</td><td>CPU और GPU दरें अलग हैं; GPU जॉब तेज़ होती हैं लेकिन अधिक महंगी। देखें <a href="https://roboflow.com/pricing">मूल्य निर्धारण पृष्ठ</a>.</td></tr><tr><td>क्षेत्र</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a> बेस API के लिए। <a href="/pages/534b8a8dbefb4b7945ced90112e80e01254d6765">वीडियो स्ट्रीमिंग API</a> समर्थन करता है <code>us</code>, <code>eu</code>, <code>ap</code>.</td><td>केवल US-आधारित डेटा सेंटर।</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td></tr><tr><td>प्लान उपलब्धता</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td><td>Core और Enterprise। देखें <a href="https://roboflow.com/pricing">मूल्य निर्धारण</a>.</td><td>Growth और Enterprise।</td></tr><tr><td>के लिए सर्वोत्तम</td><td>रीयल-टाइम एकल-छवि या Workflow इन्फ़रेंस के लिए तेज़ी से शुरुआत करने और स्वचालित रूप से स्केल करने के लिए, जब डिप्लॉयमेंट डिवाइस के पास स्थायी इंटरनेट कनेक्शन हो।</td><td>पूर्वानुमेय या प्रोडक्शन वर्कलोड, संसाधन पृथक्करण, और बड़े मॉडल जिन्हें GPU त्वरण की आवश्यकता होती है (जैसे: Florence-2, SAM2)।</td><td>Workflow के साथ संग्रहीत छवियों और वीडियो की बड़ी मात्रा का लागत-प्रभावी प्रसंस्करण।</td></tr></tbody></table>

## स्व-होस्टेड

आप अपने स्वयं के हार्डवेयर पर इन्फ़रेंस चलाते हैं, इसलिए डेटा को कभी भी आपका नेटवर्क छोड़ना नहीं पड़ता।

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/pages/5daeeeaa0760b11f43ee781e5be8ad2f010e76a3">स्व-होस्टेड इन्फ़रेंस</a></td><td><a href="/pages/3f25133f927560f139e76b793717cdb37f68d858">एज (डिप्लॉयमेंट मैनेजर)</a></td></tr><tr><td>यह कहाँ चलता है</td><td>आपका अपना हार्डवेयर: एज डिवाइस, ऑन-प्रिम सर्वर, या आपका अपना क्लाउड (Docker या <code>pip</code>)</td><td>आपके एज डिवाइस, जिन्हें Roboflow द्वारा रिमोटली प्रबंधित किया जाता है</td></tr><tr><td>GPU</td><td>CPU, CUDA GPU, या NVIDIA Jetson</td><td>डिवाइस पर निर्भर करता है (NVIDIA Jetson, NVIDIA GPU के साथ x86, या Roboflow-प्रदत्त हार्डवेयर)</td></tr><tr><td>लेटेंसी प्रोफ़ाइल</td><td>स्थानीय, कम लेटेंसी, बिना नेटवर्क राउंड-ट्रिप के; पर्याप्त हार्डवेयर पर रीयल-टाइम सक्षम।</td><td>स्थानीय एज, रीयल-टाइम। रिमोट प्रबंधन और निगरानी के लिए डिवाइसों को निरंतर इंटरनेट पहुँच चाहिए।</td></tr><tr><td>मूल्य निर्धारण</td><td>मुफ़्त और ओपन सोर्स: इन्फ्रास्ट्रक्चर आप प्रदान और प्रबंधित करते हैं। निजी मॉडलों के लिए TensorRT-अनुकूलित पैकेज Enterprise की आवश्यकता होती है।</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td></tr><tr><td>क्षेत्र</td><td>कहीं भी (आपका इन्फ्रास्ट्रक्चर).</td><td>आपके डिवाइस स्थान।</td></tr><tr><td>प्लान उपलब्धता</td><td>सभी प्लान (ओपन सोर्स)। एक से अधिक डिवाइस पर चलाने के लिए TensorRT निजी-मॉडल पैकेज और लाइसेंसिंग हेतु Enterprise आवश्यक है।</td><td>केवल Enterprise.</td></tr><tr><td>के लिए सर्वोत्तम</td><td>ऑन-प्रिम, एज, एयर-गैप्ड, या VPC-सीमित वर्कलोड जहाँ आप परिवेश और लेटेंसी पर अधिकतम नियंत्रण चाहते हैं।</td><td>स्केल पर एज डिवाइसों के एक बेड़े को सेट अप करना, डिप्लॉय करना और मॉनिटर करना।</td></tr></tbody></table>

## एक नज़र में क्षमताएँ

|                                                  | Serverless | Dedicated  | स्व-होस्टेड                                                            |
| ------------------------------------------------ | ---------- | ---------- | ---------------------------------------------------------------------- |
| फाइन-ट्यून किए गए और प्री-ट्रेंड मॉडल            | हाँ        | हाँ        | हाँ                                                                    |
| वर्कफ़्लोज़                                      | हाँ        | हाँ        | हाँ                                                                    |
| भारी फाउंडेशन मॉडल (SAM2, Florence-2, PaliGemma) | नहीं       | हाँ        | हाँ                                                                    |
| क्लाउड-होस्टेड VLMs (GPT, Claude, Gemini blocks) | हाँ        | हाँ        | हाँ                                                                    |
| वीडियो स्ट्रीमिंग                                | नहीं       | हाँ        | हाँ                                                                    |
| कस्टम Python ब्लॉक्स और अतिरिक्त निर्भरताएँ      | नहीं       | हाँ        | हाँ                                                                    |
| ऑफ़लाइन चलता है                                  | नहीं       | नहीं       | हाँ                                                                    |
| बिलिंग                                           | प्रति कॉल  | प्रति घंटा | मुफ़्त + [मीटर किया गया](https://roboflow.com/pricing) क्लाउड सुविधाएँ |

स्केल-अप व्यवहार भी अलग है: Serverless Cloud API निष्क्रिय होने पर शून्य तक स्केल हो जाता है और लोड आने पर कुछ सेकंड के कोल्ड स्टार्ट के साथ फिर से ऊपर स्केल करता है, जबकि Dedicated Deployment को शुरू होने में एक या दो मिनट लगते हैं। क्षणिक `dev-cpu` और `dev-gpu` डिप्लॉयमेंट छोटे सत्रों तक सीमित होते हैं और उच्च-प्राथमिकता वाले काम के लिए क्षमता चाहिए होने पर हटाए जा सकते हैं; स्थायी `prod-*` प्रकारों में गारंटीकृत क्षमता होती है और कोई सत्र सीमा नहीं होती।

## अपना खुद का क्लाउड लाएँ

यदि अनुपालन नीतियों के लिए वर्कलोड को आपके अपने इन्फ्रास्ट्रक्चर के भीतर रहना आवश्यक है, तो आप अपने स्वयं के AWS, Azure, या GCP खाते पर Inference चला सकते हैं: देखें [अपने स्वयं के क्लाउड में डिप्लॉय करें](/deployment/hi/self-hosted/inference-server/install/cloud.md)। बिलिंग एज डिवाइस पर स्व-होस्टिंग जैसी ही है, और आप मशीन के लिए अपने क्लाउड प्रदाता को भुगतान करते हैं।

## निर्णय प्रवाह

1. **रीयल-टाइम या बल्क?** यदि आपको डेटा आते ही परिणाम चाहिए — लाइव वीडियो, इंटरैक्टिव ऐप्स, प्रति-रिक्वेस्ट इन्फ़रेंस — तो रीयल-टाइम मार्ग अपनाएँ। यदि आप संग्रहीत छवियों या वीडियो के बड़े बैकलॉग को प्रोसेस कर रहे हैं, तो उपयोग करें [बैच प्रोसेसिंग](/deployment/hi/roboflow-cloud/batch-processing.md).
2. **सिंक या असिंक?** रीयल-टाइम इन्फ़रेंस समकालिक होता है: आप अनुरोध भेजते हैं और उत्तर प्राप्त करते हैं। बैच प्रोसेसिंग असमकालिक होती है: आप एक जॉब सबमिट करते हैं और उसके समाप्त होने पर परिणाम एकत्र करते हैं, इसलिए सटीक आरंभ समय पर निर्भर न रहें।
3. **क्लाउड या ऑन-प्रिम?** यदि आपका डेटा आपका नेटवर्क छोड़ सकता है और आप प्रबंधन के लिए शून्य इन्फ्रास्ट्रक्चर चाहते हैं, तो Roboflow-होस्टेड क्लाउड विकल्प का उपयोग करें। यदि आपका वर्कलोड ऑन-प्रिम, एज, या एयर-गैप्ड रहना चाहिए, तो चलाएँ [स्व-होस्टेड इन्फ़रेंस](/deployment/hi/self-hosted/self-hosted.md).
4. **प्रबंधित या स्व-प्रबंधित?**
   * क्लाउड में, चुनें [समर्पित डिप्लॉयमेंट](/deployment/hi/roboflow-cloud/dedicated-deployments.md) जब आपको पूर्वानुमेय समर्पित प्रदर्शन या एक निश्चित GPU प्रकार की आवश्यकता हो; अन्यथा [सर्वरलेस क्लाउड API](/deployment/hi/roboflow-cloud/serverless-api.md) सबसे सरल डिफ़ॉल्ट है।
   * अपने स्वयं के हार्डवेयर पर, उपयोग करें [डिप्लॉयमेंट मैनेजर](/deployment/hi/self-hosted/enterprise/deployment-manager.md) (Enterprise) जब आप चाहते हैं कि Roboflow आपके लिए एज डिवाइसों के एक बेड़े का प्रबंधन और निगरानी करे; अन्यथा प्रबंधित करें [स्व-होस्टेड इन्फ़रेंस](/deployment/hi/self-hosted/self-hosted.md) सर्वर स्वयं।

एक बार जब आपने विकल्प चुन लिया, तो देखें [प्रोडक्शन रेडीनेस चेकलिस्ट](/deployment/hi/production-checklist.md) त्रुटि प्रबंधन, पुनः प्रयास, दर सीमाएँ, और प्रतिकृति आकार निर्धारण के लिए।

## Inference बनाम अन्य डिप्लॉयमेंट स्टैक

Roboflow Inference कई अन्य टूल्स के साथ ओवरलैप करता है। यह तालिका बताती है कि कब कोई अन्य स्टैक बेहतर फिट होता है, और उसे चुनने पर आप क्या छोड़ते हैं।

### इन्फ़रेंस सर्वर

| टूल                    | यह कैसे तुलना करता है                                                                                                                                                                                                                                  | इसे चुनें यदि                                                                                                            |
| ---------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ | ------------------------------------------------------------------------------------------------------------------------ |
| **NVIDIA Triton**      | स्केल पर डिप्लॉय करने वाले ML विशेषज्ञों के लिए एक ताकतवर विकल्प, जो NVIDIA हार्डवेयर पर अत्यधिक अनुकूलित पाइपलाइनों पर केंद्रित है। यह सरलता और इटरेशन गति को कच्ची गति के बदले देता है, और इसके मॉडल एन्सेम्बल Workflows की तुलना में अधिक कठोर हैं। | आप एक ML विशेषज्ञ हैं, एक कड़ाई से परिभाषित परियोजना पर, जो NVIDIA GPUs पर गति को सबसे ऊपर महत्व देती है।                |
| **Lightning LitServe** | हल्का, अनुकूलन योग्य, और कार्य-निरपेक्ष (NLP, ऑडियो, टैबुलर के साथ-साथ विज़न), इसलिए यह कंप्यूटर विज़न के लिए उतना फीचर-समृद्ध नहीं है और इसमें बिल्ट-इन वीडियो स्ट्रीमिंग या मॉडल-चेनिंग एब्स्ट्रैक्शन नहीं है।                                       | आप सामान्य-उद्देश्य ML कार्यों पर काम कर रहे हैं और अपना सर्वर खुद बनाने के बजाय एक फीचर-समृद्ध शुरुआती बिंदु चाहते हैं। |
| **TensorFlow Serving** | यदि आप विभिन्न मोडैलिटीज़ में TensorFlow में गहराई से निवेशित हैं, तो यह अच्छा है। इसे सेट अप करना जटिल हो सकता है और इसमें प्री- और पोस्ट-प्रोसेसिंग जैसी बुनियादी सुविधाएँ नहीं होतीं, जिनके लिए अक्सर कस्टम कोड की आवश्यकता होती है।                | TensorFlow इकोसिस्टम आपके लिए बहुत महत्वपूर्ण है और आप आवश्यक मेहनत करने को तैयार हैं।                                   |
| **TorchServe**         | PyTorch समकक्ष, जो विज़न, NLP, टैबुलर डेटा और ऑडियो में PyTorch मॉडलों को सर्व करने के लिए अनुकूलित है। बड़े पैमाने के क्लाउड डिप्लॉयमेंट के लिए डिज़ाइन किया गया और वीडियो स्ट्रीमिंग जैसी विज़न-विशिष्ट सुविधाओं में सीमित।                          | आप PyTorch मॉडल डिप्लॉयमेंट को स्केल और अनुकूलित करना चाहते हैं और विज़न-विशिष्ट कार्यक्षमता की आवश्यकता नहीं है।        |
| **FastAPI or Flask**   | खुद बनाना। Inference का अपना HTTP इंटरफ़ेस FastAPI पर बना है, इसलिए शून्य से शुरुआत करने का मतलब है पहले से सुलझी समस्याओं को फिर से बनाना।                                                                                                            | आपका मुख्य लक्ष्य एक इन्फ़रेंस सर्वर बनाने की बारीकियाँ सीखना है।                                                        |

### एज डिप्लॉयमेंट

| टूल                   | यह कैसे तुलना करता है                                                                                                                                                                                                                              | इसे चुनें यदि                                                                                                              |
| --------------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | -------------------------------------------------------------------------------------------------------------------------- |
| **Edge Impulse**      | बहुत कम-ऊर्जा वाले एज डिवाइसों और एम्बेडेड सिस्टम पर केंद्रित, और माइक्रोकंट्रोलरों के साथ विशेष रूप से अच्छा। इसका TinyML फोकस इसे वीडियो प्रोसेसिंग और आधुनिक अत्याधुनिक मॉडलों के लिए कम उपयुक्त बनाता है, और इसमें Workflows जैसा कुछ नहीं है। | आप एक IoT या वेयरेबल डिवाइस बना रहे हैं जो अधिक शक्तिशाली मॉडल नहीं चला सकता।                                              |
| **NVIDIA DeepStream** | TensorRT और CUDA का उपयोग करके अत्यधिक अनुकूलित वीडियो पाइपलाइनों के लिए NVIDIA का प्लेटफ़ॉर्म, जो Inference जैसी कई समस्याओं को लक्षित करता है। इसकी सीखने की गति कठिन है, NVIDIA टूलिंग से परिचित होना आवश्यक है, और यह ओपन सोर्स नहीं है।       | आप एक विशेषज्ञ हैं जो एक ही परियोजना को अनुकूलित करने में भारी निवेश करने को तैयार हैं, जहाँ थ्रूपुट प्राथमिक उद्देश्य है. |
