> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/hi/choosing-a-deployment.md).

# Deployment विकल्प चुनना

Roboflow आपके मॉडलों को चलाने के कई तरीके प्रदान करता है और [वर्कफ़्लोज़](https://docs.roboflow.com/workflows)पूरी तरह से प्रबंधित क्लाउड API से लेकर अपने खुद के हार्डवेयर पर इन्फरेंस तक। सही विकल्प इस पर निर्भर करता है कि आपका वर्कलोड रियल-टाइम है या बल्क, आप कितनी लेटेंसी सह सकते हैं, आपका डेटा कहाँ रहने की अनुमति है, और आप कितनी इन्फ्रास्ट्रक्चर प्रबंधन करना चाहते हैं।

तालिकाओं का उपयोग करके विकल्पों की एक नज़र में तुलना करें, फिर नीचे दिए गए निर्णय-प्रवाह का पालन करके विकल्पों को संकुचित करें।

## Roboflow क्लाउड

Roboflow इन्फ्रास्ट्रक्चर चलाता है। आप डेटा एक API एंडपॉइंट पर भेजते हैं और बदले में पूर्वानुमान पाते हैं।

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/pages/272138ff80660391515e3b7eab0368854a6594f6">Serverless Hosted API</a></td><td><a href="/pages/45b4dbf0174baf60cefa01532fb06212644178f1">समर्पित परिनियोजन</a></td><td><a href="/pages/12f21787213c9b810dd11248c8666e86379d0249">बैच प्रोसेसिंग</a></td></tr><tr><td>यह कहाँ चलता है</td><td>Roboflow क्लाउड (<code>serverless.roboflow.com</code>)</td><td>Roboflow-प्रबंधित निजी क्लाउड सर्वर (<code>*.roboflow.cloud</code>)</td><td>Roboflow क्लाउड, जिसमें प्रत्येक जॉब के लिए इन्फ्रास्ट्रक्चर स्वतः प्रावधानित होता है</td></tr><tr><td>GPU</td><td>हाँ: GPU-त्वरित और स्वचालित रूप से स्केल होने वाला</td><td>CPU (<code>dev-cpu</code> / <code>prod-cpu</code>) या GPU (<code>dev-gpu</code> / <code>prod-gpu</code>)</td><td>जॉब के अनुसार चुना गया CPU या GPU</td></tr><tr><td>लेटेंसी प्रोफ़ाइल</td><td>रियल-टाइम, समकालिक। किसी ऐसे मॉडल के लिए पहला अनुरोध जो पहले से लोड नहीं है, कुछ सेकंड का वार्मअप लेता है; उसके बाद जब तक मॉडल कैश में रहता है, अगले अनुरोध तेज़ होते हैं।</td><td>सुसंगत, समर्पित प्रदर्शन। निष्क्रियता की अवधि के बाद डिप्लॉयमेंट स्वतः विराम ले लेते हैं (के लिए 1 घंटे पर स्थिर <code>dev-cpu</code> / <code>dev-gpu</code>) और जब आप अनुरोध भेजते हैं तो फिर से शुरू हो जाते हैं।</td><td>असमकालिक, रियल-टाइम के लिए उपयुक्त नहीं। संसाधन उपलब्ध होने पर मशीनें प्रावधानित की जाती हैं, आमतौर पर कुछ मिनटों के बाद, बिना किसी निश्चित प्रारंभ समय की गारंटी के।</td></tr><tr><td>मूल्य निर्धारण</td><td>प्रोसेसिंग समय के आधार पर, क्रेडिट्स में प्रत्येक इन्फरेंस पर मीटर किया गया। देखें <a href="https://roboflow.com/credits">roboflow.com/credits</a> और <a href="/pages/6f45bf1790e0137b832f05b8d235674f46eea1dc">Serverless मूल्य निर्धारण</a>.</td><td>प्रति घंटे भुगतान, 1-मिनट के अंतराल में बिलिंग: GPU 1 क्रेडिट/घंटा, CPU 0.25 क्रेडिट/घंटा। अनुरोध-आधारित बिलिंग अनुरोध पर उपलब्ध है।</td><td>CPU और GPU दरें अलग हैं; GPU जॉब्स तेज़ होते हैं लेकिन अधिक महंगे। देखें <a href="https://roboflow.com/pricing">मूल्य निर्धारण पृष्ठ</a>.</td></tr><tr><td>क्षेत्र</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a> बेस API के लिए। <a href="/pages/534b8a8dbefb4b7945ced90112e80e01254d6765">वीडियो स्ट्रीमिंग API</a> समर्थन करता है <code>us</code>, <code>eu</code>, <code>ap</code>.</td><td>केवल यूएस-आधारित डेटा केंद्र।</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td></tr><tr><td>योजना उपलब्धता</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td><td>Core और Enterprise. देखें <a href="https://roboflow.com/pricing">मूल्य निर्धारण</a>.</td><td>Growth और Enterprise.</td></tr><tr><td>इसके लिए सबसे उपयुक्त</td><td>तेज़ी से शुरुआत करने और रियल-टाइम सिंगल-इमेज या Workflow इन्फरेंस के लिए स्वचालित रूप से स्केल करने के लिए, जब डिप्लॉयमेंट डिवाइस के पास स्थायी इंटरनेट कनेक्शन हो।</td><td>पूर्वानुमेय या प्रोडक्शन वर्कलोड, संसाधन पृथक्करण, और बड़े मॉडल जिन्हें GPU त्वरन चाहिए (उदा: Florence-2, SAM2)।</td><td>Workflow के साथ बड़ी मात्रा में संग्रहीत छवियों और वीडियो के किफायती प्रसंस्करण के लिए।</td></tr></tbody></table>

## स्व-होस्टेड

आप अपने स्वयं के हार्डवेयर पर इन्फरेंस चलाते हैं, इसलिए डेटा को कभी भी आपका नेटवर्क छोड़ने की आवश्यकता नहीं होती।

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/pages/5daeeeaa0760b11f43ee781e5be8ad2f010e76a3">Self-Hosted Inference</a></td><td><a href="/pages/3f25133f927560f139e76b793717cdb37f68d858">एज (Deployment Manager)</a></td></tr><tr><td>यह कहाँ चलता है</td><td>आपका अपना हार्डवेयर: एज डिवाइस, ऑन-प्रेम सर्वर, या आपका अपना क्लाउड (Docker या <code>pip</code>)</td><td>आपके एज डिवाइस, जिन्हें Roboflow दूरस्थ रूप से प्रबंधित करता है</td></tr><tr><td>GPU</td><td>CPU, CUDA GPU, या NVIDIA Jetson</td><td>डिवाइस पर निर्भर करता है (NVIDIA Jetson, NVIDIA GPU वाला x86, या Roboflow-प्रदत्त हार्डवेयर)</td></tr><tr><td>लेटेंसी प्रोफ़ाइल</td><td>स्थानीय, कम लेटेंसी, बिना नेटवर्क राउंड-ट्रिप के; पर्याप्त हार्डवेयर पर रियल-टाइम सक्षम।</td><td>स्थानीय एज, रियल-टाइम। दूरस्थ प्रबंधन और निगरानी के लिए डिवाइसों को निरंतर इंटरनेट एक्सेस चाहिए।</td></tr><tr><td>मूल्य निर्धारण</td><td>निःशुल्क और ओपन सोर्स: आप इन्फ्रास्ट्रक्चर उपलब्ध कराते और प्रबंधित करते हैं। निजी मॉडलों के लिए TensorRT-अनुकूलित पैकेज Enterprise की आवश्यकता रखते हैं।</td><td><a href="https://roboflow.com/sales">सेल्स से संपर्क करें</a>.</td></tr><tr><td>क्षेत्र</td><td>कहीं भी (आपका इन्फ्रास्ट्रक्चर)।</td><td>आपके डिवाइस के स्थान।</td></tr><tr><td>योजना उपलब्धता</td><td>सभी योजनाएँ (ओपन सोर्स)। TensorRT निजी-मॉडल पैकेज और एक से अधिक डिवाइस पर चलाने के लिए लाइसेंसिंग के लिए Enterprise आवश्यक है।</td><td>केवल Enterprise।</td></tr><tr><td>इसके लिए सबसे उपयुक्त</td><td>ऑन-प्रेम, एज, एयर-गैप्ड, या VPC-बाउंड वर्कलोड जहाँ आप पर्यावरण और लेटेंसी पर अधिकतम नियंत्रण चाहते हैं।</td><td>बड़े पैमाने पर एज डिवाइसों के बेड़े को सेट अप करना, डिप्लॉय करना और मॉनिटर करना।</td></tr></tbody></table>

## एक नज़र में क्षमताएँ

|                                                  | सर्वरलेस  | समर्पित    | स्व-होस्टेड                                                                 |
| ------------------------------------------------ | --------- | ---------- | --------------------------------------------------------------------------- |
| फाइन-ट्यून किए गए और पूर्व-प्रशिक्षित मॉडल       | हाँ       | हाँ        | हाँ                                                                         |
| वर्कफ़्लोज़                                      | हाँ       | हाँ        | हाँ                                                                         |
| भारी फाउंडेशन मॉडल (SAM2, Florence-2, PaliGemma) | नहीं      | हाँ        | हाँ                                                                         |
| क्लाउड-होस्टेड VLMs (GPT, Claude, Gemini blocks) | हाँ       | हाँ        | हाँ                                                                         |
| वीडियो स्ट्रीमिंग                                | नहीं      | हाँ        | हाँ                                                                         |
| कस्टम Python ब्लॉक और अतिरिक्त निर्भरताएँ        | नहीं      | हाँ        | हाँ                                                                         |
| ऑफ़लाइन चलता है                                  | नहीं      | नहीं       | हाँ                                                                         |
| बिलिंग                                           | प्रति कॉल | प्रति घंटा | निःशुल्क प्लस [मीटर किया गया](https://roboflow.com/pricing) क्लाउड सुविधाएँ |

स्केल-अप व्यवहार भी अलग है: Serverless Hosted API निष्क्रिय होने पर शून्य तक स्केल हो जाती है और लोड आने पर कुछ सेकंड के कोल्ड स्टार्ट के साथ वापस बढ़ती है, जबकि Dedicated Deployment शुरू होने में एक या दो मिनट लेता है। Ephemeral `dev-cpu` और `dev-gpu` डिप्लॉयमेंट्स छोटे सत्रों तक सीमित होते हैं और उच्च-प्राथमिकता वाले काम के लिए क्षमता की आवश्यकता होने पर हटाए जा सकते हैं; persistent `prod-*` प्रकारों में गारंटीकृत क्षमता होती है और कोई सत्र सीमा नहीं होती।

## अपना क्लाउड लाएँ

यदि अनुपालन नीतियाँ वर्कलोड को आपके अपने इन्फ्रास्ट्रक्चर के भीतर रहने की मांग करती हैं, तो आप अपने स्वयं के AWS, Azure, या GCP खाते पर Inference चला सकते हैं: देखें [अपने स्वयं के क्लाउड में डिप्लॉय करें](/deployment/hi/self-hosted/inference-server/install/cloud.md)। बिलिंग एज डिवाइस पर स्व-होस्टिंग जैसी ही है, और आप मशीन के लिए अपने क्लाउड प्रदाता को भुगतान करते हैं।

## निर्णय-प्रवाह

1. **रियल-टाइम या बल्क?** यदि आपको डेटा आते ही परिणाम चाहिए - लाइव वीडियो, इंटरैक्टिव ऐप्स, प्रति-रिक्वेस्ट इन्फरेंस - तो रियल-टाइम मार्ग अपनाएँ। यदि आप संग्रहीत छवियों या वीडियो के बड़े बैकलॉग को संसाधित कर रहे हैं, तो उपयोग करें [बैच प्रोसेसिंग](/deployment/hi/roboflow-cloud/batch-processing.md).
2. **सिंक्रोनस या एसिंक्रोनस?** रियल-टाइम इन्फरेंस सिंक्रोनस होता है: आप अनुरोध भेजते हैं और प्रतिक्रिया प्राप्त करते हैं। बैच प्रोसेसिंग एसिंक्रोनस होती है: आप एक जॉब सबमिट करते हैं और उसके समाप्त होने पर परिणाम एकत्र करते हैं, इसलिए सटीक प्रारंभ समय पर निर्भर न रहें।
3. **क्लाउड या ऑन-प्रेम?** यदि आपका डेटा आपका नेटवर्क छोड़ सकता है और आप प्रबंधन के लिए शून्य इन्फ्रास्ट्रक्चर चाहते हैं, तो Roboflow-होस्टेड क्लाउड विकल्प का उपयोग करें। यदि आपका वर्कलोड ऑन-प्रेम, एज पर, या एयर-गैप्ड रहना चाहिए, तो चलाएँ [Self-Hosted Inference](/deployment/hi/self-hosted/self-hosted.md).
4. **प्रबंधित या स्व-प्रबंधित?**
   * क्लाउड में, चुनें [समर्पित परिनियोजन](/deployment/hi/roboflow-cloud/dedicated-deployments.md) जब आपको पूर्वानुमेय समर्पित प्रदर्शन या पिन किए गए GPU प्रकार की आवश्यकता हो; अन्यथा [Serverless Hosted API](/deployment/hi/roboflow-cloud/serverless-api.md) सबसे सरल डिफ़ॉल्ट है।
   * अपने स्वयं के हार्डवेयर पर, उपयोग करें [परिनियोजन प्रबंधक](/deployment/hi/self-hosted/enterprise/deployment-manager.md) (Enterprise) जब आप चाहते हैं कि Roboflow आपके लिए एज डिवाइसों के बेड़े का प्रबंधन और निगरानी करे; अन्यथा [Self-Hosted Inference](/deployment/hi/self-hosted/self-hosted.md) सर्वर स्वयं प्रबंधित करें।

एक बार जब आपने विकल्प चुन लिया हो, तो देखें [Production Readiness Checklist](/deployment/hi/production-checklist.md) त्रुटि प्रबंधन, पुनः प्रयास, दर सीमाएँ, और प्रतिकृति आकार निर्धारण के लिए।

## Inference बनाम अन्य डिप्लॉयमेंट स्टैक

Roboflow Inference कई अन्य टूल्स से मेल खाता है। यह तालिका संक्षेप में बताती है कि कब कोई अन्य स्टैक बेहतर विकल्प है, और उसे चुनने पर आप क्या खोते हैं।

### इन्फरेंस सर्वर

| टूल                    | यह कैसे तुलना करता है                                                                                                                                                                                                                                                | इसे चुनें यदि                                                                                                            |
| ---------------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------ |
| **NVIDIA Triton**      | ML विशेषज्ञों के लिए बड़े पैमाने पर डिप्लॉय करने का एक शक्तिशाली साधन, जो NVIDIA हार्डवेयर पर अत्यधिक अनुकूलित पाइपलाइनों पर केंद्रित है। यह सरलता और पुनरावृत्ति गति को कच्ची गति के बदले त्यागता है, और इसके model ensembles Workflows की तुलना में अधिक कठोर हैं। | आप एक ML विशेषज्ञ हैं, एक कड़ाई से परिभाषित परियोजना पर, जहाँ सबसे ऊपर NVIDIA GPUs पर गति को महत्व दिया जाता है।         |
| **Lightning LitServe** | हल्का, अनुकूलन योग्य, और कार्य-अज्ञेय (NLP, ऑडियो, tabular के साथ-साथ vision), इसलिए कंप्यूटर विज़न के लिए यह उतना फीचर-समृद्ध नहीं है और इसमें अंतर्निहित वीडियो स्ट्रीमिंग या model-chaining abstraction नहीं है।                                                  | आप सामान्य-उद्देश्य ML कार्यों पर काम कर रहे हैं और अपना सर्वर खुद बनाने के बजाय एक फीचर-समृद्ध शुरुआती बिंदु चाहते हैं। |
| **TensorFlow Serving** | यदि आप कई मोडालिटीज़ में TensorFlow में गहराई से निवेशित हैं, तो यह अच्छा है। इसे सेट अप करना जटिल हो सकता है और इसमें pre- और post-processing जैसी बुनियादी सुविधाएँ नहीं हैं, जिनके लिए अक्सर कस्टम कोड की जरूरत होती है।                                          | TensorFlow इकोसिस्टम आपके लिए बहुत मायने रखता है और आप मेहनत करने को तैयार हैं।                                          |
| **TorchServe**         | PyTorch समकक्ष, जो vision, NLP, tabular data, और audio में PyTorch मॉडलों को सर्व करने के लिए अनुकूलित है। बड़े पैमाने के क्लाउड डिप्लॉयमेंट्स के लिए डिज़ाइन किया गया है और वीडियो स्ट्रीमिंग जैसी vision-विशिष्ट सुविधाओं में हल्का है।                            | आप PyTorch मॉडल डिप्लॉयमेंट को स्केल और कस्टमाइज़ करना चाहते हैं और vision-विशिष्ट कार्यक्षमता की आवश्यकता नहीं है।      |
| **FastAPI या Flask**   | अपना खुद का बनाना। Inference का अपना HTTP इंटरफ़ेस FastAPI पर बनाया गया है, इसलिए शुरुआत से शुरू करने का मतलब है पहले से हल की गई समस्याओं को दोबारा बनाना।                                                                                                          | आपका मुख्य लक्ष्य इन्फरेंस सर्वर बनाने की बारीकियाँ सीखना है।                                                            |

### एज डिप्लॉयमेंट

| टूल                   | यह कैसे तुलना करता है                                                                                                                                                                                                                                          | इसे चुनें यदि                                                                                                                  |
| --------------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------ |
| **Edge Impulse**      | बहुत कम-शक्ति वाले edge devices और embedded systems पर केंद्रित, और microcontrollers के साथ विशेष रूप से अच्छा। इसका TinyML फोकस इसे वीडियो प्रोसेसिंग और आधुनिक state-of-the-art मॉडलों के लिए कम उपयुक्त बनाता है, और इसमें Workflows के समकक्ष कुछ नहीं है। | आप एक IoT या wearable डिवाइस बना रहे हैं जो अधिक शक्तिशाली मॉडल नहीं चला सकता।                                                 |
| **NVIDIA DeepStream** | TensorRT और CUDA का उपयोग करते हुए अत्यधिक अनुकूलित वीडियो पाइपलाइनों के लिए NVIDIA का प्लेटफ़ॉर्म, जो Inference जैसी ही कई समस्याओं को लक्षित करता है। इसका सीखने का वक्र खड़ा है, NVIDIA टूलिंग की जानकारी की आवश्यकता होती है, और यह ओपन सोर्स नहीं है।     | आप एक विशेषज्ञ हैं जो उस एकल परियोजना को अनुकूलित करने में भारी निवेश करने को तैयार हैं, जहाँ throughput प्राथमिक उद्देश्य है। |
