> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/hi/self-hosted/enterprise/parallel-http-api.md).

# Parallel HTTP API

{% hint style="warning" %}
**एंटरप्राइज़ सुविधा।** यह सुविधा केवल Roboflow Enterprise उपयोगकर्ताओं के लिए उपलब्ध है। [बिक्री टीम से संपर्क करें](https://roboflow.com/sales) Roboflow Enterprise के बारे में अधिक जानने के लिए।
{% endhint %}

आप समानांतर प्रोसेसिंग के साथ कई मॉडलों को समानांतर में चला सकते हैं, जो Roboflow Inference का एक संस्करण है जो inference अनुरोधों को असिंक्रोनस रूप से प्रोसेस करता है।

Inference Parallel, Roboflow Inference जैसी ही सुविधाओं का समर्थन करता है, सिवाय इसके कि यह core models (CLIP और SAM) का समर्थन नहीं करता।

Inference Parallel के साथ, preprocessing, auto batching, inference, और post-processing सभी अलग-अलग थ्रेड्स में चलते हैं ताकि सर्वर FPS throughput बढ़ सके। उसी मॉडल के लिए अलग-अलग अनुरोधों को on the fly बैच किया जाता है, जैसा कि द्वारा अनुमति दी जाती है `$MAX_BATCH_SIZE`, और फिर response handling स्वतंत्र रूप से होती है। Images को Python के माध्यम से पास किया जाता है `SharedMemory` मॉड्यूल, ताकि throughput अधिकतम हो सके।

इन परिवर्तनों के परिणामस्वरूप एक मापे गए workload पर **76% की गति वृद्धि** तक हुई।

## समानांतर प्रोसेसिंग के साथ Inference कैसे चलाएँ

{% tabs %}
{% tab title="Bash" %}
सबसे पहले, parallel server बनाइए:

```bash
./inference/enterprise/parallel/build.sh
```

फिर server चलाइए:

```bash
./inference/enterprise/parallel/run.sh
```

टर्मिनल में एक संदेश दिखाई देता है जो बताता है कि server चल रहा है और उपयोग के लिए तैयार है।
{% endtab %}

{% tab title="Docker" %}
Docker Hub पर एक container प्रकाशित किया गया है:

```bash
docker pull roboflow/roboflow-inference-server-gpu-parallel:latest
```

यदि आप एक pinned tag pull कर रहे हैं, तो `$TAG` variable को `run.sh` में उसी के अनुसार बदलें।
{% endtab %}
{% endtabs %}

## बेंचमार्क

हमने Inference Parallel के प्रदर्शन का मूल्यांकन [Roboflow Universe](https://universe.roboflow.com/)से विभिन्न मॉडलों पर किया, और उसी हार्डवेयर पर Inference Server 0.9.5.rc के साथ इसकी तुलना की: आठ कोरों और एक GPU वाला कंप्यूटर। Instance segmentation मेट्रिक्स की गणना `"mask_decode_mode": "fast"` को अनुरोध बॉडी में शामिल करके की गई। अनुरोध 1000 की parallelism के साथ एक साथ भेजे गए थे।

| Workspace                   | मॉडल                       | मॉडल प्रकार         | विभाजन    | 0.9.5.rc FPS | 0.9.5.parallel FPS |
| --------------------------- | -------------------------- | ------------------- | --------- | ------------ | ------------------ |
| senior-design-project-j9gpp | nbafootage/3               | वस्तु-पहचान         | प्रशिक्षण | 30.2 fps     | 44.03 fps          |
| niklas-bommersbach-jyjff    | dart-scorer/8              | वस्तु-पहचान         | प्रशिक्षण | 26.6 fps     | 47.0 fps           |
| geonu                       | water-08xpr/1              | इंस्टेंस सेगमेंटेशन | सत्यापन   | 4.7 fps      | 6.1 fps            |
| university-of-bradford      | detecting-drusen\_1/2      | इंस्टेंस सेगमेंटेशन | प्रशिक्षण | 6.2 fps      | 7.2 fps            |
| fy-project-y9ecd            | cataract-detection-viwsu/2 | वर्गीकरण            | प्रशिक्षण | 48.5 fps     | 65.4 fps           |
| hesunyu                     | playing-cards-ir0wr/1      | वर्गीकरण            | प्रशिक्षण | 44.6 fps     | 57.7 fps           |

समानांतर प्रोसेसिंग सक्षम करने के साथ Inference ने हर परीक्षण में अधिक FPS प्राप्त किया। कुछ मॉडलों पर FPS वृद्धि 10 FPS से अधिक थी।
