For the complete documentation index, see llms.txt. This page is also available as Markdown.

Parallel HTTP API

उच्च throughput और कम latency के लिए inference अनुरोधों को asynchronously process करने हेतु Roboflow Inference parallel HTTP server चलाएँ।

आप समानांतर प्रोसेसिंग के साथ कई मॉडलों को समानांतर में चला सकते हैं, जो Roboflow Inference का एक संस्करण है जो inference अनुरोधों को असिंक्रोनस रूप से प्रोसेस करता है।

Inference Parallel, Roboflow Inference जैसी ही सुविधाओं का समर्थन करता है, सिवाय इसके कि यह core models (CLIP और SAM) का समर्थन नहीं करता।

Inference Parallel के साथ, preprocessing, auto batching, inference, और post-processing सभी अलग-अलग थ्रेड्स में चलते हैं ताकि सर्वर FPS throughput बढ़ सके। उसी मॉडल के लिए अलग-अलग अनुरोधों को on the fly बैच किया जाता है, जैसा कि द्वारा अनुमति दी जाती है $MAX_BATCH_SIZE, और फिर response handling स्वतंत्र रूप से होती है। Images को Python के माध्यम से पास किया जाता है SharedMemory मॉड्यूल, ताकि throughput अधिकतम हो सके।

इन परिवर्तनों के परिणामस्वरूप एक मापे गए workload पर 76% की गति वृद्धि तक हुई।

समानांतर प्रोसेसिंग के साथ Inference कैसे चलाएँ

सबसे पहले, parallel server बनाइए:

./inference/enterprise/parallel/build.sh

फिर server चलाइए:

./inference/enterprise/parallel/run.sh

टर्मिनल में एक संदेश दिखाई देता है जो बताता है कि server चल रहा है और उपयोग के लिए तैयार है।

Docker Hub पर एक container प्रकाशित किया गया है:

docker pull roboflow/roboflow-inference-server-gpu-parallel:latest

यदि आप एक pinned tag pull कर रहे हैं, तो $TAG variable को run.sh में उसी के अनुसार बदलें।

बेंचमार्क

हमने Inference Parallel के प्रदर्शन का मूल्यांकन Roboflow Universeसे विभिन्न मॉडलों पर किया, और उसी हार्डवेयर पर Inference Server 0.9.5.rc के साथ इसकी तुलना की: आठ कोरों और एक GPU वाला कंप्यूटर। Instance segmentation मेट्रिक्स की गणना "mask_decode_mode": "fast" को अनुरोध बॉडी में शामिल करके की गई। अनुरोध 1000 की parallelism के साथ एक साथ भेजे गए थे।

Workspace
मॉडल
मॉडल प्रकार
विभाजन
0.9.5.rc FPS
0.9.5.parallel FPS

senior-design-project-j9gpp

nbafootage/3

वस्तु-पहचान

प्रशिक्षण

30.2 fps

44.03 fps

niklas-bommersbach-jyjff

dart-scorer/8

वस्तु-पहचान

प्रशिक्षण

26.6 fps

47.0 fps

geonu

water-08xpr/1

इंस्टेंस सेगमेंटेशन

सत्यापन

4.7 fps

6.1 fps

university-of-bradford

detecting-drusen_1/2

इंस्टेंस सेगमेंटेशन

प्रशिक्षण

6.2 fps

7.2 fps

fy-project-y9ecd

cataract-detection-viwsu/2

वर्गीकरण

प्रशिक्षण

48.5 fps

65.4 fps

hesunyu

playing-cards-ir0wr/1

वर्गीकरण

प्रशिक्षण

44.6 fps

57.7 fps

समानांतर प्रोसेसिंग सक्षम करने के साथ Inference ने हर परीक्षण में अधिक FPS प्राप्त किया। कुछ मॉडलों पर FPS वृद्धि 10 FPS से अधिक थी।

अंतिम अपडेट

क्या यह उपयोगी था?