Parallel HTTP API
उच्च throughput और कम latency के लिए inference अनुरोधों को asynchronously process करने हेतु Roboflow Inference parallel HTTP server चलाएँ।
अंतिम अपडेट
क्या यह उपयोगी था?
उच्च throughput और कम latency के लिए inference अनुरोधों को asynchronously process करने हेतु Roboflow Inference parallel HTTP server चलाएँ।
एंटरप्राइज़ सुविधा। यह सुविधा केवल Roboflow Enterprise उपयोगकर्ताओं के लिए उपलब्ध है। बिक्री टीम से संपर्क करें Roboflow Enterprise के बारे में अधिक जानने के लिए।
आप समानांतर प्रोसेसिंग के साथ कई मॉडलों को समानांतर में चला सकते हैं, जो Roboflow Inference का एक संस्करण है जो inference अनुरोधों को असिंक्रोनस रूप से प्रोसेस करता है।
Inference Parallel, Roboflow Inference जैसी ही सुविधाओं का समर्थन करता है, सिवाय इसके कि यह core models (CLIP और SAM) का समर्थन नहीं करता।
Inference Parallel के साथ, preprocessing, auto batching, inference, और post-processing सभी अलग-अलग थ्रेड्स में चलते हैं ताकि सर्वर FPS throughput बढ़ सके। उसी मॉडल के लिए अलग-अलग अनुरोधों को on the fly बैच किया जाता है, जैसा कि द्वारा अनुमति दी जाती है $MAX_BATCH_SIZE, और फिर response handling स्वतंत्र रूप से होती है। Images को Python के माध्यम से पास किया जाता है SharedMemory मॉड्यूल, ताकि throughput अधिकतम हो सके।
इन परिवर्तनों के परिणामस्वरूप एक मापे गए workload पर 76% की गति वृद्धि तक हुई।
सबसे पहले, parallel server बनाइए:
./inference/enterprise/parallel/build.shफिर server चलाइए:
./inference/enterprise/parallel/run.shटर्मिनल में एक संदेश दिखाई देता है जो बताता है कि server चल रहा है और उपयोग के लिए तैयार है।
Docker Hub पर एक container प्रकाशित किया गया है:
docker pull roboflow/roboflow-inference-server-gpu-parallel:latestयदि आप एक pinned tag pull कर रहे हैं, तो $TAG variable को run.sh में उसी के अनुसार बदलें।
हमने Inference Parallel के प्रदर्शन का मूल्यांकन Roboflow Universeसे विभिन्न मॉडलों पर किया, और उसी हार्डवेयर पर Inference Server 0.9.5.rc के साथ इसकी तुलना की: आठ कोरों और एक GPU वाला कंप्यूटर। Instance segmentation मेट्रिक्स की गणना "mask_decode_mode": "fast" को अनुरोध बॉडी में शामिल करके की गई। अनुरोध 1000 की parallelism के साथ एक साथ भेजे गए थे।
senior-design-project-j9gpp
nbafootage/3
वस्तु-पहचान
प्रशिक्षण
30.2 fps
44.03 fps
niklas-bommersbach-jyjff
dart-scorer/8
वस्तु-पहचान
प्रशिक्षण
26.6 fps
47.0 fps
geonu
water-08xpr/1
इंस्टेंस सेगमेंटेशन
सत्यापन
4.7 fps
6.1 fps
university-of-bradford
detecting-drusen_1/2
इंस्टेंस सेगमेंटेशन
प्रशिक्षण
6.2 fps
7.2 fps
fy-project-y9ecd
cataract-detection-viwsu/2
वर्गीकरण
प्रशिक्षण
48.5 fps
65.4 fps
hesunyu
playing-cards-ir0wr/1
वर्गीकरण
प्रशिक्षण
44.6 fps
57.7 fps
समानांतर प्रोसेसिंग सक्षम करने के साथ Inference ने हर परीक्षण में अधिक FPS प्राप्त किया। कुछ मॉडलों पर FPS वृद्धि 10 FPS से अधिक थी।
अंतिम अपडेट
क्या यह उपयोगी था?
क्या यह उपयोगी था?