For the complete documentation index, see llms.txt. This page is also available as Markdown.

Workflows बेंचमार्क

प्रत्यक्ष मॉडल इन्फ़रेंस की विलंबता की तुलना उस ही मॉडल से करें जिसे Workflow में लपेटा गया हो।

यह पृष्ठ तुलना करता है प्रत्यक्ष मॉडल इन्फ़रेंस विलंबता बनाम वर्कफ़्लो-आवृत इन्फ़रेंस लोकप्रिय डिटेक्शन मॉडलों के लिए विलंबता। इसका लक्ष्य Workflows निष्पादन इंजन द्वारा जोड़े गए ओवरहेड को मापना है।

स्व-होस्ट किए गए परिणाम

सभी समय में हैं मिलीसेकंड. बेंचमार्क एक सर्वर-ग्रेड NVIDIA GPU पर TensorRT-अनुकूलित मॉडलों के साथ चलाए गए, जिन्हें सीधे inference Python पैकेज के माध्यम से कॉल किया गया। प्रत्येक मॉडल को समय मापने से पहले वार्म अप किया गया, फिर 10 इटरेशन पर मापा गया।

मॉडल
औसत प्रत्यक्ष (ms)
औसत वर्कफ़्लो (ms)
वर्कफ़्लो ओवरहेड (ms)

rfdetr-nano

2.65

4.40

1.75

rfdetr-small

3.17

4.62

1.45

rfdetr-medium

3.79

5.38

1.59

rfdetr-large

4.87

7.46

2.59

rfdetr-xlarge

8.44

10.65

2.21

yolo26n-640

2.42

4.07

1.65

yolo26s-640

3.25

5.48

2.23

yolo26m-640

4.56

6.29

1.73

yolo26l-640

5.76

8.01

2.25

yolo26x-640

7.75

9.36

1.61

मुख्य निष्कर्ष

  • वर्कफ़्लो ओवरहेड न्यूनतम है - आमतौर पर प्रत्यक्ष इन्फ़रेंस के ऊपर 1.5-2.6 ms, मॉडल आकार चाहे जो भी हो।

  • बड़े मॉडलों के लिए (उदा. rfdetr-xlarge), वर्कफ़्लो ओवरहेड मॉडल इन्फ़रेंस समय की तुलना में छोटा है (~26%).

  • छोटे, तेज़ मॉडलों के लिए (उदा. yolo26n-640), ओवरहेड अनुपात में अधिक है, लेकिन निरपेक्ष रूप से फिर भी 2 ms से कम है।

  • वर्कफ़्लो ओवरहेड CPU-आधारित है (ग्राफ़ शेड्यूलिंग, इनपुट तैयारी, आउटपुट रूटिंग), जबकि मॉडल इन्फ़रेंस स्वयं आमतौर पर GPU पर चलता है (जब उपलब्ध हो)। परिणामस्वरूप, GPU की गति चाहे जो भी हो, ओवरहेड अपेक्षाकृत स्थिर रहता है।

कार्यप्रणाली

  • GPU-त्वरित इन्फ़रेंस (परिणाम हार्डवेयर के अनुसार बदलेंगे).

  • वार्मअप: समय माप शुरू होने से पहले प्रत्येक मॉडल और वर्कफ़्लो इंजन को एक इन्फ़रेंस कॉल के साथ वार्म अप किया जाता है।

  • इटरेशन: प्रति विधि, प्रति मॉडल 10 समयबद्ध इटरेशन।

  • प्रत्यक्ष इन्फ़रेंस: उपयोग करता है get_model() और कॉल करता है model.infer() सीधे।

  • वर्कफ़्लो इन्फ़रेंस: उसी मॉडल को एक न्यूनतम एक-चरणीय वर्कफ़्लो में लपेटता है और इसे निष्पादन इंजन.

बेंचमार्क स्क्रिप्ट विस्तृत करने के लिए क्लिक करें

क्लाउड-होस्ट किए गए परिणाम

निम्नलिखित परिणाम होस्ट किए गए पर बेंचमार्क किए गए सर्वरलेस क्लाउड API. कुछ नोट्स:

  • स्व-होस्ट किए गए परिणामों की तुलना में, Serverless सर्वर को Workflow schema और मॉडल वेट्स भी फ़ेच करने पड़ते हैं (जबकि Serverless मॉडल इन्फ़रेंस केवल वेट्स फ़ेच करता है)

  • Workflows के लिए 10-50ms का स्थिर विलंबता ओवरहेड होता है

Serverless बेंचमार्क वर्कफ़्लोज़

अंतिम अपडेट

क्या यह उपयोगी था?