For the complete documentation index, see llms.txt. This page is also available as Markdown.

Inference का बेंचमार्क करें

inference benchmark के साथ Inference Server या inference Python package की throughput और latency मापें।

इन्फरेंस बेंचमार्क आपकी सेटअप में इन्फरेंस के प्रदर्शन की जाँच करने का एक आसान तरीका प्रदान करता है। यह कमांड इन्फरेंस सर्वर और इन्फरेंस पायथन पैकेज।

का बेंचमार्किंग करना इन्फरेंस पायथन पैकेज

एक बुनियादी बेंचमार्क निम्नलिखित कमांड से चलाया जा सकता है:

inference benchmark python-package-speed \
  -m {your_model_id} \
  -d {pre-configured dataset name or path to directory with images} \
  -o {output_directory}

यह कमांड दिए गए मॉडल का उपयोग करके निर्दिष्ट संख्या में इन्फरेंस चलाता है और आँकड़े (जिनमें बेंचमार्क पैरामीटर, थ्रूपुट, लेटेंसी, त्रुटियाँ, और प्लेटफ़ॉर्म विवरण शामिल हैं) दिए गए डायरेक्टरी में सहेजता है।

इन्फरेंस सर्वर का बेंचमार्किंग

अपने लोकल इन्फरेंस सर्वर का API बेंचमार्क चलाने से पहले, सुनिश्चित करें कि सर्वर चालू है और चल रहा है:

inference server start

एक बुनियादी बेंचमार्क निम्नलिखित कमांड से चलाया जा सकता है:

यह कमांड दिए गए मॉडल का उपयोग करके निर्दिष्ट संख्या में इन्फरेंस चलाता है और आँकड़े (जिनमें बेंचमार्क पैरामीटर, थ्रूपुट, लेटेंसी, त्रुटियाँ, और प्लेटफ़ॉर्म विवरण शामिल हैं) दिए गए डायरेक्टरी में सहेजता है।

HTTP API प्रोफाइलिंग के विभिन्न तरीकों का समर्थन करने के लिए इस बेंचमार्क में अधिक कॉन्फ़िगरेशन विकल्प हैं। डिफ़ॉल्ट मोड में, एक एकल क्लाइंट शुरू किया जाता है और वह एक के बाद एक क्रमिक रूप से अनुरोध भेजता है। यह कुछ विशेष मामलों में उपयुक्त नहीं हो सकता, इसलिए आप -c {number_of_clients} विकल्प का उपयोग करके समवर्ती क्लाइंटों की संख्या निर्दिष्ट कर सकते हैं। प्रत्येक क्लाइंट पिछला अनुरोध संभाले जाने के बाद अगला अनुरोध भेजता है।

यह विकल्प अभी भी सभी परीक्षण परिदृश्यों को कवर नहीं करता। उदाहरण के लिए, आप भेजना चाह सकते हैं x प्रति सेकंड अनुरोध, जो उस प्रोडक्शन वातावरण के अधिक निकट है जहाँ कई क्लाइंट एक साथ अनुरोध भेजते हैं। इस परिदृश्य में, --rps {value} विकल्प का उपयोग किया जा सकता है (और -c को अनदेखा किया जाता है)। इसमें दिया गया मान --rps यह निर्दिष्ट करता है कि कितने अनुरोध शुरू किए जाते हैं प्रति सेकंड पिछले अनुरोधों के संभाले जाने का इंतज़ार किए बिना। I/O-गहन बेंचमार्क परिदृश्यों में, हम सुझाव देते हैं कि इस कमांड को कई अलग-अलग प्रक्रियाओं और संभवतः कई होस्टों से चलाएँ।

देखें इन्फरेंस बेंचमार्क्स इस कमांड से मापे गए प्रकाशित परिणामों के लिए।

अंतिम अपडेट

क्या यह उपयोगी था?