For the complete documentation index, see llms.txt. This page is also available as Markdown.

आउटलायर पहचानें

पिछले डेटा की तुलना में आउटलायर एम्बेडिंग्स की पहचान करें।

von Mises-Fisher सांख्यिकीय वितरण विश्लेषण का उपयोग करके पूर्व डेटा की तुलना में आउटलायर एम्बेडिंग्स की पहचान करें, ताकि वर्तमान एम्बेडिंग वेक्टरों की ऐतिहासिक एम्बेडिंग्स की स्लाइडिंग विंडो के विरुद्ध तुलना करके गुणवत्ता नियंत्रण, अनोमली डिटेक्शन और डेटा सैंपलिंग वर्कफ़्लो के लिए असामान्यताओं, असामान्य पैटर्नों या सामान्य व्यवहार से विचलनों का पता लगाया जा सके।

यह ब्लॉक कैसे काम करता है

यह ब्लॉक दिशात्मक सांख्यिकी का उपयोग करके एम्बेडिंग वेक्टरों की ऐतिहासिक डेटा से सांख्यिकीय तुलना करके आउटलायर का पता लगाता है। यह ब्लॉक:

  1. वर्तमान डेटा बिंदु की विशेषताओं का प्रतिनिधित्व करने वाला एक एम्बेडिंग वेक्टर प्राप्त करता है

  2. एम्बेडिंग को इकाई लंबाई पर सामान्यीकृत करता है:

    • दिशात्मक विश्लेषण के लिए एम्बेडिंग को एक यूनिट वेक्टर (लंबाई = 1) में बदलता है

    • दूरी-आधारित मेट्रिक्स के बजाय कोणीय/दिशात्मक सांख्यिकी का उपयोग करके तुलना सक्षम करता है

    • शून्य वेक्टरों को सामान्यीकरण छोड़कर सहजता से संभालता है

  3. नमूना संख्या और वार्मअप स्थिति को ट्रैक करता है:

    • प्रत्येक संसाधित एम्बेडिंग के लिए नमूना काउंटर बढ़ाता है

    • निर्धारित करता है कि क्या यह अभी भी वार्मअप अवधि में है (नमूने < वार्मअप पैरामीटर)

    • वार्मअप के दौरान, आधाररेखा स्थापित करने के लिए कोई आउट्लायर पहचाने नहीं जाते

  4. ऐतिहासिक एम्बेडिंग्स की एक स्लाइडिंग विंडो बनाए रखता है:

    • नॉर्मलाइज़्ड एम्बेडिंग्स को ऐसे बफ़र में संग्रहीत करता है जो window_size तक बढ़ता है

    • जब बफ़र window_size से अधिक हो जाता है, तो सबसे पुरानी एम्बेडिंग्स को हटाता है (FIFO)

    • सांख्यिकीय तुलना के लिए हालिया डेटा का एक रोलिंग इतिहास बनाता है

  5. वार्मअप पूरा होने पर von Mises-Fisher (vMF) वितरण पैरामीटर फिट करता है:

    • औसत दिशा (mu): सभी ऐतिहासिक एम्बेडिंग्स की औसत दिशा की गणना करता है

    • सांद्रता पैरामीटर (kappa): मापता है कि एम्बेडिंग्स औसत के चारों ओर कितनी कसकर गुच्छित हैं

    • एम्बेडिंग दिशाओं के वितरण का मॉडल बनाने के लिए सांख्यिकीय अनुमान का उपयोग करता है

    • vMF वितरण हाइपरस्फीयर (यूनिट वेक्टर) पर दिशात्मक डेटा के लिए आदर्श है

  6. वर्तमान एम्बेडिंग के लिए संरेखण स्कोर की गणना करता है:

    • वर्तमान नॉर्मलाइज़्ड एम्बेडिंग और औसत दिशा वेक्टर के बीच डॉट प्रोडक्ट की गणना करता है

    • मापता है कि वर्तमान एम्बेडिंग सामान्य दिशा के साथ कितनी अच्छी तरह संरेखित है

    • उच्च मान मानक के अधिक निकट संरेखण दर्शाते हैं, निम्न मान विचलन दर्शाते हैं

  7. वर्तमान एम्बेडिंग का प्रायोगिक परसेंटाइल गणना करता है:

    • औसत दिशा के विरुद्ध सभी ऐतिहासिक एम्बेडिंग्स के संरेखण स्कोर की गणना करता है

    • वर्तमान एम्बेडिंग के संरेखण स्कोर को ऐतिहासिक स्कोरों के बीच रैंक करता है

    • वर्तमान एम्बेडिंग की परसेंटाइल स्थिति (0.0 = सबसे कम, 1.0 = सबसे अधिक) निर्धारित करता है

  8. परसेंटाइल सीमा के आधार पर आउट्लायर स्थिति निर्धारित करता है:

    • यदि परसेंटाइल threshold_percentile से कम हो (जैसे, निचले 5%) तो आउटलायर के रूप में चिह्नित करता है

    • यदि परसेंटाइल (1 - threshold_percentile) से अधिक हो (जैसे, शीर्ष 5%) तो आउटलायर के रूप में चिह्नित करता है

    • मानक से अत्यधिक निम्न और अत्यधिक उच्च दोनों प्रकार के विचलनों का पता लगाता है

  9. तीन आउटपुट लौटाता है:

    • आउटलायर-स्थिति: वर्तमान एम्बेडिंग के आउटलायर होने का संकेत देने वाला बूलियन फ़्लैग

    • परसेंटाइल: फ़्लोट मान (0.0-1.0) जो दर्शाता है कि एम्बेडिंग ऐतिहासिक डेटा में कहाँ रैंक करती है

    • वार्मअप: बूलियन फ़्लैग जो दर्शाता है कि क्या अभी भी वार्मअप अवधि में है (वार्मअप के बाद हमेशा False)

यह ब्लॉक von Mises-Fisher वितरण विश्लेषण का उपयोग करता है, जो हाइपरस्फीयर (यूनिट वेक्टर) पर दिशात्मक डेटा के लिए बनाया गया है। यह इसे उच्च-आयामी एम्बेडिंग्स के लिए उपयुक्त बनाता है, जहाँ दिशा परिमाण से अधिक महत्वपूर्ण होती है। स्लाइडिंग विंडो दृष्टिकोण यह सुनिश्चित करता है कि सांख्यिकीय मॉडल हालिया रुझानों के अनुसार ढलता रहे, जबकि परसेंटाइल-आधारित डिटेक्शन उन एम्बेडिंग्स की पहचान करता है जो ऐतिहासिक पैटर्न से असामान्य रूप से अलग हैं। कम परसेंटाइल उन एम्बेडिंग्स को दर्शाते हैं जो सामान्य पैटर्न से कम संरेखित हैं, जबकि उच्च परसेंटाइल उन एम्बेडिंग्स को दर्शाते हैं जो असामान्य रूप से अधिक संरेखित हैं या सकारात्मक दिशा में भिन्न हैं।

सामान्य उपयोग के मामले

  • असामान्यता पहचान: सामान्य डेटा से विचलित होने वाली असामान्य छवियों, वस्तुओं, या पैटर्नों का पता लगाएँ (जैसे, असामान्य उत्पाद भिन्नताओं की पहचान करना, असामान्य व्यवहार का पता लगाना, अप्रत्याशित पैटर्नों को चिह्नित करना), जिससे असामान्यता पहचान वर्कफ़्लो सक्षम हों

  • गुणवत्ता नियंत्रण: निर्माण या उत्पादन में दोषपूर्ण या असामान्य वस्तुओं की पहचान करें (जैसे, उत्पाद दोषों का पता लगाना, गुणवत्ता समस्याओं की पहचान करना, निर्माण संबंधी अनोमलियों को चिह्नित करना), जिससे गुणवत्ता नियंत्रण वर्कफ़्लो सक्षम हों

  • डेटा सैंपलिंग: मैनुअल समीक्षा या आगे के विश्लेषण के लिए रोचक या असामान्य डेटा बिंदुओं की पहचान करें (जैसे, लेबलिंग के लिए असामान्य छवियों का सैंपल लेना, मॉडल सुधार के लिए एज केस की पहचान करना, विश्लेषण के लिए रोचक डेटा चुनना), जिससे बुद्धिमान डेटा सैंपलिंग वर्कफ़्लो सक्षम हों

  • परिवर्तन पहचान: पता लगाएँ जब डेटा पैटर्न ऐतिहासिक मानकों से महत्वपूर्ण रूप से बदलते हैं (जैसे, दृश्य परिवर्तन का पता लगाना, पैटर्न बदलावों की पहचान करना, महत्वपूर्ण भिन्नताओं को चिह्नित करना), जिससे परिवर्तन पहचान वर्कफ़्लो सक्षम हों

  • मॉडल मॉनिटरिंग: प्रशिक्षण वितरण से एम्बेडिंग्स के विचलन का पता लगाकर मॉडल प्रदर्शन की निगरानी करें (जैसे, वितरण शिफ्ट का पता लगाना, आउट-ऑफ-डिस्ट्रिब्यूशन डेटा की पहचान करना, मॉडल ड्रिफ्ट की निगरानी करना), जिससे मॉडल मॉनिटरिंग वर्कफ़्लो सक्षम हों

  • सामग्री फ़िल्टरिंग: अपेक्षित पैटर्नों से अलग असामान्य या अनुपयुक्त सामग्री की पहचान करें (जैसे, असामान्य सामग्री का पता लगाना, अनुपयुक्त सामग्री को चिह्नित करना, सामग्री अनोमलियों की पहचान करना), जिससे सामग्री फ़िल्टरिंग वर्कफ़्लो सक्षम हों

अन्य ब्लॉक्स से कनेक्ट करना

यह ब्लॉक एम्बेडिंग्स प्राप्त करता है और is_outlier, percentile, तथा warming_up आउटपुट उत्पन्न करता है:

  • एम्बेडिंग मॉडल ब्लॉकों के बाद (CLIP, Perception Encoder, आदि) का उपयोग करके एम्बेडिंग आउटलायरों का विश्लेषण करें (जैसे, CLIP एम्बेडिंग्स से आउटलायर की पहचान करना, Perception Encoder आउटलायरों का विश्लेषण करना, एम्बेडिंग्स से अनोमलियों का पता लगाना), जिससे एम्बेडिंग-से-आउटलायर वर्कफ़्लो सक्षम हों

  • वर्गीकरण या पहचान ब्लॉकों के बाद एम्बेडिंग्स के साथ असामान्य पूर्वानुमानों की पहचान करें (जैसे, असामान्य डिटेक्शनों की पहचान करना, अनोमलस वर्गीकरणों को चिह्नित करना, आउटलायर पूर्वानुमानों का पता लगाना), जिससे पूर्वानुमान-से-आउटलायर वर्कफ़्लो सक्षम हों

  • लॉजिक ब्लॉक्स से पहले जैसे Continue If का उपयोग करके आउटलायर पहचान के आधार पर निर्णय लें (जैसे, यदि आउटलायर पाया जाए तो जारी रखना, आउटलायर स्थिति के आधार पर फ़िल्टर करना, अनोमलियों पर कार्रवाई ट्रिगर करना), जिससे आउटलायर-आधारित निर्णय वर्कफ़्लो सक्षम हों

  • सूचना ब्लॉकों से पहले आउटलायर पहचान पर अलर्ट करें (जैसे, अनोमलियों पर अलर्ट करना, असामान्य डेटा के बारे में सूचित करना, आउटलायर पर अलर्ट ट्रिगर करना), जिससे आउटलायर-आधारित अधिसूचना वर्कफ़्लो सक्षम हों

  • डेटा संग्रहण ब्लॉकों से पहले आउटलायर जानकारी रिकॉर्ड करने के लिए (जैसे, आउटलायर डेटा लॉग करना, अनोमली सांख्यिकी संग्रहीत करना, असामान्य डेटा बिंदुओं को रिकॉर्ड करना), जिससे आउटलायर डेटा लॉगिंग वर्कफ़्लो सक्षम हों

  • गुणवत्ता नियंत्रण पाइपलाइनों में जहाँ आउटलायर पहचान गुणवत्ता आश्वासन का हिस्सा है (जैसे, गुणवत्ता पाइपलाइनों में आउटलायरों को फ़िल्टर करना, उत्पादन वर्कफ़्लो में समस्याओं की पहचान करना, प्रसंस्करण शृंखलाओं में समस्याओं का पता लगाना), जिससे गुणवत्ता नियंत्रण वर्कफ़्लो सक्षम हों

आवश्यकताएँ

इस ब्लॉक को इनपुट के रूप में एम्बेडिंग्स की आवश्यकता होती है (आमतौर पर CLIP या Perception Encoder जैसे एम्बेडिंग मॉडल ब्लॉकों से)। यह ब्लॉक वर्कफ़्लो निष्पादनों के दौरान आंतरिक स्थिति बनाए रखता है, और ऐतिहासिक एम्बेडिंग्स की एक स्लाइडिंग विंडो को संचित करता है। वार्मअप अवधि (पहले वार्मअप सैंपल्स) के दौरान, कोई आउटलायर पहचाने नहीं जाते और ब्लॉक is_outlier=False तथा percentile=0.5 लौटाता है। वार्मअप के बाद, ब्लॉक सांख्यिकीय आधाररेखा स्थापित करने के लिए कम से कम वार्मअप एम्बेडिंग्स (तक विंडो आकार एम्बेडिंग्स) का उपयोग करता है। threshold_percentile पैरामीटर (0.0-1.0) संवेदनशीलता को नियंत्रित करता है - कम मान (जैसे, 0.01) केवल अत्यधिक आउटलायरों का पता लगाते हैं, जबकि उच्च मान (जैसे, 0.1) अधिक मध्यम विचलनों का पता लगाते हैं। यह ब्लॉक सुसंगत एम्बेडिंग मॉडलों के साथ सबसे अच्छा काम करता है और आपके डेटा में अपेक्षित भिन्नता के आधार पर threshold_percentile समायोजन की आवश्यकता हो सकती है।

प्रकार पहचानकर्ता

स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/identify_outliers@v1 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।

गुण

नाम

प्रकार

विवरण

संदर्भ

name

str

वर्कफ़्लोज़ में चरण का विशिष्ट नाम।

सीमा परसेंटाइल

float

आउटलायर पहचान के लिए परसेंटाइल थ्रेशहोल्ड, सीमा 0.0-1.0। इस परसेंटाइल से नीचे या (1 - threshold_percentile) से ऊपर की एम्बेडिंग्स को आउटलायर के रूप में चिह्नित किया जाता है। कम मान (जैसे, 0.01) केवल अत्यधिक आउटलायरों का पता लगाते हैं - बहुत सख्त। उच्च मान (जैसे, 0.1) अधिक मध्यम विचलनों का पता लगाते हैं - अधिक संवेदनशील। डिफ़ॉल्ट 0.05 का अर्थ है निचले 5% और शीर्ष 5% आउटलायर हैं। अपने डेटा में अपेक्षित भिन्नता के आधार पर समायोजित करें..

वार्मअप

int

आउटलायर पहचान शुरू होने से पहले आवश्यक प्रारंभिक डेटा बिंदुओं की संख्या। वार्मअप के दौरान, कोई आउटलायर पहचाने नहीं जाते (is_outlier=False) ताकि आधाररेखा स्थापित हो सके। सांख्यिकीय विश्लेषण के लिए कम से कम 2 होना चाहिए। सामान्य सीमा: 3-100 सैंपल्स। अधिक मान अधिक स्थिर आधाररेखाएँ प्रदान करते हैं लेकिन आउटलायर पहचान में देरी करते हैं। कम मान तेज़ पहचान सक्षम करते हैं लेकिन प्रारंभ में कम सटीक हो सकते हैं..

विंडो आकार

int

स्लाइडिंग विंडो में बनाए रखने के लिए ऐतिहासिक एम्बेडिंग्स की अधिकतम संख्या। यह ब्लॉक सांख्यिकीय तुलना के लिए सबसे हाल की window_size एम्बेडिंग्स रखता है। सीमा से अधिक होने पर, सबसे पुरानी एम्बेडिंग्स हटा दी जाती हैं (FIFO)। बड़ी विंडो अधिक स्थिर सांख्यिकी प्रदान करती हैं लेकिन वितरण परिवर्तनों के अनुसार धीमी गति से अनुकूलित होती हैं। छोटी विंडो तेज़ी से अनुकूलित होती हैं लेकिन कम स्थिर हो सकती हैं। असीमित विंडो के लिए None पर सेट करें (सभी ऐतिहासिक डेटा का उपयोग करता है)। सामान्य सीमा: 10-100 एम्बेडिंग्स..

यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।

रनटाइम संगतता

सॉफ्ट - रनटाइम hosted_serverless, dedicated_deployment; निष्पादन दूरस्थ; इनपुट वीडियो : ब्लॉक प्रति-वीडियो स्थिति को प्रक्रिया मेमोरी में बनाए रखता है (video_metadata.video_identifier द्वारा कुंजीबद्ध)। स्टेटलेस या मल्टी-रिप्लिका HTTP रनटाइम्स पर दूरस्थ स्टेप निष्पादन के साथ, क्रमिक अनुरोधों को अलग-अलग वर्कर प्रक्रियाएँ सर्व कर सकती हैं, इसलिए कॉल्स के बीच स्थिति रीसेट हो जाती है और आउटपुट ट्रैकिंग / काउंटिंग / एग्रीगेशन के लिए अर्थहीन हो जाता है। स्थिर फ़्रेम-से-फ़्रेम परिणामों के लिए एक स्थायी WebRTC सत्र में स्थानीय स्टेप निष्पादन का उपयोग करें।

सॉफ्ट - इनपुट छवि : ब्लॉक वीडियो या दोहराए गए-फ़्रेम वर्कफ़्लो से समयगत संदर्भ पर निर्भर करता है। एक स्थिर छवि/फ़ोटो के साथ, ट्रैक करने, तुलना करने, समेकित करने या दृश्यीकृत करने के लिए कोई अर्थपूर्ण इतिहास नहीं होता, इसलिए ब्लॉक बहुत कम या कोई लाभ नहीं देता।

इनपुट और आउटपुट बाइंडिंग्स

उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार आउटलायर्स की पहचान करें संस्करण v1 है।

इनपुट और आउटपुट बाइंडिंग्स
  • इनपुट

    • एम्बेडिंग (एम्बेडिंग): वर्तमान डेटा बिंदु की विशेषताओं का प्रतिनिधित्व करने वाला एम्बेडिंग वेक्टर। आमतौर पर CLIP या Perception Encoder जैसे एम्बेडिंग मॉडलों से। von Mises-Fisher वितरण का उपयोग करके दिशात्मक सांख्यिकीय विश्लेषण के लिए एम्बेडिंग को यूनिट लंबाई पर नॉर्मलाइज़ किया जाता है। यह किसी भी आयाम का संख्यात्मक वेक्टर होना चाहिए..

    • सीमा परसेंटाइल (float_zero_to_one): आउटलायर पहचान के लिए परसेंटाइल थ्रेशहोल्ड, सीमा 0.0-1.0। इस परसेंटाइल से नीचे या (1 - threshold_percentile) से ऊपर की एम्बेडिंग्स को आउटलायर के रूप में चिह्नित किया जाता है। कम मान (जैसे, 0.01) केवल अत्यधिक आउटलायरों का पता लगाते हैं - बहुत सख्त। उच्च मान (जैसे, 0.1) अधिक मध्यम विचलनों का पता लगाते हैं - अधिक संवेदनशील। डिफ़ॉल्ट 0.05 का अर्थ है निचले 5% और शीर्ष 5% आउटलायर हैं। अपने डेटा में अपेक्षित भिन्नता के आधार पर समायोजित करें..

    • वार्मअप (पूर्णांक): आउटलायर पहचान शुरू होने से पहले आवश्यक प्रारंभिक डेटा बिंदुओं की संख्या। वार्मअप के दौरान, कोई आउटलायर पहचाने नहीं जाते (is_outlier=False) ताकि आधाररेखा स्थापित हो सके। सांख्यिकीय विश्लेषण के लिए कम से कम 2 होना चाहिए। सामान्य सीमा: 3-100 सैंपल्स। अधिक मान अधिक स्थिर आधाररेखाएँ प्रदान करते हैं लेकिन आउटलायर पहचान में देरी करते हैं। कम मान तेज़ पहचान सक्षम करते हैं लेकिन प्रारंभ में कम सटीक हो सकते हैं..

    • विंडो आकार (पूर्णांक): स्लाइडिंग विंडो में बनाए रखने के लिए ऐतिहासिक एम्बेडिंग्स की अधिकतम संख्या। यह ब्लॉक सांख्यिकीय तुलना के लिए सबसे हाल की window_size एम्बेडिंग्स रखता है। सीमा से अधिक होने पर, सबसे पुरानी एम्बेडिंग्स हटा दी जाती हैं (FIFO)। बड़ी विंडो अधिक स्थिर सांख्यिकी प्रदान करती हैं लेकिन वितरण परिवर्तनों के अनुसार धीमी गति से अनुकूलित होती हैं। छोटी विंडो तेज़ी से अनुकूलित होती हैं लेकिन कम स्थिर हो सकती हैं। असीमित विंडो के लिए None पर सेट करें (सभी ऐतिहासिक डेटा का उपयोग करता है)। सामान्य सीमा: 10-100 एम्बेडिंग्स..

  • आउटपुट

    • आउटलायर-स्थिति (boolean): बूलियन फ़्लैग.

    • परसेंटाइल (float_zero_to_one): float दायरे में मान [0.0, 1.0].

    • वार्मअप (boolean): बूलियन फ़्लैग.

उदाहरण JSON परिभाषा

अंतिम अपडेट

क्या यह उपयोगी था?