For the complete documentation index, see llms.txt. This page is also available as Markdown.

OCR पहचानें जोड़ें

पहचानों को स्थानिक रूप से व्यवस्थित करके OCR पहचान परिणामों को एक सुसंगत पाठ स्ट्रिंग में संयोजित करता है।

v2

व्यक्तिगत OCR डिटेक्शन परिणामों (शब्द, अक्षर, या पाठ क्षेत्रों) को स्थानिक रूप से व्यवस्थित करके, उन्हें पंक्तियों में समूहित करके, और उचित पठन क्रम में पाठ को जोड़कर सुसंगत पाठ स्ट्रिंग्स में संयोजित करें।

स्टिचिंग एल्गोरिद्म

यह ब्लॉक OCR डिटेक्शन से पाठ पुनर्निर्माण के लिए तीन एल्गोरिद्म का समर्थन करता है:

सहिष्णुता-आधारित (डिफ़ॉल्ट)

एक निश्चित पिक्सेल सहिष्णुता का उपयोग करके डिटेक्शन को पंक्तियों में समूहित करता है। सहिष्णुता दूरी के भीतर लंबवत (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) डिटेक्शन को एक ही पंक्ति में समूहित किया जाता है, फिर प्रत्येक पंक्ति के भीतर स्थिति के अनुसार क्रमबद्ध किया जाता है।

  • के लिए सर्वोत्तम: सुसंगत फ़ॉन्ट आकार और अच्छी तरह संरेखित क्षैतिज/ऊर्ध्वाधर पाठ

  • पैरामीटर: सहिष्णुता (पंक्ति समूहण के लिए पिक्सेल सीमा)

ओत्सु थ्रेशहोल्डिंग

चरित्र अंतराल को शब्द अंतराल से अलग करने वाली सर्वोत्तम सीमा को स्वचालित रूप से खोजने के लिए सामान्यीकृत अंतर दूरी पर ओत्सु की विधि का उपयोग करता है। अंतराल को स्थानीय चरित्र चौड़ाई के अनुसार सामान्यीकृत किया जाता है, जिससे यह रिज़ॉल्यूशन-स्वतंत्र बनता है।

  • के लिए सर्वोत्तम: परिवर्ती फ़ॉन्ट आकार, स्वचालित शब्द सीमा पहचान

  • पैरामीटर: otsu_threshold_multiplier (सीमा संवेदनशीलता समायोजित करें)

  • मुख्य विशेषता: एकल शब्दों को बहु-शब्द पाठ से अलग करने के लिए द्विशिखरी वितरणों का पता लगाता है

कोलिमेट (झुका हुआ पाठ)

पाठ के प्रवाह का अनुसरण करने के लिए लालची पैरेंट-चाइल्ड ट्रैवर्सल का उपयोग करता है। पहले डिटेक्शन से शुरू करके, यह बाद के उन डिटेक्शन को खोजता है जो पठन क्रम में 'follow' करते हैं (समान संरेखण + सही दिशा), और बकेटिंग के बजाय ट्रैवर्सल के माध्यम से पंक्तियाँ बनाता है।

  • के लिए सर्वोत्तम: झुका हुआ, घुमावदार, या अक्ष-असंरेखित पाठ

  • पैरामीटर: collimate_tolerance (पिक्सेल में संरेखण सहिष्णुता)

  • नोट: शब्द सीमाओं का पता नहीं लगाता - उपयोग करें डिलिमिटर पैरामीटर यदि रिक्ति की आवश्यकता हो

पठन दिशाएँ

सभी एल्गोरिद्म कई पठन दिशाओं का समर्थन करते हैं:

  • left_to_right: मानक क्षैतिज (अंग्रेज़ी, अधिकांश भाषाएँ)

  • right_to_left: दाएँ-से-बाएँ (अरबी, हिब्रू)

  • vertical_top_to_bottom: ऊर्ध्वाधर ऊपर-से-नीचे (पारंपरिक चीनी, जापानी)

  • vertical_bottom_to_top: ऊर्ध्वाधर नीचे-से-ऊपर

  • auto: बाउंडिंग बॉक्स के आयामों के आधार पर स्वचालित रूप से पता लगाता है

सामान्य उपयोग के मामले

  • दस्तावेज़ OCR: वर्ण/शब्द डिटेक्शन से अनुच्छेद और पंक्तियों का पुनर्निर्माण करें

  • बहुभाषी समर्थन: विभिन्न पठन दिशाओं और लेखन प्रणालियों को संभालें

  • झुके हुए पाठ की प्रोसेसिंग: झुके हुए या घुमावदार पाठ के लिए कोलिमेट एल्गोरिद्म का उपयोग करें

  • शब्द पहचान: शब्दों के बीच स्वतः रिक्तियाँ जोड़ने के लिए ओत्सु एल्गोरिद्म का उपयोग करें

प्रकार पहचानकर्ता

स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/stitch_ocr_detections@v2 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।

गुण

नाम

प्रकार

विवरण

संदर्भ

name

str

इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..

stitching_algorithm

str

डिटेक्शन को शब्दों/पंक्तियों में समूहित करने का एल्गोरिद्म। 'tolerance': पंक्ति समूहण के लिए निश्चित पिक्सेल सहिष्णुता का उपयोग करता है (मूल एल्गोरिद्म)। सुसंगत फ़ॉन्ट आकार और पंक्ति रिक्ति के लिए अच्छा। 'otsu': शब्दों के बीच प्राकृतिक विराम खोजने के लिए सामान्यीकृत अंतराल पर ओत्सु की विधि का उपयोग करता है। रिज़ॉल्यूशन-स्वतंत्र है और द्विशिखरी अंतराल वितरणों के साथ अच्छा काम करता है। 'collimate': डिटेक्शन को समूहित करने के लिए लालची पैरेंट-चाइल्ड ट्रैवर्सल का उपयोग करता है। झुके हुए या घुमावदार पाठ के लिए अच्छा है जहाँ बकेट-आधारित दृष्टिकोण विफल होते हैं..

reading_direction

str

पढ़ने और पाठ डिटेक्शन को व्यवस्थित करने की दिशा। 'left_to_right': मानक क्षैतिज पठन (अंग्रेज़ी, अधिकांश भाषाएँ)। 'right_to_left': दाएँ-से-बाएँ पठन (अरबी, हिब्रू)। 'vertical_top_to_bottom': ऊपर से नीचे ऊर्ध्वाधर पठन (पारंपरिक चीनी, जापानी)। 'vertical_bottom_to_top': नीचे से ऊपर ऊर्ध्वाधर पठन (दुर्लभ ऊर्ध्वाधर प्रारूप)। 'auto': औसत बाउंडिंग बॉक्स आयामों के आधार पर पठन दिशा का स्वचालित रूप से पता लगाता है (चौड़ाई > ऊँचाई = क्षैतिज, ऊँचाई >= चौड़ाई = ऊर्ध्वाधर)। यह निर्धारित करता है कि डिटेक्शन को पंक्तियों में कैसे समूहित किया जाए और पंक्तियों के भीतर कैसे क्रमबद्ध किया जाए..

सहिष्णुता

int

समान पंक्ति में डिटेक्शन समूहित करने के लिए पिक्सेल में ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा। इस सहिष्णुता दूरी के भीतर के डिटेक्शन एक ही पंक्ति में समूहित किए जाते हैं। उच्च मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं (परिवर्ती पंक्ति रिक्ति या तिरछे पाठ के लिए उपयोगी)। निम्न मान अधिक पंक्तियाँ बनाते हैं (सघन रिक्ति वाले पाठ के लिए उपयोगी)। शून्य से अधिक होना चाहिए..

डिलिमिटर

str

स्टिचिंग के दौरान प्रत्येक पाठ तत्व (शब्द/अक्षर) के बीच जोड़ने के लिए वैकल्पिक डिलिमिटर स्ट्रिंग। खाली स्ट्रिंग (डिफ़ॉल्ट) का अर्थ कोई डिलिमिटर नहीं - पाठ तत्व सीधे जोड़े जाते हैं। शब्दों के बीच रिक्ति, तत्वों के बीच अल्पविराम, या कस्टम विभाजक जोड़ने के लिए उपयोगी। उदाहरण: शब्दों के बीच रिक्ति जोड़ने के लिए ' ' (स्पेस) का उपयोग करें, या अल्पविराम जोड़ने के लिए ',' का उपयोग करें..

otsu_threshold_multiplier

float

जब 'otsu' स्टिचिंग एल्गोरिद्म का उपयोग किया जाता है, तब ओत्सु द्वारा गणना की गई सीमा पर लागू गुणक। 1.0 से अधिक मान शब्द-विराम को कम बार होने देते हैं (अधिक संयमित, कम विभाजन), 1.0 से कम मान शब्द-विराम को अधिक बार होने देते हैं (अधिक आक्रामक, अधिक विभाजन)। डिफ़ॉल्ट 1.0 है (ओत्सु सीमा जैसा है वैसा ही उपयोग करें)। यदि शब्द गलत तरीके से विभाजित हो रहे हों तो 1.3-1.5 आज़माएँ, या यदि शब्द गलत तरीके से विलय हो रहे हों तो 0.7-0.9 आज़माएँ..

collimate_tolerance

int

‘collimate’ स्टिचिंग एल्गोरिद्म के लिए पिक्सेल सहिष्णुता। यह नियंत्रित करता है कि पठन क्रम में एक डिटेक्शन दूसरे का अनुसरण करता है या नहीं, तय करते समय कितना ऊर्ध्वाधर (क्षैतिज पाठ के लिए) या क्षैतिज (ऊर्ध्वाधर पाठ के लिए) विचलन अनुमति है। उच्च मान अधिक झुके हुए पाठ को संभालते हैं, लेकिन अलग-अलग पंक्तियों को गलत तरीके से मिला सकते हैं। डिफ़ॉल्ट 10 पिक्सेल है..

यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।

इनपुट और आउटपुट बाइंडिंग्स

उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार OCR डिटेक्शन स्टिच करें संस्करण v2 है।

इनपुट और आउटपुट बाइंडिंग्स
  • इनपुट

    • predictions (object_detection_prediction): OCR मॉडल से प्राप्त OCR डिटेक्शन प्रेडिक्शन। इसमें पाठ सामग्री के साथ बाउंडिंग बॉक्स और वर्ग नाम होने चाहिए। प्रत्येक डिटेक्शन एक शब्द, अक्षर, या पाठ क्षेत्र का प्रतिनिधित्व करता है जिसे सुसंगत पाठ में स्टिच किया जाएगा। डेटा डिक्शनरी में बाउंडिंग बॉक्स (xyxy) और वर्ग नामों के साथ ऑब्जेक्ट डिटेक्शन प्रारूप का समर्थन करता है..

    • सहिष्णुता (पूर्णांक): समान पंक्ति में डिटेक्शन समूहित करने के लिए पिक्सेल में ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा। इस सहिष्णुता दूरी के भीतर के डिटेक्शन एक ही पंक्ति में समूहित किए जाते हैं। उच्च मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं (परिवर्ती पंक्ति रिक्ति या तिरछे पाठ के लिए उपयोगी)। निम्न मान अधिक पंक्तियाँ बनाते हैं (सघन रिक्ति वाले पाठ के लिए उपयोगी)। शून्य से अधिक होना चाहिए..

    • डिलिमिटर (string): स्टिचिंग के दौरान प्रत्येक पाठ तत्व (शब्द/अक्षर) के बीच जोड़ने के लिए वैकल्पिक डिलिमिटर स्ट्रिंग। खाली स्ट्रिंग (डिफ़ॉल्ट) का अर्थ कोई डिलिमिटर नहीं - पाठ तत्व सीधे जोड़े जाते हैं। शब्दों के बीच रिक्ति, तत्वों के बीच अल्पविराम, या कस्टम विभाजक जोड़ने के लिए उपयोगी। उदाहरण: शब्दों के बीच रिक्ति जोड़ने के लिए ' ' (स्पेस) का उपयोग करें, या अल्पविराम जोड़ने के लिए ',' का उपयोग करें..

    • otsu_threshold_multiplier (float): जब 'otsu' स्टिचिंग एल्गोरिद्म का उपयोग किया जाता है, तब ओत्सु द्वारा गणना की गई सीमा पर लागू गुणक। 1.0 से अधिक मान शब्द-विराम को कम बार होने देते हैं (अधिक संयमित, कम विभाजन), 1.0 से कम मान शब्द-विराम को अधिक बार होने देते हैं (अधिक आक्रामक, अधिक विभाजन)। डिफ़ॉल्ट 1.0 है (ओत्सु सीमा जैसा है वैसा ही उपयोग करें)। यदि शब्द गलत तरीके से विभाजित हो रहे हों तो 1.3-1.5 आज़माएँ, या यदि शब्द गलत तरीके से विलय हो रहे हों तो 0.7-0.9 आज़माएँ..

    • collimate_tolerance (पूर्णांक): ‘collimate’ स्टिचिंग एल्गोरिद्म के लिए पिक्सेल सहिष्णुता। यह नियंत्रित करता है कि पठन क्रम में एक डिटेक्शन दूसरे का अनुसरण करता है या नहीं, तय करते समय कितना ऊर्ध्वाधर (क्षैतिज पाठ के लिए) या क्षैतिज (ऊर्ध्वाधर पाठ के लिए) विचलन अनुमति है। उच्च मान अधिक झुके हुए पाठ को संभालते हैं, लेकिन अलग-अलग पंक्तियों को गलत तरीके से मिला सकते हैं। डिफ़ॉल्ट 10 पिक्सेल है..

  • आउटपुट

    • ocr_text (string): स्ट्रिंग मान.

उदाहरण JSON परिभाषा

v1

व्यक्तिगत OCR डिटेक्शन परिणामों (शब्द, अक्षर, या पाठ क्षेत्रों) को पठन दिशा के अनुसार स्थानिक रूप से व्यवस्थित करके, डिटेक्शन को पंक्तियों में समूहित करके, उन्हें पंक्तियों के भीतर क्रमबद्ध करके, और उचित पठन क्रम में पाठ को जोड़कर, OCR मॉडल आउटपुट से पठनीय पाठ का पुनर्निर्माण करें।

यह ब्लॉक कैसे काम करता है

यह ब्लॉक व्यक्तिगत OCR डिटेक्शन से पठनीय पाठ का पुनर्निर्माण करता है, उन्हें स्थानिक रूप से व्यवस्थित करके और उचित पठन क्रम में पाठ को जोड़कर। यह ब्लॉक:

  1. बाउंडिंग बॉक्स और वर्ग नामों (पाठ सामग्री) वाले व्यक्तिगत पाठ डिटेक्शन सहित OCR डिटेक्शन प्रेडिक्शन प्राप्त करता है

  2. पठन दिशा के आधार पर निर्देशांक तैयार करता है:

    • ऊर्ध्वाधर पठन दिशाओं के लिए, ऊर्ध्वाधर पंक्ति प्रसंस्करण सक्षम करने हेतु x और y निर्देशांकों को स्वैप करता है

    • क्षैतिज पठन दिशाओं के लिए, निर्देशांक वैसे ही उपयोग करता है

  3. डिटेक्शन को पंक्तियों में समूहित करता है:

    • सहिष्णुता पैरामीटर का उपयोग करके ऊर्ध्वाधर स्थिति (या ऊर्ध्वाधर पाठ के लिए क्षैतिज स्थिति) के आधार पर डिटेक्शन को समूहित करता है

    • सहिष्णुता दूरी के भीतर के डिटेक्शन को एक ही पंक्ति का भाग माना जाता है

    • उच्च सहिष्णुता मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं, जो परिवर्ती पंक्ति रिक्ति वाले पाठ के लिए उपयोगी है

  4. पठन दिशा के आधार पर पंक्तियों को क्रमबद्ध करता है:

    • left-to-right और vertical top-to-bottom के लिए: पंक्तियों को ऊपर से नीचे क्रमबद्ध करता है

    • right-to-left और vertical bottom-to-top के लिए: पंक्तियों को उल्टे क्रम में (नीचे से ऊपर) क्रमबद्ध करता है

  5. प्रत्येक पंक्ति के भीतर डिटेक्शन को क्रमबद्ध करता है:

    • left-to-right और vertical top-to-bottom के लिए: डिटेक्शन को क्षैतिज स्थिति के अनुसार क्रमबद्ध करता है (बाएँ से दाएँ, या ऊर्ध्वाधर के लिए ऊपर से नीचे)

    • right-to-left और vertical bottom-to-top के लिए: डिटेक्शन को उल्टे क्रम में क्रमबद्ध करता है (दाएँ से बाएँ, या ऊर्ध्वाधर के लिए नीचे से ऊपर)

  6. पठन क्रम में पाठ को जोड़ता है:

    • क्रमबद्ध क्रम में डिटेक्शन से वर्ग नामों (पाठ सामग्री) को निकालता है

    • पंक्तियों के बीच पंक्ति विभाजक (क्षैतिज पाठ के लिए नई पंक्ति, ऊर्ध्वाधर पाठ के लिए स्पेस) जोड़ता है

    • यदि निर्दिष्ट हो, तो प्रत्येक पाठ तत्व के बीच वैकल्पिक रूप से एक डिलिमिटर सम्मिलित करता है

    • उचित पठन क्रम के साथ एक एकल सुसंगत पाठ स्ट्रिंग उत्पन्न करता है

  7. स्वचालित पठन दिशा पहचान को संभालता है (यदि "auto" चुना गया है):

    • डिटेक्शन बाउंडिंग बॉक्स की औसत चौड़ाई और ऊँचाई का विश्लेषण करता है

    • यदि औसत चौड़ाई > औसत ऊँचाई: क्षैतिज पाठ (left-to-right) का पता लगाता है

    • यदि औसत ऊँचाई >= औसत चौड़ाई: ऊर्ध्वाधर पाठ (top-to-bottom) का पता लगाता है

  8. स्टिच किया गया पाठ स्ट्रिंग लौटाता है:

    • आउटपुट के तहत एकल पाठ स्ट्रिंग प्रदान करता है ocr_text कुंजी

    • पाठ को पठन दिशा के अनुसार उचित पंक्ति विराम और रिक्ति के साथ स्वरूपित किया जाता है

यह ब्लॉक विभिन्न भाषाओं और लेखन प्रणालियों के लिए उचित पठन क्रम बनाए रखते हुए, व्यक्तिगत OCR डिटेक्शन से बहु-पंक्ति पाठ के पुनर्निर्माण को सक्षम बनाता है। यह क्षैतिज (left-to-right, right-to-left) और ऊर्ध्वाधर (top-to-bottom, bottom-to-top) दोनों पाठ अभिविन्यासों को संभालता है, जिससे यह विभिन्न भाषाओं और प्रारूपों में पाठ संसाधित करने के लिए उपयोगी बनता है।

सामान्य उपयोग के मामले

  • पाठ पुनर्निर्माण: OCR मॉडल से व्यक्तिगत शब्द या अक्षर डिटेक्शन को पठनीय पाठ ब्लॉकों में बदलें (जैसे, शब्द डिटेक्शन से दस्तावेज़ पुनर्निर्मित करें, अक्षर डिटेक्शन को शब्दों में संयोजित करें, OCR परिणामों को अनुच्छेदों में स्टिच करें), जिससे पाठ पुनर्निर्माण वर्कफ़्लो सक्षम होते हैं

  • बहु-पंक्ति पाठ प्रसंस्करण: OCR परिणामों से उचित पंक्ति विराम और स्वरूपण के साथ बहु-पंक्ति पाठ का पुनर्निर्माण करें (जैसे, OCR परिणामों से अनुच्छेद निकालें, स्वरूपित पाठ पुनर्निर्मित करें, बहु-पंक्ति दस्तावेज़ संसाधित करें), जिससे बहु-पंक्ति पाठ वर्कफ़्लो सक्षम होते हैं

  • बहुभाषी OCR: विभिन्न भाषाओं और लेखन प्रणालियों से प्राप्त OCR परिणामों को संसाधित करें (जैसे, अरबी दाएँ-से-बाएँ पाठ संसाधित करें, ऊर्ध्वाधर चीनी/जापानी पाठ संभालें, कई पठन दिशाओं का समर्थन करें), जिससे बहुभाषी OCR वर्कफ़्लो सक्षम होते हैं

  • दस्तावेज़ प्रसंस्करण: दस्तावेज़ों और छवियों से पाठ निकालें और उसका पुनर्निर्माण करें (जैसे, स्कैन किए गए दस्तावेज़ों से पाठ निकालें, इनवॉइस पाठ संसाधित करें, फ़ॉर्म से पाठ निकालें), जिससे दस्तावेज़ प्रसंस्करण वर्कफ़्लो सक्षम होते हैं

  • पाठ निष्कर्षण और स्वरूपण: छवियों से पाठ निकालें और उसे आगे उपयोग के लिए स्वरूपित करें (जैसे, डेटाबेस भंडारण के लिए पाठ निकालें, API प्रतिक्रियाओं के लिए पाठ स्वरूपित करें, विश्लेषण के लिए पाठ तैयार करें), जिससे पाठ निष्कर्षण वर्कफ़्लो सक्षम होते हैं

  • OCR परिणाम पश्च-प्रसंस्करण: उपयोगी पाठ स्ट्रिंग उत्पन्न करने के लिए OCR मॉडल आउटपुट का पश्च-प्रसंस्करण करें (जैसे, OCR आउटपुट स्वरूपित करें, OCR परिणाम व्यवस्थित करें, डाउनस्ट्रीम ब्लॉकों के लिए पाठ तैयार करें), जिससे OCR पश्च-प्रसंस्करण वर्कफ़्लो सक्षम होते हैं

अन्य ब्लॉक्स से कनेक्ट करना

यह ब्लॉक OCR डिटेक्शन प्रेडिक्शन प्राप्त करता है और स्टिच किए गए पाठ स्ट्रिंग्स उत्पन्न करता है:

  • OCR मॉडल ब्लॉकों के बाद डिटेक्शन परिणामों को पठनीय पाठ में बदलने के लिए (जैसे, OCR मॉडल से पाठ स्ट्रिंग, OCR डिटेक्शन से स्वरूपित पाठ, OCR परिणाम से पाठ आउटपुट), जिससे OCR-से-पाठ वर्कफ़्लो सक्षम होते हैं

  • डेटा संग्रहण ब्लॉकों से पहले निकाले गए पाठ को संग्रहीत करने के लिए (जैसे, OCR पाठ को डेटाबेस में संग्रहीत करें, निकाला गया पाठ सहेजें, OCR परिणाम लॉग करें), जिससे पाठ भंडारण वर्कफ़्लो सक्षम होते हैं

  • सूचना ब्लॉकों से पहले सूचनाओं में निकाला गया पाठ भेजने के लिए (जैसे, अलर्ट में OCR पाठ भेजें, संदेशों में निकाला गया पाठ शामिल करें, OCR परिणामों के साथ सूचित करें), जिससे पाठ सूचना वर्कफ़्लो सक्षम होते हैं

  • पाठ प्रसंस्करण ब्लॉकों से पहले स्टिच किए गए पाठ को संसाधित करने के लिए (जैसे, NLP मॉडल के साथ पाठ संसाधित करें, निकाले गए पाठ का विश्लेषण करें, पाठ रूपांतरण लागू करें), जिससे पाठ प्रसंस्करण वर्कफ़्लो सक्षम होते हैं

  • API आउटपुट ब्लॉकों से पहले API प्रतिक्रियाओं में पाठ प्रदान करने के लिए (जैसे, API में OCR पाठ लौटाएँ, प्रतिक्रियाओं के लिए पाठ स्वरूपित करें, निकाला गया पाठ आउटपुट प्रदान करें), जिससे पाठ आउटपुट वर्कफ़्लो सक्षम होते हैं

  • वर्कफ़्लो आउटपुट में अंतिम आउटपुट के रूप में स्टिच किया गया पाठ प्रदान करने के लिए (जैसे, पाठ निष्कर्षण वर्कफ़्लो, OCR आउटपुट वर्कफ़्लो, दस्तावेज़ प्रसंस्करण वर्कफ़्लो), जिससे पाठ आउटपुट वर्कफ़्लो सक्षम होते हैं

आवश्यकताएँ

इस ब्लॉक को बाउंडिंग बॉक्स और पाठ सामग्री वाले वर्ग नामों सहित OCR डिटेक्शन प्रेडिक्शन (ऑब्जेक्ट डिटेक्शन प्रारूप) की आवश्यकता होती है। यह सहिष्णुता पैरामीटर शून्य से अधिक होना चाहिए और पंक्तियों में डिटेक्शन समूहित करने के लिए ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा को नियंत्रित करता है। यह reading_direction पैरामीटर पाँच मोड का समर्थन करता है: "left_to_right" (मानक क्षैतिज), "right_to_left" (अरबी-शैली), "vertical_top_to_bottom" (ऊर्ध्वाधर), "vertical_bottom_to_top" (उल्टा ऊर्ध्वाधर), और "auto" (बाउंडिंग बॉक्स आयामों के आधार पर स्वचालित पहचान)। यह डिलिमिटर पैरामीटर वैकल्पिक है और प्रत्येक पाठ तत्व के बीच एक डिलिमिटर सम्मिलित करता है (डिफ़ॉल्ट रूप से खाली स्ट्रिंग, जिसका अर्थ है कोई डिलिमिटर नहीं)। ब्लॉक एकल पाठ स्ट्रिंग प्रदान करता है, जो ocr_text कुंजी।

प्रकार पहचानकर्ता

स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/stitch_ocr_detections@v1 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।

गुण

नाम

प्रकार

विवरण

संदर्भ

name

str

इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..

reading_direction

str

पढ़ने और पाठ डिटेक्शन को व्यवस्थित करने की दिशा। 'left_to_right': मानक क्षैतिज पठन (अंग्रेज़ी, अधिकांश भाषाएँ)। 'right_to_left': दाएँ-से-बाएँ पठन (अरबी, हिब्रू)। 'vertical_top_to_bottom': ऊपर से नीचे ऊर्ध्वाधर पठन (पारंपरिक चीनी, जापानी)। 'vertical_bottom_to_top': नीचे से ऊपर ऊर्ध्वाधर पठन (दुर्लभ ऊर्ध्वाधर प्रारूप)। 'auto': औसत बाउंडिंग बॉक्स आयामों के आधार पर पठन दिशा का स्वचालित रूप से पता लगाता है (चौड़ाई > ऊँचाई = क्षैतिज, ऊँचाई >= चौड़ाई = ऊर्ध्वाधर)। यह निर्धारित करता है कि डिटेक्शन को पंक्तियों में कैसे समूहित किया जाए और पंक्तियों के भीतर कैसे क्रमबद्ध किया जाए..

सहिष्णुता

int

समान पंक्ति में डिटेक्शन समूहित करने के लिए पिक्सेल में ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा। इस सहिष्णुता दूरी के भीतर के डिटेक्शन एक ही पंक्ति में समूहित किए जाते हैं। उच्च मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं (परिवर्ती पंक्ति रिक्ति या तिरछे पाठ के लिए उपयोगी)। निम्न मान अधिक पंक्तियाँ बनाते हैं (सघन रिक्ति वाले पाठ के लिए उपयोगी)। शून्य से अधिक होना चाहिए..

डिलिमिटर

str

स्टिचिंग के दौरान प्रत्येक पाठ तत्व (शब्द/अक्षर) के बीच जोड़ने के लिए वैकल्पिक डिलिमिटर स्ट्रिंग। खाली स्ट्रिंग (डिफ़ॉल्ट) का अर्थ कोई डिलिमिटर नहीं - पाठ तत्व सीधे जोड़े जाते हैं। शब्दों के बीच रिक्ति, तत्वों के बीच अल्पविराम, या कस्टम विभाजक जोड़ने के लिए उपयोगी। उदाहरण: शब्दों के बीच रिक्ति जोड़ने के लिए ' ' (स्पेस) का उपयोग करें, या अल्पविराम जोड़ने के लिए ',' का उपयोग करें..

यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।

इनपुट और आउटपुट बाइंडिंग्स

उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार OCR डिटेक्शन स्टिच करें संस्करण v1 है।

इनपुट और आउटपुट बाइंडिंग्स
  • इनपुट

    • predictions (object_detection_prediction): OCR मॉडल से प्राप्त OCR डिटेक्शन प्रेडिक्शन। इसमें पाठ सामग्री के साथ बाउंडिंग बॉक्स और वर्ग नाम होने चाहिए। प्रत्येक डिटेक्शन एक शब्द, अक्षर, या पाठ क्षेत्र का प्रतिनिधित्व करता है जिसे सुसंगत पाठ में स्टिच किया जाएगा। डेटा डिक्शनरी में बाउंडिंग बॉक्स (xyxy) और वर्ग नामों के साथ ऑब्जेक्ट डिटेक्शन प्रारूप का समर्थन करता है..

    • सहिष्णुता (पूर्णांक): समान पंक्ति में डिटेक्शन समूहित करने के लिए पिक्सेल में ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा। इस सहिष्णुता दूरी के भीतर के डिटेक्शन एक ही पंक्ति में समूहित किए जाते हैं। उच्च मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं (परिवर्ती पंक्ति रिक्ति या तिरछे पाठ के लिए उपयोगी)। निम्न मान अधिक पंक्तियाँ बनाते हैं (सघन रिक्ति वाले पाठ के लिए उपयोगी)। शून्य से अधिक होना चाहिए..

    • डिलिमिटर (string): स्टिचिंग के दौरान प्रत्येक पाठ तत्व (शब्द/अक्षर) के बीच जोड़ने के लिए वैकल्पिक डिलिमिटर स्ट्रिंग। खाली स्ट्रिंग (डिफ़ॉल्ट) का अर्थ कोई डिलिमिटर नहीं - पाठ तत्व सीधे जोड़े जाते हैं। शब्दों के बीच रिक्ति, तत्वों के बीच अल्पविराम, या कस्टम विभाजक जोड़ने के लिए उपयोगी। उदाहरण: शब्दों के बीच रिक्ति जोड़ने के लिए ' ' (स्पेस) का उपयोग करें, या अल्पविराम जोड़ने के लिए ',' का उपयोग करें..

  • आउटपुट

    • ocr_text (string): स्ट्रिंग मान.

उदाहरण JSON परिभाषा

अंतिम अपडेट

क्या यह उपयोगी था?