OCR पहचानें जोड़ें
पहचानों को स्थानिक रूप से व्यवस्थित करके OCR पहचान परिणामों को एक सुसंगत पाठ स्ट्रिंग में संयोजित करता है।
v2
व्यक्तिगत OCR डिटेक्शन परिणामों (शब्द, अक्षर, या पाठ क्षेत्रों) को स्थानिक रूप से व्यवस्थित करके, उन्हें पंक्तियों में समूहित करके, और उचित पठन क्रम में पाठ को जोड़कर सुसंगत पाठ स्ट्रिंग्स में संयोजित करें।
स्टिचिंग एल्गोरिद्म
यह ब्लॉक OCR डिटेक्शन से पाठ पुनर्निर्माण के लिए तीन एल्गोरिद्म का समर्थन करता है:
सहिष्णुता-आधारित (डिफ़ॉल्ट)
एक निश्चित पिक्सेल सहिष्णुता का उपयोग करके डिटेक्शन को पंक्तियों में समूहित करता है। सहिष्णुता दूरी के भीतर लंबवत (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) डिटेक्शन को एक ही पंक्ति में समूहित किया जाता है, फिर प्रत्येक पंक्ति के भीतर स्थिति के अनुसार क्रमबद्ध किया जाता है।
के लिए सर्वोत्तम: सुसंगत फ़ॉन्ट आकार और अच्छी तरह संरेखित क्षैतिज/ऊर्ध्वाधर पाठ
पैरामीटर:
सहिष्णुता(पंक्ति समूहण के लिए पिक्सेल सीमा)
ओत्सु थ्रेशहोल्डिंग
चरित्र अंतराल को शब्द अंतराल से अलग करने वाली सर्वोत्तम सीमा को स्वचालित रूप से खोजने के लिए सामान्यीकृत अंतर दूरी पर ओत्सु की विधि का उपयोग करता है। अंतराल को स्थानीय चरित्र चौड़ाई के अनुसार सामान्यीकृत किया जाता है, जिससे यह रिज़ॉल्यूशन-स्वतंत्र बनता है।
के लिए सर्वोत्तम: परिवर्ती फ़ॉन्ट आकार, स्वचालित शब्द सीमा पहचान
पैरामीटर:
otsu_threshold_multiplier(सीमा संवेदनशीलता समायोजित करें)मुख्य विशेषता: एकल शब्दों को बहु-शब्द पाठ से अलग करने के लिए द्विशिखरी वितरणों का पता लगाता है
कोलिमेट (झुका हुआ पाठ)
पाठ के प्रवाह का अनुसरण करने के लिए लालची पैरेंट-चाइल्ड ट्रैवर्सल का उपयोग करता है। पहले डिटेक्शन से शुरू करके, यह बाद के उन डिटेक्शन को खोजता है जो पठन क्रम में 'follow' करते हैं (समान संरेखण + सही दिशा), और बकेटिंग के बजाय ट्रैवर्सल के माध्यम से पंक्तियाँ बनाता है।
के लिए सर्वोत्तम: झुका हुआ, घुमावदार, या अक्ष-असंरेखित पाठ
पैरामीटर:
collimate_tolerance(पिक्सेल में संरेखण सहिष्णुता)नोट: शब्द सीमाओं का पता नहीं लगाता - उपयोग करें
डिलिमिटरपैरामीटर यदि रिक्ति की आवश्यकता हो
पठन दिशाएँ
सभी एल्गोरिद्म कई पठन दिशाओं का समर्थन करते हैं:
left_to_right: मानक क्षैतिज (अंग्रेज़ी, अधिकांश भाषाएँ)right_to_left: दाएँ-से-बाएँ (अरबी, हिब्रू)vertical_top_to_bottom: ऊर्ध्वाधर ऊपर-से-नीचे (पारंपरिक चीनी, जापानी)vertical_bottom_to_top: ऊर्ध्वाधर नीचे-से-ऊपरauto: बाउंडिंग बॉक्स के आयामों के आधार पर स्वचालित रूप से पता लगाता है
सामान्य उपयोग के मामले
दस्तावेज़ OCR: वर्ण/शब्द डिटेक्शन से अनुच्छेद और पंक्तियों का पुनर्निर्माण करें
बहुभाषी समर्थन: विभिन्न पठन दिशाओं और लेखन प्रणालियों को संभालें
झुके हुए पाठ की प्रोसेसिंग: झुके हुए या घुमावदार पाठ के लिए कोलिमेट एल्गोरिद्म का उपयोग करें
शब्द पहचान: शब्दों के बीच स्वतः रिक्तियाँ जोड़ने के लिए ओत्सु एल्गोरिद्म का उपयोग करें
प्रकार पहचानकर्ता
स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/stitch_ocr_detections@v2 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।
गुण
नाम
प्रकार
विवरण
संदर्भ
name
str
इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..
❌
stitching_algorithm
str
डिटेक्शन को शब्दों/पंक्तियों में समूहित करने का एल्गोरिद्म। 'tolerance': पंक्ति समूहण के लिए निश्चित पिक्सेल सहिष्णुता का उपयोग करता है (मूल एल्गोरिद्म)। सुसंगत फ़ॉन्ट आकार और पंक्ति रिक्ति के लिए अच्छा। 'otsu': शब्दों के बीच प्राकृतिक विराम खोजने के लिए सामान्यीकृत अंतराल पर ओत्सु की विधि का उपयोग करता है। रिज़ॉल्यूशन-स्वतंत्र है और द्विशिखरी अंतराल वितरणों के साथ अच्छा काम करता है। 'collimate': डिटेक्शन को समूहित करने के लिए लालची पैरेंट-चाइल्ड ट्रैवर्सल का उपयोग करता है। झुके हुए या घुमावदार पाठ के लिए अच्छा है जहाँ बकेट-आधारित दृष्टिकोण विफल होते हैं..
❌
reading_direction
str
पढ़ने और पाठ डिटेक्शन को व्यवस्थित करने की दिशा। 'left_to_right': मानक क्षैतिज पठन (अंग्रेज़ी, अधिकांश भाषाएँ)। 'right_to_left': दाएँ-से-बाएँ पठन (अरबी, हिब्रू)। 'vertical_top_to_bottom': ऊपर से नीचे ऊर्ध्वाधर पठन (पारंपरिक चीनी, जापानी)। 'vertical_bottom_to_top': नीचे से ऊपर ऊर्ध्वाधर पठन (दुर्लभ ऊर्ध्वाधर प्रारूप)। 'auto': औसत बाउंडिंग बॉक्स आयामों के आधार पर पठन दिशा का स्वचालित रूप से पता लगाता है (चौड़ाई > ऊँचाई = क्षैतिज, ऊँचाई >= चौड़ाई = ऊर्ध्वाधर)। यह निर्धारित करता है कि डिटेक्शन को पंक्तियों में कैसे समूहित किया जाए और पंक्तियों के भीतर कैसे क्रमबद्ध किया जाए..
❌
सहिष्णुता
int
समान पंक्ति में डिटेक्शन समूहित करने के लिए पिक्सेल में ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा। इस सहिष्णुता दूरी के भीतर के डिटेक्शन एक ही पंक्ति में समूहित किए जाते हैं। उच्च मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं (परिवर्ती पंक्ति रिक्ति या तिरछे पाठ के लिए उपयोगी)। निम्न मान अधिक पंक्तियाँ बनाते हैं (सघन रिक्ति वाले पाठ के लिए उपयोगी)। शून्य से अधिक होना चाहिए..
✅
डिलिमिटर
str
स्टिचिंग के दौरान प्रत्येक पाठ तत्व (शब्द/अक्षर) के बीच जोड़ने के लिए वैकल्पिक डिलिमिटर स्ट्रिंग। खाली स्ट्रिंग (डिफ़ॉल्ट) का अर्थ कोई डिलिमिटर नहीं - पाठ तत्व सीधे जोड़े जाते हैं। शब्दों के बीच रिक्ति, तत्वों के बीच अल्पविराम, या कस्टम विभाजक जोड़ने के लिए उपयोगी। उदाहरण: शब्दों के बीच रिक्ति जोड़ने के लिए ' ' (स्पेस) का उपयोग करें, या अल्पविराम जोड़ने के लिए ',' का उपयोग करें..
✅
otsu_threshold_multiplier
float
जब 'otsu' स्टिचिंग एल्गोरिद्म का उपयोग किया जाता है, तब ओत्सु द्वारा गणना की गई सीमा पर लागू गुणक। 1.0 से अधिक मान शब्द-विराम को कम बार होने देते हैं (अधिक संयमित, कम विभाजन), 1.0 से कम मान शब्द-विराम को अधिक बार होने देते हैं (अधिक आक्रामक, अधिक विभाजन)। डिफ़ॉल्ट 1.0 है (ओत्सु सीमा जैसा है वैसा ही उपयोग करें)। यदि शब्द गलत तरीके से विभाजित हो रहे हों तो 1.3-1.5 आज़माएँ, या यदि शब्द गलत तरीके से विलय हो रहे हों तो 0.7-0.9 आज़माएँ..
✅
collimate_tolerance
int
‘collimate’ स्टिचिंग एल्गोरिद्म के लिए पिक्सेल सहिष्णुता। यह नियंत्रित करता है कि पठन क्रम में एक डिटेक्शन दूसरे का अनुसरण करता है या नहीं, तय करते समय कितना ऊर्ध्वाधर (क्षैतिज पाठ के लिए) या क्षैतिज (ऊर्ध्वाधर पाठ के लिए) विचलन अनुमति है। उच्च मान अधिक झुके हुए पाठ को संभालते हैं, लेकिन अलग-अलग पंक्तियों को गलत तरीके से मिला सकते हैं। डिफ़ॉल्ट 10 पिक्सेल है..
✅
यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।
इनपुट और आउटपुट बाइंडिंग्स
उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार OCR डिटेक्शन स्टिच करें संस्करण v2 है।
इनपुट और आउटपुट बाइंडिंग्स
इनपुट
predictions(object_detection_prediction): OCR मॉडल से प्राप्त OCR डिटेक्शन प्रेडिक्शन। इसमें पाठ सामग्री के साथ बाउंडिंग बॉक्स और वर्ग नाम होने चाहिए। प्रत्येक डिटेक्शन एक शब्द, अक्षर, या पाठ क्षेत्र का प्रतिनिधित्व करता है जिसे सुसंगत पाठ में स्टिच किया जाएगा। डेटा डिक्शनरी में बाउंडिंग बॉक्स (xyxy) और वर्ग नामों के साथ ऑब्जेक्ट डिटेक्शन प्रारूप का समर्थन करता है..सहिष्णुता(पूर्णांक): समान पंक्ति में डिटेक्शन समूहित करने के लिए पिक्सेल में ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा। इस सहिष्णुता दूरी के भीतर के डिटेक्शन एक ही पंक्ति में समूहित किए जाते हैं। उच्च मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं (परिवर्ती पंक्ति रिक्ति या तिरछे पाठ के लिए उपयोगी)। निम्न मान अधिक पंक्तियाँ बनाते हैं (सघन रिक्ति वाले पाठ के लिए उपयोगी)। शून्य से अधिक होना चाहिए..डिलिमिटर(string): स्टिचिंग के दौरान प्रत्येक पाठ तत्व (शब्द/अक्षर) के बीच जोड़ने के लिए वैकल्पिक डिलिमिटर स्ट्रिंग। खाली स्ट्रिंग (डिफ़ॉल्ट) का अर्थ कोई डिलिमिटर नहीं - पाठ तत्व सीधे जोड़े जाते हैं। शब्दों के बीच रिक्ति, तत्वों के बीच अल्पविराम, या कस्टम विभाजक जोड़ने के लिए उपयोगी। उदाहरण: शब्दों के बीच रिक्ति जोड़ने के लिए ' ' (स्पेस) का उपयोग करें, या अल्पविराम जोड़ने के लिए ',' का उपयोग करें..otsu_threshold_multiplier(float): जब 'otsu' स्टिचिंग एल्गोरिद्म का उपयोग किया जाता है, तब ओत्सु द्वारा गणना की गई सीमा पर लागू गुणक। 1.0 से अधिक मान शब्द-विराम को कम बार होने देते हैं (अधिक संयमित, कम विभाजन), 1.0 से कम मान शब्द-विराम को अधिक बार होने देते हैं (अधिक आक्रामक, अधिक विभाजन)। डिफ़ॉल्ट 1.0 है (ओत्सु सीमा जैसा है वैसा ही उपयोग करें)। यदि शब्द गलत तरीके से विभाजित हो रहे हों तो 1.3-1.5 आज़माएँ, या यदि शब्द गलत तरीके से विलय हो रहे हों तो 0.7-0.9 आज़माएँ..collimate_tolerance(पूर्णांक): ‘collimate’ स्टिचिंग एल्गोरिद्म के लिए पिक्सेल सहिष्णुता। यह नियंत्रित करता है कि पठन क्रम में एक डिटेक्शन दूसरे का अनुसरण करता है या नहीं, तय करते समय कितना ऊर्ध्वाधर (क्षैतिज पाठ के लिए) या क्षैतिज (ऊर्ध्वाधर पाठ के लिए) विचलन अनुमति है। उच्च मान अधिक झुके हुए पाठ को संभालते हैं, लेकिन अलग-अलग पंक्तियों को गलत तरीके से मिला सकते हैं। डिफ़ॉल्ट 10 पिक्सेल है..
आउटपुट
ocr_text(string): स्ट्रिंग मान.
v1
व्यक्तिगत OCR डिटेक्शन परिणामों (शब्द, अक्षर, या पाठ क्षेत्रों) को पठन दिशा के अनुसार स्थानिक रूप से व्यवस्थित करके, डिटेक्शन को पंक्तियों में समूहित करके, उन्हें पंक्तियों के भीतर क्रमबद्ध करके, और उचित पठन क्रम में पाठ को जोड़कर, OCR मॉडल आउटपुट से पठनीय पाठ का पुनर्निर्माण करें।
यह ब्लॉक कैसे काम करता है
यह ब्लॉक व्यक्तिगत OCR डिटेक्शन से पठनीय पाठ का पुनर्निर्माण करता है, उन्हें स्थानिक रूप से व्यवस्थित करके और उचित पठन क्रम में पाठ को जोड़कर। यह ब्लॉक:
बाउंडिंग बॉक्स और वर्ग नामों (पाठ सामग्री) वाले व्यक्तिगत पाठ डिटेक्शन सहित OCR डिटेक्शन प्रेडिक्शन प्राप्त करता है
पठन दिशा के आधार पर निर्देशांक तैयार करता है:
ऊर्ध्वाधर पठन दिशाओं के लिए, ऊर्ध्वाधर पंक्ति प्रसंस्करण सक्षम करने हेतु x और y निर्देशांकों को स्वैप करता है
क्षैतिज पठन दिशाओं के लिए, निर्देशांक वैसे ही उपयोग करता है
डिटेक्शन को पंक्तियों में समूहित करता है:
सहिष्णुता पैरामीटर का उपयोग करके ऊर्ध्वाधर स्थिति (या ऊर्ध्वाधर पाठ के लिए क्षैतिज स्थिति) के आधार पर डिटेक्शन को समूहित करता है
सहिष्णुता दूरी के भीतर के डिटेक्शन को एक ही पंक्ति का भाग माना जाता है
उच्च सहिष्णुता मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं, जो परिवर्ती पंक्ति रिक्ति वाले पाठ के लिए उपयोगी है
पठन दिशा के आधार पर पंक्तियों को क्रमबद्ध करता है:
left-to-right और vertical top-to-bottom के लिए: पंक्तियों को ऊपर से नीचे क्रमबद्ध करता है
right-to-left और vertical bottom-to-top के लिए: पंक्तियों को उल्टे क्रम में (नीचे से ऊपर) क्रमबद्ध करता है
प्रत्येक पंक्ति के भीतर डिटेक्शन को क्रमबद्ध करता है:
left-to-right और vertical top-to-bottom के लिए: डिटेक्शन को क्षैतिज स्थिति के अनुसार क्रमबद्ध करता है (बाएँ से दाएँ, या ऊर्ध्वाधर के लिए ऊपर से नीचे)
right-to-left और vertical bottom-to-top के लिए: डिटेक्शन को उल्टे क्रम में क्रमबद्ध करता है (दाएँ से बाएँ, या ऊर्ध्वाधर के लिए नीचे से ऊपर)
पठन क्रम में पाठ को जोड़ता है:
क्रमबद्ध क्रम में डिटेक्शन से वर्ग नामों (पाठ सामग्री) को निकालता है
पंक्तियों के बीच पंक्ति विभाजक (क्षैतिज पाठ के लिए नई पंक्ति, ऊर्ध्वाधर पाठ के लिए स्पेस) जोड़ता है
यदि निर्दिष्ट हो, तो प्रत्येक पाठ तत्व के बीच वैकल्पिक रूप से एक डिलिमिटर सम्मिलित करता है
उचित पठन क्रम के साथ एक एकल सुसंगत पाठ स्ट्रिंग उत्पन्न करता है
स्वचालित पठन दिशा पहचान को संभालता है (यदि "auto" चुना गया है):
डिटेक्शन बाउंडिंग बॉक्स की औसत चौड़ाई और ऊँचाई का विश्लेषण करता है
यदि औसत चौड़ाई > औसत ऊँचाई: क्षैतिज पाठ (left-to-right) का पता लगाता है
यदि औसत ऊँचाई >= औसत चौड़ाई: ऊर्ध्वाधर पाठ (top-to-bottom) का पता लगाता है
स्टिच किया गया पाठ स्ट्रिंग लौटाता है:
आउटपुट के तहत एकल पाठ स्ट्रिंग प्रदान करता है
ocr_textकुंजीपाठ को पठन दिशा के अनुसार उचित पंक्ति विराम और रिक्ति के साथ स्वरूपित किया जाता है
यह ब्लॉक विभिन्न भाषाओं और लेखन प्रणालियों के लिए उचित पठन क्रम बनाए रखते हुए, व्यक्तिगत OCR डिटेक्शन से बहु-पंक्ति पाठ के पुनर्निर्माण को सक्षम बनाता है। यह क्षैतिज (left-to-right, right-to-left) और ऊर्ध्वाधर (top-to-bottom, bottom-to-top) दोनों पाठ अभिविन्यासों को संभालता है, जिससे यह विभिन्न भाषाओं और प्रारूपों में पाठ संसाधित करने के लिए उपयोगी बनता है।
सामान्य उपयोग के मामले
पाठ पुनर्निर्माण: OCR मॉडल से व्यक्तिगत शब्द या अक्षर डिटेक्शन को पठनीय पाठ ब्लॉकों में बदलें (जैसे, शब्द डिटेक्शन से दस्तावेज़ पुनर्निर्मित करें, अक्षर डिटेक्शन को शब्दों में संयोजित करें, OCR परिणामों को अनुच्छेदों में स्टिच करें), जिससे पाठ पुनर्निर्माण वर्कफ़्लो सक्षम होते हैं
बहु-पंक्ति पाठ प्रसंस्करण: OCR परिणामों से उचित पंक्ति विराम और स्वरूपण के साथ बहु-पंक्ति पाठ का पुनर्निर्माण करें (जैसे, OCR परिणामों से अनुच्छेद निकालें, स्वरूपित पाठ पुनर्निर्मित करें, बहु-पंक्ति दस्तावेज़ संसाधित करें), जिससे बहु-पंक्ति पाठ वर्कफ़्लो सक्षम होते हैं
बहुभाषी OCR: विभिन्न भाषाओं और लेखन प्रणालियों से प्राप्त OCR परिणामों को संसाधित करें (जैसे, अरबी दाएँ-से-बाएँ पाठ संसाधित करें, ऊर्ध्वाधर चीनी/जापानी पाठ संभालें, कई पठन दिशाओं का समर्थन करें), जिससे बहुभाषी OCR वर्कफ़्लो सक्षम होते हैं
दस्तावेज़ प्रसंस्करण: दस्तावेज़ों और छवियों से पाठ निकालें और उसका पुनर्निर्माण करें (जैसे, स्कैन किए गए दस्तावेज़ों से पाठ निकालें, इनवॉइस पाठ संसाधित करें, फ़ॉर्म से पाठ निकालें), जिससे दस्तावेज़ प्रसंस्करण वर्कफ़्लो सक्षम होते हैं
पाठ निष्कर्षण और स्वरूपण: छवियों से पाठ निकालें और उसे आगे उपयोग के लिए स्वरूपित करें (जैसे, डेटाबेस भंडारण के लिए पाठ निकालें, API प्रतिक्रियाओं के लिए पाठ स्वरूपित करें, विश्लेषण के लिए पाठ तैयार करें), जिससे पाठ निष्कर्षण वर्कफ़्लो सक्षम होते हैं
OCR परिणाम पश्च-प्रसंस्करण: उपयोगी पाठ स्ट्रिंग उत्पन्न करने के लिए OCR मॉडल आउटपुट का पश्च-प्रसंस्करण करें (जैसे, OCR आउटपुट स्वरूपित करें, OCR परिणाम व्यवस्थित करें, डाउनस्ट्रीम ब्लॉकों के लिए पाठ तैयार करें), जिससे OCR पश्च-प्रसंस्करण वर्कफ़्लो सक्षम होते हैं
अन्य ब्लॉक्स से कनेक्ट करना
यह ब्लॉक OCR डिटेक्शन प्रेडिक्शन प्राप्त करता है और स्टिच किए गए पाठ स्ट्रिंग्स उत्पन्न करता है:
OCR मॉडल ब्लॉकों के बाद डिटेक्शन परिणामों को पठनीय पाठ में बदलने के लिए (जैसे, OCR मॉडल से पाठ स्ट्रिंग, OCR डिटेक्शन से स्वरूपित पाठ, OCR परिणाम से पाठ आउटपुट), जिससे OCR-से-पाठ वर्कफ़्लो सक्षम होते हैं
डेटा संग्रहण ब्लॉकों से पहले निकाले गए पाठ को संग्रहीत करने के लिए (जैसे, OCR पाठ को डेटाबेस में संग्रहीत करें, निकाला गया पाठ सहेजें, OCR परिणाम लॉग करें), जिससे पाठ भंडारण वर्कफ़्लो सक्षम होते हैं
सूचना ब्लॉकों से पहले सूचनाओं में निकाला गया पाठ भेजने के लिए (जैसे, अलर्ट में OCR पाठ भेजें, संदेशों में निकाला गया पाठ शामिल करें, OCR परिणामों के साथ सूचित करें), जिससे पाठ सूचना वर्कफ़्लो सक्षम होते हैं
पाठ प्रसंस्करण ब्लॉकों से पहले स्टिच किए गए पाठ को संसाधित करने के लिए (जैसे, NLP मॉडल के साथ पाठ संसाधित करें, निकाले गए पाठ का विश्लेषण करें, पाठ रूपांतरण लागू करें), जिससे पाठ प्रसंस्करण वर्कफ़्लो सक्षम होते हैं
API आउटपुट ब्लॉकों से पहले API प्रतिक्रियाओं में पाठ प्रदान करने के लिए (जैसे, API में OCR पाठ लौटाएँ, प्रतिक्रियाओं के लिए पाठ स्वरूपित करें, निकाला गया पाठ आउटपुट प्रदान करें), जिससे पाठ आउटपुट वर्कफ़्लो सक्षम होते हैं
वर्कफ़्लो आउटपुट में अंतिम आउटपुट के रूप में स्टिच किया गया पाठ प्रदान करने के लिए (जैसे, पाठ निष्कर्षण वर्कफ़्लो, OCR आउटपुट वर्कफ़्लो, दस्तावेज़ प्रसंस्करण वर्कफ़्लो), जिससे पाठ आउटपुट वर्कफ़्लो सक्षम होते हैं
आवश्यकताएँ
इस ब्लॉक को बाउंडिंग बॉक्स और पाठ सामग्री वाले वर्ग नामों सहित OCR डिटेक्शन प्रेडिक्शन (ऑब्जेक्ट डिटेक्शन प्रारूप) की आवश्यकता होती है। यह सहिष्णुता पैरामीटर शून्य से अधिक होना चाहिए और पंक्तियों में डिटेक्शन समूहित करने के लिए ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा को नियंत्रित करता है। यह reading_direction पैरामीटर पाँच मोड का समर्थन करता है: "left_to_right" (मानक क्षैतिज), "right_to_left" (अरबी-शैली), "vertical_top_to_bottom" (ऊर्ध्वाधर), "vertical_bottom_to_top" (उल्टा ऊर्ध्वाधर), और "auto" (बाउंडिंग बॉक्स आयामों के आधार पर स्वचालित पहचान)। यह डिलिमिटर पैरामीटर वैकल्पिक है और प्रत्येक पाठ तत्व के बीच एक डिलिमिटर सम्मिलित करता है (डिफ़ॉल्ट रूप से खाली स्ट्रिंग, जिसका अर्थ है कोई डिलिमिटर नहीं)। ब्लॉक एकल पाठ स्ट्रिंग प्रदान करता है, जो ocr_text कुंजी।
प्रकार पहचानकर्ता
स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/stitch_ocr_detections@v1 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।
गुण
नाम
प्रकार
विवरण
संदर्भ
name
str
इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..
❌
reading_direction
str
पढ़ने और पाठ डिटेक्शन को व्यवस्थित करने की दिशा। 'left_to_right': मानक क्षैतिज पठन (अंग्रेज़ी, अधिकांश भाषाएँ)। 'right_to_left': दाएँ-से-बाएँ पठन (अरबी, हिब्रू)। 'vertical_top_to_bottom': ऊपर से नीचे ऊर्ध्वाधर पठन (पारंपरिक चीनी, जापानी)। 'vertical_bottom_to_top': नीचे से ऊपर ऊर्ध्वाधर पठन (दुर्लभ ऊर्ध्वाधर प्रारूप)। 'auto': औसत बाउंडिंग बॉक्स आयामों के आधार पर पठन दिशा का स्वचालित रूप से पता लगाता है (चौड़ाई > ऊँचाई = क्षैतिज, ऊँचाई >= चौड़ाई = ऊर्ध्वाधर)। यह निर्धारित करता है कि डिटेक्शन को पंक्तियों में कैसे समूहित किया जाए और पंक्तियों के भीतर कैसे क्रमबद्ध किया जाए..
❌
सहिष्णुता
int
समान पंक्ति में डिटेक्शन समूहित करने के लिए पिक्सेल में ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा। इस सहिष्णुता दूरी के भीतर के डिटेक्शन एक ही पंक्ति में समूहित किए जाते हैं। उच्च मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं (परिवर्ती पंक्ति रिक्ति या तिरछे पाठ के लिए उपयोगी)। निम्न मान अधिक पंक्तियाँ बनाते हैं (सघन रिक्ति वाले पाठ के लिए उपयोगी)। शून्य से अधिक होना चाहिए..
✅
डिलिमिटर
str
स्टिचिंग के दौरान प्रत्येक पाठ तत्व (शब्द/अक्षर) के बीच जोड़ने के लिए वैकल्पिक डिलिमिटर स्ट्रिंग। खाली स्ट्रिंग (डिफ़ॉल्ट) का अर्थ कोई डिलिमिटर नहीं - पाठ तत्व सीधे जोड़े जाते हैं। शब्दों के बीच रिक्ति, तत्वों के बीच अल्पविराम, या कस्टम विभाजक जोड़ने के लिए उपयोगी। उदाहरण: शब्दों के बीच रिक्ति जोड़ने के लिए ' ' (स्पेस) का उपयोग करें, या अल्पविराम जोड़ने के लिए ',' का उपयोग करें..
✅
यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।
इनपुट और आउटपुट बाइंडिंग्स
उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार OCR डिटेक्शन स्टिच करें संस्करण v1 है।
इनपुट और आउटपुट बाइंडिंग्स
इनपुट
predictions(object_detection_prediction): OCR मॉडल से प्राप्त OCR डिटेक्शन प्रेडिक्शन। इसमें पाठ सामग्री के साथ बाउंडिंग बॉक्स और वर्ग नाम होने चाहिए। प्रत्येक डिटेक्शन एक शब्द, अक्षर, या पाठ क्षेत्र का प्रतिनिधित्व करता है जिसे सुसंगत पाठ में स्टिच किया जाएगा। डेटा डिक्शनरी में बाउंडिंग बॉक्स (xyxy) और वर्ग नामों के साथ ऑब्जेक्ट डिटेक्शन प्रारूप का समर्थन करता है..सहिष्णुता(पूर्णांक): समान पंक्ति में डिटेक्शन समूहित करने के लिए पिक्सेल में ऊर्ध्वाधर (या ऊर्ध्वाधर पाठ के लिए क्षैतिज) दूरी सीमा। इस सहिष्णुता दूरी के भीतर के डिटेक्शन एक ही पंक्ति में समूहित किए जाते हैं। उच्च मान अधिक दूर स्थित डिटेक्शन को समूहित करते हैं (परिवर्ती पंक्ति रिक्ति या तिरछे पाठ के लिए उपयोगी)। निम्न मान अधिक पंक्तियाँ बनाते हैं (सघन रिक्ति वाले पाठ के लिए उपयोगी)। शून्य से अधिक होना चाहिए..डिलिमिटर(string): स्टिचिंग के दौरान प्रत्येक पाठ तत्व (शब्द/अक्षर) के बीच जोड़ने के लिए वैकल्पिक डिलिमिटर स्ट्रिंग। खाली स्ट्रिंग (डिफ़ॉल्ट) का अर्थ कोई डिलिमिटर नहीं - पाठ तत्व सीधे जोड़े जाते हैं। शब्दों के बीच रिक्ति, तत्वों के बीच अल्पविराम, या कस्टम विभाजक जोड़ने के लिए उपयोगी। उदाहरण: शब्दों के बीच रिक्ति जोड़ने के लिए ' ' (स्पेस) का उपयोग करें, या अल्पविराम जोड़ने के लिए ',' का उपयोग करें..
आउटपुट
ocr_text(string): स्ट्रिंग मान.
अंतिम अपडेट
क्या यह उपयोगी था?