For the complete documentation index, see llms.txt. This page is also available as Markdown.

OCR मॉडल

DocTR ऑप्टिकल कैरेक्टर रिकग्निशन का उपयोग करके किसी छवि से पाठ निकालें।

DocTR ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) का उपयोग करके एक छवि में अक्षरों को प्राप्त करें।

यह ब्लॉक किसी छवि के भीतर का पाठ लौटाता है।

आप इस ब्लॉक का उपयोग किसी डिटेक्शन्स-आधारित ब्लॉक (अर्थात ObjectDetectionBlock) के साथ मिलाकर करना चाह सकते हैं। एक ऑब्जेक्ट डिटेक्शन मॉडल आगे की प्रोसेसिंग के लिए किसी छवि से विशिष्ट क्षेत्रों को अलग कर सकता है (अर्थात लॉजिस्टिक्स उपयोग-केस में एक शिपिंग कंटेनर ID)। फिर आप OCR चलाने से पहले रुचि के क्षेत्र को क्रॉप करने के लिए DynamicCropBlock का उपयोग कर सकते हैं।

पहले डिटेक्शन्स मॉडल का उपयोग करना और फिर डिटेक्शन्स को क्रॉप करना आपको किसी छवि के विशेष क्षेत्रों पर अपना विश्लेषण केंद्रित करने की अनुमति देता है।

प्रकार पहचानकर्ता

स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फील्ड: roboflow_core/ocr_model@v1 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।

गुण

नाम

प्रकार

विवरण

संदर्भ

name

str

वर्कफ़्लो में चरण का विशिष्ट नाम।

यह संदर्भ कॉलम यह दर्शाता है कि प्रॉपर्टी को गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है, जो वर्कफ़्लो रनटाइम में उपलब्ध हैं। अधिक जानकारी के लिए देखें Bindings

इनपुट और आउटपुट बाइंडिंग्स

उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। जाँचें कि कौन-से बाइंडिंग प्रकार OCR मॉडल संस्करण में v1 है।

इनपुट और आउटपुट बाइंडिंग्स
  • इनपुट

    • छवियाँ (image): जिस छवि पर अनुमान लगाना है..

  • आउटपुट

    • परिणाम (स्ट्रिंग): स्ट्रिंग मान।

    • भविष्यवाणियाँ (object_detection_prediction): sv.Detections(...) ऑब्जेक्ट के रूप में पहचाने गए बाउंडिंग बॉक्स वाली भविष्यवाणी।

    • parent_id (parent_id): चरण आउटपुट के लिए पैरेंट का पहचानकर्ता।

    • root_parent_id (parent_id): चरण आउटपुट के लिए पैरेंट का पहचानकर्ता।

    • prediction_type (prediction_type): भविष्यवाणी के प्रकार वाला स्ट्रिंग मान।

उदाहरण JSON परिभाषा

अंतिम अपडेट

क्या यह उपयोगी था?