OCR मॉडल
DocTR ऑप्टिकल कैरेक्टर रिकग्निशन का उपयोग करके किसी छवि से पाठ निकालें।
अंतिम अपडेट
क्या यह उपयोगी था?
DocTR ऑप्टिकल कैरेक्टर रिकग्निशन का उपयोग करके किसी छवि से पाठ निकालें।
DocTR ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) का उपयोग करके एक छवि में अक्षरों को प्राप्त करें।
यह ब्लॉक किसी छवि के भीतर का पाठ लौटाता है।
आप इस ब्लॉक का उपयोग किसी डिटेक्शन्स-आधारित ब्लॉक (अर्थात ObjectDetectionBlock) के साथ मिलाकर करना चाह सकते हैं। एक ऑब्जेक्ट डिटेक्शन मॉडल आगे की प्रोसेसिंग के लिए किसी छवि से विशिष्ट क्षेत्रों को अलग कर सकता है (अर्थात लॉजिस्टिक्स उपयोग-केस में एक शिपिंग कंटेनर ID)। फिर आप OCR चलाने से पहले रुचि के क्षेत्र को क्रॉप करने के लिए DynamicCropBlock का उपयोग कर सकते हैं।
पहले डिटेक्शन्स मॉडल का उपयोग करना और फिर डिटेक्शन्स को क्रॉप करना आपको किसी छवि के विशेष क्षेत्रों पर अपना विश्लेषण केंद्रित करने की अनुमति देता है।
स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फील्ड: roboflow_core/ocr_model@v1 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।
नाम
प्रकार
विवरण
संदर्भ
name
str
वर्कफ़्लो में चरण का विशिष्ट नाम।
❌
यह संदर्भ कॉलम यह दर्शाता है कि प्रॉपर्टी को गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है, जो वर्कफ़्लो रनटाइम में उपलब्ध हैं। अधिक जानकारी के लिए देखें Bindings ।
उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। जाँचें कि कौन-से बाइंडिंग प्रकार OCR मॉडल संस्करण में v1 है।
इनपुट
छवियाँ (image): जिस छवि पर अनुमान लगाना है..
आउटपुट
परिणाम (स्ट्रिंग): स्ट्रिंग मान।
भविष्यवाणियाँ (object_detection_prediction): sv.Detections(...) ऑब्जेक्ट के रूप में पहचाने गए बाउंडिंग बॉक्स वाली भविष्यवाणी।
parent_id (parent_id): चरण आउटपुट के लिए पैरेंट का पहचानकर्ता।
root_parent_id (parent_id): चरण आउटपुट के लिए पैरेंट का पहचानकर्ता।
prediction_type (prediction_type): भविष्यवाणी के प्रकार वाला स्ट्रिंग मान।
अंतिम अपडेट
क्या यह उपयोगी था?
क्या यह उपयोगी था?
{
"name": "<your_step_name_here>",
"type": "roboflow_core/ocr_model@v1",
"images": "$inputs.image"
}