For the complete documentation index, see llms.txt. This page is also available as Markdown.

TrOCR

Dedicated Deployment या self-hosted Inference पर text recognition के लिए Microsoft के TrOCR का उपयोग करें

TrOCR Microsoft का transformer-आधारित OCR model है। इसे line-level text recognition के लिए प्रशिक्षित किया गया है, इसलिए सर्वोत्तम परिणामों के लिए अपने input को एक ही text region तक crop करें।

TrOCR Serverless Hosted API पर उपलब्ध नहीं है। इसे एक पर चलाएँ Dedicated Deployment या self-hosted Inference.

कोड नमूना

1

अपनी API Key प्राप्त करें

एक Roboflow खाता बनाएं, अपनी key यहाँ पर ढूँढें Roboflow API settings page और इसे अपने shell में उपलब्ध कराएँ:

export ROBOFLOW_API_KEY="your-key-here"
2

निर्भरताएँ इंस्टॉल करें

ये packages image को fetch करते हैं और API को call करते हैं:

pip install requests opencv-python
3

मॉडल चलाएँ

सेट करें URL को अपने Dedicated Deployment URL या local Inference server पर।

import base64
import os
import cv2
import numpy as np
import requests

URL = "https://your-deployment.roboflow.cloud"
content = requests.get("https://media.roboflow.com/inference/license_plate_1.jpg").content
image = cv2.imdecode(np.frombuffer(content, np.uint8), cv2.IMREAD_COLOR)
_, buffer = cv2.imencode(".jpg", image)
image_base64 = base64.b64encode(buffer).decode("utf-8")

response = requests.post(
    f"{URL}/ocr/trocr",
    json={
        "api_key": os.environ["ROBOFLOW_API_KEY"],
        "image": {"type": "base64", "value": image_base64},
    },
)
print(response.json()["result"])

ऊपर दिया गया code पहचाने गए text को terminal पर print करता है:

कुल

Inference speed

Latency मापी गई Roboflow Inference 1x NVIDIA L4 पर, batch size 1, warmup के बाद का औसत।

मॉडल
विलंबता (ms)

trocr

114.4

TrOCR एक ही cropped text line को पहचानता है, इसलिए यह latency एक line crop के लिए है, पूरे page के लिए नहीं।

सेट करें URL को अपने deployment target से मिलाएँ:

अंतिम अपडेट

क्या यह उपयोगी था?