For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-OCR

हमारे Serverless Cloud API के माध्यम से इमेज OCR के लिए GLM-OCR का उपयोग करें

GLM-OCR, GLM vision-language model परिवार पर आधारित एक OCR मॉडल है। यह एक छवि से पाठ का लिप्यंतरण करता है और दस्तावेज़ों, संकेतों, तथा मिश्रित लेआउट वाले लेबलों के लिए उपयुक्त है। हम GLM-OCR का समर्थन अपने माध्यम से करते हैं सर्वरलेस क्लाउड API के माध्यम से समर्थित करते हैं, समर्पित डिप्लॉयमेंट्स, और स्व-होस्टेड Inference.

कोड नमूना

GLM-OCR साझा के माध्यम से चलता है /infer/lmm एंडपॉइंट। इसे सीधे HTTP एंडपॉइंट के माध्यम से कॉल करें curl, या inference-sdk रैपर के साथ।

1

अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ ढूँढें Roboflow API सेटिंग्स पेज और इसे अपने शेल में उपलब्ध कराएँ:

export ROBOFLOW_API_KEY="आपकी-कुंजी-यहाँ"
2

मॉडल चलाएँ

को कॉल करें /infer/lmm एंडपॉइंट के साथ curl:

curl --location 'https://serverless.roboflow.com/infer/lmm' \
  --header 'Content-Type: application/json' \
  --data '{
    "api_key": "'"$ROBOFLOW_API_KEY"'",
    "image": {"type": "url", "value": "https://media.roboflow.com/inference/license_plate_1.jpg"},
    "model_id": "glm-ocr",
    "prompt": "OCR",
    "max_new_tokens": 128
  }'
1

अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ ढूँढें Roboflow API सेटिंग्स पेज और इसे अपने शेल में उपलब्ध कराएँ:

export ROBOFLOW_API_KEY="आपकी-कुंजी-यहाँ"
2

निर्भरताएँ इंस्टॉल करें

यह पैकेज मॉडल को कॉल करता है:

pip install -U inference-sdk supervision
3

मॉडल चलाएँ

पाठ वाली एक छवि पर GLM-OCR चलाएँ:

import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/inference/license_plate_1.jpg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="glm-ocr",
    prompt="OCR",
    max_new_tokens=128,
)
print(result["response"])

ऊपर दिया गया कोड पहचाने गए पाठ को टर्मिनल पर प्रिंट करता है:

280 SE
AUTOMATIC
34 T 6511

इन्फरेंस गति

विलंबता मापी गई Roboflow Inference 1x NVIDIA L4 पर, बैच साइज़ 1 के साथ, एक निश्चित प्रॉम्प्ट से greedy decoding का उपयोग करके ठीक 128 टोकन जनरेट करते हुए। लेटेंसी आउटपुट लंबाई के साथ स्केल होती है, इसलिए अन्य लंबाइयों का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

उपनाम
लेटेंसी, 128 टोकन (मि.से.)
टोकन/सेकंड

glm-ocr

1850

69

सेट करें api_url को अपने डिप्लॉयमेंट लक्ष्य से मिलाएँ:

Inference के साथ उपयोग करें (सेल्फ-होस्टेड)

GLM-OCR एक पर भी चलता है Inference ऐसा सर्वर जिसे आप स्वयं होस्ट करते हैं।

एक स्थानीय सर्वर शुरू करें:

फिर मान्यता प्रॉम्प्ट के साथ साझा मल्टीमोडल एंडपॉइंट को कॉल करें। GLM-OCR कस्टम प्रॉम्प्ट स्वीकार करता है, इसलिए आप इसे क्रमांक, लेबल, या दस्तावेज़ पाठ की ओर निर्देशित कर सकते हैं:

अधिक पढ़ें

अंतिम अपडेट

क्या यह उपयोगी था?