For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-OCR

이미지 OCR을 위해 GLM-OCR을 Serverless Cloud API를 통해 사용하세요.

GLM-OCR은 GLM 비전-언어 모델 계열을 기반으로 한 OCR 모델입니다. 이미지에서 텍스트를 전사하며, 혼합된 레이아웃의 문서, 표지판, 라벨에 적합합니다. 우리는 우리의 Serverless Cloud API, 전용 배포, 그리고 자가 호스팅 추론.

코드 예시

GLM-OCR은 공유된 /infer/lmm 엔드포인트를 통해 실행됩니다. 다음을 사용해 HTTP 엔드포인트를 직접 호출하세요: curl, 또는 다음을 사용하여 inference-sdk 래퍼.

1

API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요. Roboflow API 설정 페이지 에서 다음과 같이 셸에서 사용할 수 있도록 합니다:

export ROBOFLOW_API_KEY="your-key-here"
2

모델 실행

다음을 호출합니다. /infer/lmm 엔드포인트를 다음과 함께 curl:

curl --location 'https://serverless.roboflow.com/infer/lmm' \
  --header 'Content-Type: application/json' \\
  --data '{
    "api_key": "'"$ROBOFLOW_API_KEY"'",
    "image": {"type": "url", "value": "https://media.roboflow.com/inference/license_plate_1.jpg"},
    "model_id": "glm-ocr",
    "prompt": "OCR",
    "max_new_tokens": 128
  }'
1

API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요. Roboflow API 설정 페이지 에서 다음과 같이 셸에서 사용할 수 있도록 합니다:

export ROBOFLOW_API_KEY="your-key-here"
2

의존성 설치

이 패키지는 다음 모델을 호출합니다:

pip install -U inference-sdk supervision
3

모델 실행

텍스트가 포함된 이미지에서 GLM-OCR을 실행합니다:

import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/inference/license_plate_1.jpg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="glm-ocr",
    prompt="OCR",
    max_new_tokens=128,
)
print(result["response"])

위 코드는 인식된 텍스트를 터미널에 출력합니다:

280 SE
자동
34 T 6511

추론 속도

지연 시간 측정 기준: Roboflow Inference 1x NVIDIA L4, 배치 크기 1, 고정된 프롬프트에서 greedy 디코딩으로 정확히 128개의 토큰을 생성하여 측정했습니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이를 추정하려면 토큰/초를 사용하세요.

별칭
지연 시간, 128 토큰(ms)
토큰/초

glm-ocr

1850

69

설정 api_url 를 배포 대상에 맞게:

  • https://serverless.roboflow.com 서버리스 클라우드 API용입니다.

  • http://localhost:9001 로컬 Inference 서버용.

  • 당신의 전용 배포 비공개 엔드포인트용 URL.

Inference(자가 호스팅)에서 사용

GLM-OCR은 또한 한 Inference 직접 호스팅하는 서버에서도 실행됩니다.

로컬 서버를 시작하세요:

그런 다음 인식 프롬프트와 함께 공유 멀티모달 엔드포인트를 호출하세요. GLM-OCR은 사용자 지정 프롬프트를 지원하므로, 일련번호, 라벨 또는 문서 텍스트 쪽으로 유도할 수 있습니다:

추가 읽을거리

마지막 업데이트

도움이 되었나요?