For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-OCR

Serverless Hosted API를 통해 이미지 OCR에 GLM-OCR을 사용합니다.

GLM-OCR은 GLM 비전-언어 모델 계열을 기반으로 한 OCR 모델입니다. 이미지를 텍스트로 전사하며, 혼합된 레이아웃의 문서, 표지판, 라벨에 매우 적합합니다. 우리는 우리의 Serverless Hosted API, Dedicated Deployments그리고 자체 호스팅 Inference.

코드 샘플

GLM-OCR은 공유된 /infer/lmm endpoint입니다. 다음을 사용해 HTTP endpoint를 통해 직접 호출하세요: curl또는 inference-sdk 래퍼를 사용하세요.

1

API Key를 받으세요

Roboflow 계정을 만들고, 다음에서 키를 찾으세요: Roboflow API 설정 페이지 그리고 이를 셸에서 사용할 수 있도록 설정하세요:

export ROBOFLOW_API_KEY="your-key-here"
2

모델을 실행하세요

다음에 호출하세요. /infer/lmm 엔드포인트를 curl:

curl --location 'https://serverless.roboflow.com/infer/lmm' \
  --header 'Content-Type: application/json' \
  --data '{
    "api_key": "'"$ROBOFLOW_API_KEY"'",
    "image": {"type": "url", "value": "https://media.roboflow.com/inference/license_plate_1.jpg"},
    "model_id": "glm-ocr",
    "prompt": "OCR",
    "max_new_tokens": 128
  }'

추론 속도

다음 기준으로 측정한 지연 시간 Roboflow Inference 1x NVIDIA L4에서 배치 크기 1로, 고정 프롬프트에서 greedy decoding을 사용해 정확히 128개의 토큰을 생성할 때의 결과입니다. 지연 시간은 출력 길이에 따라 증가하므로, 다른 길이를 추정할 때는 tokens/sec를 사용하세요.

별칭
지연 시간, 128 토큰(ms)
Tokens/sec

glm-ocr

1850

69

설정 api_url 을 배포 대상에 맞게 설정하세요:

  • https://serverless.roboflow.com Serverless Hosted API용입니다.

  • http://localhost:9001 로컬 Inference 서버용입니다.

  • 귀하의 Dedicated Deployment 비공개 엔드포인트용 URL입니다.

마지막 업데이트

도움이 되었나요?