> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/ko/supported-models/glm-ocr.md).

# GLM-OCR

GLM-OCR은 GLM 비전-언어 모델 계열을 기반으로 한 OCR 모델입니다. 이미지를 텍스트로 변환하며, 레이아웃이 혼합된 문서, 표지판, 라벨에 특히 적합합니다. 우리는 GLM-OCR을 다음을 통해 지원합니다 [서버리스 호스티드 API](https://docs.roboflow.com/deployment/roboflow-cloud/serverless-api), [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments), 및 [자가 호스팅 Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted).

## 코드 샘플

GLM-OCR은 공유된 `/infer/lmm` 엔드포인트를 통해 실행됩니다. 다음을 사용하여 HTTP 엔드포인트를 직접 호출하세요: `curl`, 또는 다음을 사용하여 [`inference-sdk`](https://docs.roboflow.com/reference/inference/inference-sdk) 래퍼를 사용합니다.

{% tabs %}
{% tab title="HTTP(curl)" icon="webhook" %}
{% stepper %}
{% step %}

### API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요 [Roboflow API 설정 페이지](https://app.roboflow.com/settings/api) 그리고 셸에서 사용할 수 있도록 설정하세요:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### 모델 실행하기

다음을 호출하세요: `/infer/lmm` 엔드포인트를 다음으로 `curl`:

```bash
curl --location 'https://serverless.roboflow.com/infer/lmm' \
  --header 'Content-Type: application/json' \
  --data '{
    "api_key": "'"$ROBOFLOW_API_KEY"'",
    "image": {"type": "url", "value": "https://media.roboflow.com/inference/license_plate_1.jpg"},
    "model_id": "glm-ocr",
    "prompt": "OCR",
    "max_new_tokens": 128
  }'
```

{% endstep %}
{% endstepper %}
{% endtab %}

{% tab title="SDK (Python)" icon="python" %}
{% stepper %}
{% step %}

### API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요 [Roboflow API 설정 페이지](https://app.roboflow.com/settings/api) 그리고 셸에서 사용할 수 있도록 설정하세요:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### 의존성 설치하기

이 패키지는 다음 모델을 호출합니다:

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### 모델 실행하기

텍스트가 포함된 이미지에서 GLM-OCR을 실행하세요:

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/inference/license_plate_1.jpg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="glm-ocr",
    prompt="OCR",
    max_new_tokens=128,
)
print(result["response"])
```

위 코드는 인식된 텍스트를 터미널에 출력합니다:

```
280 SE
AUTOMATIC
34 T 6511
```

<figure><img src="/files/f948b8a7f83569b75dae717951dfe60cf7654407" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}
{% endtab %}
{% endtabs %}

## 추론 속도

다음을 사용해 측정한 지연 시간 [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1x NVIDIA L4에서, 배치 크기 1, 고정된 프롬프트로 그리디 디코딩을 사용해 정확히 128개의 토큰을 생성할 때 측정했습니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이를 추정할 때는 토큰/초를 사용하세요.

<table data-search="false"><thead><tr><th>별칭</th><th>지연 시간, 128토큰(ms)</th><th>토큰/초</th></tr></thead><tbody><tr><td><code>glm-ocr</code></td><td>1850</td><td>69</td></tr></tbody></table>

{% hint style="info" %}
설정하세요 `api_url` 배포 대상에 맞게 설정하세요:

* `https://serverless.roboflow.com` Serverless Hosted API용입니다.
* `http://localhost:9001` 로컬 [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 서버.
* 사용자 [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) 비공개 엔드포인트용 URL.
  {% endhint %}

## Inference(자가 호스팅)와 함께 사용

GLM-OCR은 또한 다음에서 실행됩니다: [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 사용자가 직접 호스팅하는 서버.

{% hint style="warning" %}
셀프 호스팅 GLM-OCR에는 GPU와 다음이 포함된 Inference 빌드가 필요합니다 `inference-models` 지원이 활성화되어 있어야 합니다(`USE_INFERENCE_MODELS=true`).
{% endhint %}

로컬 서버를 시작하세요:

```bash
pip install inference-cli
inference server start  # http://localhost:9001을 제공합니다
```

그런 다음 인식 프롬프트와 함께 공유 멀티모달 엔드포인트를 호출하세요. GLM-OCR은 사용자 지정 프롬프트를 지원하므로, 일련번호, 라벨 또는 문서 텍스트 쪽으로 유도할 수 있습니다:

```python
import os
from inference_sdk import InferenceHTTPClient

client = InferenceHTTPClient(
    api_url="http://127.0.0.1:9001",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)

result = client.infer_lmm(
    inference_input="./serial_number.png",
    prompt="Text Recognition:",
    model_id="glm-ocr",
)
print(result["response"])
```

## 추가 읽을거리

* [Hugging Face의 GLM-OCR](https://huggingface.co/zai-org/GLM-OCR)
* [OCR로 이미지에서 텍스트를 감지하는 방법](https://blog.roboflow.com/ocr-api/)
