For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-OCR

画像 OCR に GLM-OCR を Serverless Cloud API で使用します

GLM-OCR は、GLM のビジョン・言語モデルファミリーに基づく OCR モデルです。画像からテキストを文字起こしし、レイアウトが混在する文書、標識、ラベルに適しています。GLM-OCR は、当社の Serverless Cloud API, 専用デプロイメント、および セルフホストの Inference.

コード例

GLM-OCR は共有の /infer/lmm エンドポイントを通じて実行されます。HTTP エンドポイントから直接、次のように呼び出します。 curlまたは inference-sdk ラッパーを使用します。

1

API キーを取得する

Roboflow アカウントを作成し、キーを次の場所で見つけてください。 Roboflow API 設定ページ そしてシェルから使えるようにします。

export ROBOFLOW_API_KEY="your-key-here"
2

モデルを実行する

次の /infer/lmm エンドポイントを curl:

curl --location 'https://serverless.roboflow.com/infer/lmm' \
  --header 'Content-Type: application/json' \
  --data '{
    "api_key": "'"$ROBOFLOW_API_KEY"'",
    "image": {"type": "url", "value": "https://media.roboflow.com/inference/license_plate_1.jpg"},
    "model_id": "glm-ocr",
    "prompt": "OCR",
    "max_new_tokens": 128
  }'
1

API キーを取得する

Roboflow アカウントを作成し、キーを次の場所で見つけてください。 Roboflow API 設定ページ そしてシェルから使えるようにします。

export ROBOFLOW_API_KEY="your-key-here"
2

依存関係をインストールする

このパッケージはモデルを呼び出します:

pip install -U inference-sdk supervision
3

モデルを実行する

テキストを含む画像で GLM-OCR を実行します:

import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/inference/license_plate_1.jpg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="glm-ocr",
    prompt="OCR",
    max_new_tokens=128,
)
print(result["response"])

上記のコードは、認識されたテキストをターミナルに出力します:

280 SE
AUTOMATIC
34 T 6511

推論速度

以下で測定したレイテンシ Roboflow Inference 1x NVIDIA L4、バッチサイズ 1 で、固定プロンプトから貪欲デコードを用いてちょうど 128 トークンを生成した場合。レイテンシは出力長に比例するため、他の長さを見積もるには tokens/sec を使用してください。

エイリアス
レイテンシ、128トークン(ms)
トークン/秒

glm-ocr

1850

69

設定してください api_url をデプロイ先に合わせてください:

  • https://serverless.roboflow.com Serverless Cloud API 用です。

  • http://localhost:9001 ローカルの Inference サーバー。

  • あなたの 専用デプロイメント プライベートエンドポイント用の URL。

Inference(セルフホスト)で使用

GLM-OCR は Inference 自分でホストするサーバー。

ローカルサーバーを起動します:

次に、認識プロンプトを使って共有のマルチモーダルエンドポイントを呼び出します。GLM-OCR はカスタムプロンプトに対応しているため、シリアル番号、ラベル、文書テキストに向けて誘導できます:

参考資料

最終更新

役に立ちましたか?