For the complete documentation index, see llms.txt. This page is also available as Markdown.

PaliGemma 2

Serverless Hosted API を通じて Google の PaliGemma 2 vision-language model を使用します

PaliGemma 2 は Google の vision-language model です。画像とテキストプロンプトを受け取り、テキスト応答を返します。PaliGemma 2 は当社の Serverless Hosted API, Dedicated Deployments、および self-hosted Inference.

コードサンプル

1

API Key を取得する

Roboflow アカウントを作成し、キーを次の場所で見つけます Roboflow API 設定ページ そしてシェルで利用できるようにします:

export ROBOFLOW_API_KEY="your-key-here"
2

依存関係をインストールする

次をインストールします: Inference SDK:

pip install inference-sdk
3

モデルを実行する

サンプルは、事前学習済みの paligemma2-3b-pt-224 checkpoint をキャプションプロンプトで呼び出します。

import os
import cv2
import numpy as np
import requests
from inference_sdk import InferenceHTTPClient

content = requests.get("https://media.roboflow.com/quickstart/dog.jpeg").content
image = cv2.imdecode(np.frombuffer(content, np.uint8), cv2.IMREAD_COLOR)

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="paligemma2-3b-pt-224",
    prompt="caption en",
    max_new_tokens=64,
)
print(result["response"])

上記のコードは、モデルの応答をターミナルに出力します:

ここでは、男性の肩の上に犬が見えます

推論速度

〜で測定されたレイテンシ Roboflow Inference 1x NVIDIA L4、バッチサイズ 1、固定プロンプトから greedy decoding でちょうど 128 トークンを生成して測定。レイテンシは出力長に応じて変化するため、他の長さを推定するには tokens/sec を使用してください。

別名
レイテンシ、128 トークン (ms)
トークン/秒

paligemma2-3b-pt-224

3986

32

設定する api_url をデプロイ先に合わせてください:

  • https://serverless.roboflow.com Serverless Hosted API 用。

  • http://localhost:9001 ローカルの Inference サーバー用。

  • あなたの Dedicated Deployment プライベートエンドポイントの URL。

Roboflow で独自の PaliGemma 2 checkpoint を学習し、モデルごとの {workspace}/{model-slug} ID で呼び出すことができます( Versions, Trainings, and Models)。こちらを参照してください 推論ドキュメント 追加のプロンプト形式と対応している checkpoint について。

最終更新

役に立ちましたか?