For the complete documentation index, see llms.txt. This page is also available as Markdown.

SmolVLM2

Dedicated Deployment または self-hosted Inference で HuggingFace の SmolVLM2 vision-language model を使用します

SmolVLM2 は HuggingFace のコンパクトな vision-language model です。画像とテキストプロンプトを受け取り、テキスト応答を返します。

SmolVLM2 は Serverless Hosted API では利用できません。a で実行してください。 Dedicated Deployment または self-hosted Inference.

コードサンプル

1

API Key を取得する

Roboflow アカウントを作成し、キーを次の場所で見つけます Roboflow API 設定ページ そしてシェルで利用できるようにします:

export ROBOFLOW_API_KEY="your-key-here"
2

依存関係をインストールする

次をインストールします: Inference SDK:

pip install inference-sdk
3

モデルを実行する

設定する api_url を Dedicated Deployment の URL またはローカルの Inference server に設定します。

import os
import cv2
import numpy as np
import requests
from inference_sdk import InferenceHTTPClient

content = requests.get("https://media.roboflow.com/quickstart/dog.jpeg").content
image = cv2.imdecode(np.frombuffer(content, np.uint8), cv2.IMREAD_COLOR)

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="smolvlm2",
    prompt="この画像を簡単に説明してください。",
    max_new_tokens=64,
)
print(result["response"])

上記のコードは、モデルの応答をターミナルに出力します:

男性が犬を肩に担いでいます。

推論速度

〜で測定されたレイテンシ Roboflow Inference 1x NVIDIA L4、バッチサイズ 1、固定プロンプトから greedy decoding でちょうど 128 トークンを生成して測定。レイテンシは出力長に応じて変化するため、他の長さを推定するには tokens/sec を使用してください。

別名
レイテンシ、128 トークン (ms)
トークン/秒

smolvlm2

3113

41

設定する api_url をデプロイ先に合わせてください:

  • http://localhost:9001 ローカルの Inference サーバー用。

  • あなたの Dedicated Deployment プライベートエンドポイントの URL。

最終更新

役に立ちましたか?