For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3-VL

Serverless Hosted API を通じて Alibaba の Qwen3-VL vision-language model を使用します

Qwen3-VL は Alibaba の vision-language model です。画像とテキストのプロンプトを受け取り、テキスト応答を返します。Roboflow の Serverless Hosted API, Dedicated Deployments、および self-hosted Inference.

コードサンプル

1

API Key を取得する

Roboflow アカウントを作成し、キーを次の場所で見つけます Roboflow API 設定ページ そしてシェルで利用できるようにします:

export ROBOFLOW_API_KEY="your-key-here"
2

依存関係をインストールする

次をインストールします: Inference SDK:

pip install inference-sdk
3

モデルを実行する

サンプルは qwen3vl-2b-instruct チェックポイントに画像の説明を求め、応答を表示します。

import os
import cv2
import numpy as np
import requests
from inference_sdk import InferenceHTTPClient

content = requests.get("https://media.roboflow.com/quickstart/dog.jpeg").content
image = cv2.imdecode(np.frombuffer(content, np.uint8), cv2.IMREAD_COLOR)

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="qwen3vl-2b-instruct",
    prompt="この画像を簡単に説明してください。",
    max_new_tokens=128,
)
print(result["response"])

上記のコードは、モデルの応答をターミナルに出力します:

白いTシャツと赤いショートパンツを着た男性が、ビーグル犬を肩に乗せて運んでいます。犬は黒いハーネスを着けていて、前を見ています。男性は住宅街の舗装された道を歩いており、背景にはアパートの建物があります。左側には、緑の芝生と白い花のある小さな庭があります。

推論速度

〜で測定されたレイテンシ Roboflow Inference 1x NVIDIA L4、バッチサイズ 1、固定プロンプトから greedy decoding でちょうど 128 トークンを生成して測定。レイテンシは出力長に応じて変化するため、他の長さを推定するには tokens/sec を使用してください。

別名
レイテンシ、128 トークン (ms)
トークン/秒

qwen3vl-2b-instruct

4057

32

qwen25-vl-7b

5603

23

qwen25-vl-7b は、以前の Qwen2.5-VL チェックポイントです。ここに記載されているのは、この別名の名前空間を共有し、同じブロックで実行されるためです。

設定する api_url をデプロイ先に合わせてください:

  • https://serverless.roboflow.com Serverless Hosted API 用。

  • http://localhost:9001 ローカルの Inference サーバー用。

  • あなたの Dedicated Deployment プライベートエンドポイントの URL。

Roboflow 上で独自の Qwen3-VL チェックポイントを学習し、モデルごとの {workspace}/{model-slug} ID で呼び出すことができます( Versions, Trainings, and Models).

最終更新

役に立ちましたか?