For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3-VL

Alibaba の Qwen3-VL 画像言語モデルを Serverless Cloud API で使用します

Qwen3-VLはAlibabaの視覚言語モデルです。画像とテキストプロンプトを受け取り、テキスト応答を返します。私たちはQwen3-VLを当社の Serverless Cloud API, 専用デプロイメント、および セルフホストの Inference.

コード例

1

API キーを取得する

Roboflow アカウントを作成し、キーを次の場所で見つけてください。 Roboflow API 設定ページ そしてシェルから使えるようにします。

export ROBOFLOW_API_KEY="your-key-here"
2

依存関係をインストールする

次をインストールします。 Inference SDK:

pip install -U inference-sdk supervision
3

モデルを実行する

このサンプルはその qwen3vl-2b-instruct 画像を説明するチェックポイントで、応答を出力します。

import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="qwen3vl-2b-instruct",
    prompt="この画像を簡単に説明してください。",
    max_new_tokens=128,
)
print(result["response"])

上記のコードはモデルの応答をターミナルに出力します:

白いTシャツと赤いショーツを着た男性が、ビーグル犬を肩に乗せて運んでいます。犬は黒いハーネスを着けており、前を見ています。男性は住宅地の舗装された小道を歩いており、背景には集合住宅の建物があります。左側には緑の芝生と白い花のある小さな庭があります。

推論速度

以下で測定したレイテンシ Roboflow Inference 1x NVIDIA L4、バッチサイズ 1 で、固定プロンプトから貪欲デコードを用いてちょうど 128 トークンを生成した場合。レイテンシは出力長に比例するため、他の長さを見積もるには tokens/sec を使用してください。

エイリアス
レイテンシ、128トークン(ms)
トークン/秒

qwen3vl-2b-instruct

4057

32

qwen25-vl-7b

5603

23

qwen25-vl-7b は以前のQwen2.5-VLチェックポイントです。これは同じエイリアス名前空間を共有し、同じブロックを通って実行されるため、ここに掲載されています。

設定してください api_url をデプロイ先に合わせてください:

  • https://serverless.roboflow.com Serverless Cloud API 用です。

  • http://localhost:9001 ローカルの Inference サーバー。

  • あなたの 専用デプロイメント プライベートエンドポイント用の URL。

Roboflowで独自のQwen3-VLチェックポイントを学習し、モデルごとの {workspace}/{model-slug} IDに置き換えてください( バージョン、トレーニング、およびモデル).

最終更新

役に立ちましたか?