> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/ja/supported-models/qwen3-5.md).

# Qwen3.5

Qwen3.5 は Alibaba の視覚言語モデルファミリーです。画像とテキストプロンプトを受け取り、テキスト応答を返します。2つの事前学習済みチェックポイントが利用できます:

<table data-search="false"><thead><tr><th>エイリアス</th><th>パラメータ</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>0.8B</td></tr><tr><td><code>qwen3_5-2b</code></td><td>2B</td></tr></tbody></table>

## Qwen3.5 の精度

公式モデルカードの注目視覚言語ベンチマーク（非思考モード）([0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B), [2B](https://huggingface.co/Qwen/Qwen3.5-2B)):

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td>ベンチマーク</td><td><code>qwen3_5-0.8b</code></td><td><code>qwen3_5-2b</code></td></tr><tr><td>MMMU</td><td>47.4</td><td>64.2</td></tr><tr><td>MathVista（mini）</td><td>58.6</td><td>73.9</td></tr><tr><td>MMBench（EN v1.1）</td><td>68.0</td><td>81.3</td></tr></tbody></table>

## Qwen3.5 の推論速度

レイテンシの計測条件: [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1 台の NVIDIA L4、バッチサイズ 1、固定プロンプトからグリーディーデコーディングでちょうど 128 トークンを生成した場合。レイテンシは出力長に応じて変化するため、他の長さの推定には tokens/sec を使用してください。

<table data-search="false"><thead><tr><th>エイリアス</th><th>レイテンシ、128 トークン (ms)</th><th>トークン/秒</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>3307</td><td>39</td></tr><tr><td><code>qwen3_5-2b</code></td><td>3688</td><td>35</td></tr></tbody></table>

## ワークフローで Qwen3.5 を使う

Qwen 3.5 VL は、あらかじめ構成された [Workflow](https://docs.roboflow.com/workflows) モデルページの「Open-Source Models」タブで利用できます。「Qwen VL」を選択し、モデルバリアントとプロンプトを選んでから「Test API」をクリックすると、ワークフローをあなたのワークスペースにフォークして推論を開始できます。

このワークフローは統合された `qwen_vlm@v1` ブロックを使用しており、複数の Qwen VL 世代をサポートします:

<table data-search="false"><thead><tr><th>モデル</th><th>パラメータ</th></tr></thead><tbody><tr><td>Qwen 3.5 VL 0.8B</td><td>0.8B</td></tr><tr><td>Qwen 3.5 VL 2B</td><td>2B</td></tr><tr><td>Qwen 3 VL 2B</td><td>2B</td></tr><tr><td>Qwen 2.5 VL 7B</td><td>7B</td></tr></tbody></table>

## Qwen3.5 API

{% hint style="info" %}
Qwen3.5 への直接推論 SDK 呼び出しには [専用デプロイメント](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) または [セルフホスト推論](https://docs.roboflow.com/deployment/self-hosted/self-hosted)が必要です。ホスト型アクセスには、上記で説明したワークフローの手順を使用してください。
{% endhint %}

{% stepper %}
{% step %}

### API キーを取得する

Roboflow アカウントを作成し、キーを次の [Roboflow の API 設定ページ](https://app.roboflow.com/settings/api) で見つけて、シェルで利用できるようにします:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### 依存関係をインストールする

次をインストールします: [Inference SDK](https://docs.roboflow.com/deployment/self-hosted/self-hosted):

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### モデルを実行する

次を設定します: `api_url` Dedicated DeploymentのURL、またはローカルのInferenceサーバーに設定します。

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="qwen3_5-2b",
    prompt="この画像を簡潔に説明してください。",
    max_new_tokens=256,
)
print(result["response"])

```

{% endstep %}
{% endstepper %}

上のコードは、モデルの応答を端末に出力します:

```
白いTシャツと赤いショートパンツを着た人物が、肩に黒いバックパックを担いでおり、その上にビーグル犬が乗っています。場面は住宅街の屋外で、背景には近代的なアパートの建物があり、歩道沿いには緑が広がっています。人物は大きな窓のある建物の近くを歩いているか、立っているように見えます。
```

<figure><img src="/files/bf5c21bbb5089a29d20556175f1cb1e38fdbaf9e" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
次を設定します: `api_url` をデプロイ先に合わせて設定します:

* `http://localhost:9001` ローカル [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) サーバー。
* プライベートエンドポイントの [専用デプロイメント](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) URL。
  {% endhint %}

Roboflow で独自の Qwen3.5 チェックポイントを学習し、モデルごとの `{workspace}/{model-slug}` ID（参照 [バージョン、トレーニング、モデル](/models/ja/versions-trainings-and-models.md)).

{% embed url="<https://www.youtube.com/watch?v=Y8CR6IzLDaw>" %}

## 自己ホスト型推論で Qwen3.5 を実行する

Qwen3.5 は、 [`inference`](https://docs.roboflow.com/deployment/self-hosted/self-hosted) パッケージを使って HTTP 経由ではなく直接読み込むこともできます。

{% stepper %}
{% step %}

### パッケージをインストール

```bash
pip install "inference[transformers]"
```

使用する `inference-gpu[transformers]` GPU マシン上で。
{% endstep %}

{% step %}

### モデルを実行する

```python
from inference.models.qwen3_5vl.qwen3_5vl_inference_models import (
    InferenceModelsQwen35VLAdapter,
)

model = InferenceModelsQwen35VLAdapter(
    model_id="qwen3_5-0.8b",
    api_key="YOUR_API_KEY",
)

image = "https://media.roboflow.com/dog.jpeg"
prompt = "この画像には犬が何匹いますか？"

preprocessed, metadata = model.preprocess(image, prompt)
predictions = model.predict(preprocessed)
result = model.postprocess(predictions, metadata)

print(result[0].response)
```

{% endstep %}
{% endstepper %}

Qwen3.5 は「思考」モードもサポートしており、このモードではモデルが回答前に推論トークンを生成します。

### Workflows の実行モード

で使用される場合 [Workflow](https://docs.roboflow.com/workflows)、Qwen3.5 は次の2つのモードのいずれかで動作します:

* **ローカル実行**: モデルはあなたの Inference サーバー上で実行されます（GPU 推奨）。
* **リモート実行**: モデルはリモートの推論サーバー上で HTTP 経由で呼び出されます。
