> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/ja/supported-models/qwen3-5.md).

# Qwen3.5

Qwen3.5はAlibabaの視覚言語モデルファミリーです。画像とテキストプロンプトを受け取り、テキスト応答を返します。2つの事前学習済みチェックポイントが利用可能です：

<table data-search="false"><thead><tr><th>別名</th><th>パラメータ</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>0.8B</td></tr><tr><td><code>qwen3_5-2b</code></td><td>2B</td></tr></tbody></table>

## Qwen3.5の精度

公式モデルカードに記載された主要な視覚言語ベンチマーク（非思考モード）（[0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B), [2B](https://huggingface.co/Qwen/Qwen3.5-2B)):

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td>ベンチマーク</td><td><code>qwen3_5-0.8b</code></td><td><code>qwen3_5-2b</code></td></tr><tr><td>MMMU</td><td>47.4</td><td>64.2</td></tr><tr><td>MathVista（mini）</td><td>58.6</td><td>73.9</td></tr><tr><td>MMBench（EN v1.1）</td><td>68.0</td><td>81.3</td></tr></tbody></table>

## Qwen3.5の推論速度

次で測定したレイテンシー [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1 台の NVIDIA L4、バッチサイズ 1、固定プロンプトから greedy decoding でちょうど 128 トークンを生成した条件で測定。レイテンシは出力長に比例するため、他の長さの見積もりには tokens/sec を使用してください。

<table data-search="false"><thead><tr><th>別名</th><th>レイテンシ、128トークン（ms）</th><th>トークン/秒</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>3307</td><td>39</td></tr><tr><td><code>qwen3_5-2b</code></td><td>3688</td><td>35</td></tr></tbody></table>

## WorkflowでQwen3.5を使用する

Qwen 3.5 VLは、事前設定済みの [Workflow](https://docs.roboflow.com/workflows) Modelsページの「Open-Source Models」タブで利用できます。「Qwen VL」を選択し、モデルのバリアントとプロンプトを選んでから、「Test API」をクリックしてWorkflowをWorkspaceにフォークし、推論を開始してください。

このWorkflowは統合された `qwen_vlm@v1` ブロックを使用します。これは複数のQwen VL世代をサポートします：

<table data-search="false"><thead><tr><th>モデル</th><th>パラメータ</th></tr></thead><tbody><tr><td>Qwen 3.5 VL 0.8B</td><td>0.8B</td></tr><tr><td>Qwen 3.5 VL 2B</td><td>2B</td></tr><tr><td>Qwen 3 VL 2B</td><td>2B</td></tr><tr><td>Qwen 2.5 VL 7B</td><td>7B</td></tr></tbody></table>

## Qwen3.5 API

{% hint style="info" %}
Qwen3.5への直接的なInference SDK呼び出しには [Dedicated Deployment](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) または [self-hosted Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted)が必要です。ホスト型アクセスを利用するには、上記で説明したWorkflowの方法を使用してください。
{% endhint %}

{% stepper %}
{% step %}

### APIキーを取得する

Roboflow アカウントを作成し、 [Roboflow API 設定ページ](https://app.roboflow.com/settings/api) でキーを見つけ、シェルで利用できるようにします。

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### 依存関係をインストールする

以下をインストールします [Inference SDK](https://docs.roboflow.com/deployment/self-hosted/self-hosted):

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### モデルを実行する

設定する `api_url` 専用デプロイURLまたはローカル推論サーバーに対して。

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient, InferenceConfiguration

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
).configure(InferenceConfiguration(api_key_transport="header"))
result = client.infer_lmm(
    image,
    model_id="qwen3_5-2b",
    prompt="この画像を簡単に説明してください。",
    max_new_tokens=256,
)
print(result["response"] )
```

{% endstep %}
{% endstepper %}

上記のコードは、モデルの応答をターミナルに出力します：

```
白いTシャツと赤いショーツを着た人物が、肩に黒いバックパックをかけており、その上にビーグル犬が乗っています。場面は住宅地の屋外で、背景には近代的な集合住宅があり、歩道沿いには緑が植えられています。人物は、大きな窓のある建物の近くを歩いているか、立っているように見えます。
```

<figure><img src="/files/bf5c21bbb5089a29d20556175f1cb1e38fdbaf9e" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
設定する `api_url` をデプロイ先に合わせます:

* `http://localhost:9001` ローカルの [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) サーバー用。
* あなたの [Dedicated Deployment](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) プライベートエンドポイント用のURL。
  {% endhint %}

Roboflowで独自のQwen3.5チェックポイントを学習し、モデルごとの `{workspace}/{model-slug}` IDに置き換えてください（ [バージョン、トレーニング、モデル](/models/ja/versions-trainings-and-models.md)).

{% embed url="<https://www.youtube.com/watch?v=Y8CR6IzLDaw>" %}

## セルフホスト型InferenceでQwen3.5を実行する

Qwen3.5は、 [`inference`](https://docs.roboflow.com/deployment/self-hosted/self-hosted) パッケージを使って直接読み込むこともでき、HTTP経由で呼び出す必要はありません。

{% stepper %}
{% step %}

### パッケージをインストールする

```bash
pip install "inference[transformers]"
```

使用する `inference-gpu[transformers]` GPUマシンでは。
{% endstep %}

{% step %}

### モデルを実行する

```python
from inference.models.qwen3_5vl.qwen3_5vl_inference_models import (
    InferenceModelsQwen35VLAdapter,
)

model = InferenceModelsQwen35VLAdapter(
    model_id="qwen3_5-0.8b",
    api_key="YOUR_API_KEY",
)

image = "https://media.roboflow.com/dog.jpeg"
prompt = "この画像には犬が何匹いますか？"

preprocessed, metadata = model.preprocess(image, prompt)
predictions = model.predict(preprocessed)
result = model.postprocess(predictions, metadata)

print(result[0].response)
```

{% endstep %}
{% endstepper %}

Qwen3.5は「thinking」モードもサポートしており、このモードではモデルが回答前に推論トークンを生成します。

### Workflowsの実行モード

次の環境で使用する場合： [Workflow](https://docs.roboflow.com/workflows)、Qwen3.5は次の2つのモードのいずれかで動作します：

* **ローカル実行**：モデルはInferenceサーバー上で実行されます（GPU推奨）。
* **リモート実行**：モデルはリモートのInferenceサーバー上でHTTP経由で呼び出されます。
