> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/ko/supported-models/qwen3-5.md).

# Qwen3.5

Qwen3.5는 Alibaba의 비전-언어 모델 패밀리입니다. 이미지를 입력과 텍스트 프롬프트를 받아 텍스트 응답을 반환합니다. 두 개의 사전 학습된 체크포인트를 사용할 수 있습니다:

<table data-search="false"><thead><tr><th>별칭</th><th>매개변수</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>0.8B</td></tr><tr><td><code>qwen3_5-2b</code></td><td>2B</td></tr></tbody></table>

## 정확도

공식 모델 카드의 주요 비전-언어 벤치마크(비사고 모드) ([0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B), [2B](https://huggingface.co/Qwen/Qwen3.5-2B)):

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td>벤치마크</td><td><code>qwen3_5-0.8b</code></td><td><code>qwen3_5-2b</code></td></tr><tr><td>MMMU</td><td>47.4</td><td>64.2</td></tr><tr><td>MathVista (mini)</td><td>58.6</td><td>73.9</td></tr><tr><td>MMBench (EN v1.1)</td><td>68.0</td><td>81.3</td></tr></tbody></table>

## 추론 속도

다음을 사용해 측정한 지연 시간 [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1x NVIDIA L4에서, 배치 크기 1, 고정된 프롬프트로 그리디 디코딩을 사용해 정확히 128개의 토큰을 생성할 때 측정했습니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이를 추정할 때는 토큰/초를 사용하세요.

<table data-search="false"><thead><tr><th>별칭</th><th>지연 시간, 128토큰(ms)</th><th>토큰/초</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>3307</td><td>39</td></tr><tr><td><code>qwen3_5-2b</code></td><td>3688</td><td>35</td></tr></tbody></table>

## Workflows를 통해 Qwen 3.5 VL 사용

Qwen 3.5 VL은 사전 구성된 [Workflow](https://docs.roboflow.com/workflows) Models 페이지의 "Open-Source Models" 탭에서 사용할 수 있습니다. "Qwen VL"을 선택하고 모델 변형과 프롬프트를 고른 다음, "Test API"를 클릭하여 Workflow를 Workspace로 포크하고 추론을 시작하세요.

이 Workflow는 통합된 `qwen_vlm@v1` 블록을 사용하며, 여러 Qwen VL 세대를 지원합니다:

<table data-search="false"><thead><tr><th>모델</th><th>매개변수</th></tr></thead><tbody><tr><td>Qwen 3.5 VL 0.8B</td><td>0.8B</td></tr><tr><td>Qwen 3.5 VL 2B</td><td>2B</td></tr><tr><td>Qwen 3 VL 2B</td><td>2B</td></tr><tr><td>Qwen 2.5 VL 7B</td><td>7B</td></tr></tbody></table>

## Inference SDK를 통해 Qwen 3.5 VL 사용

{% hint style="info" %}
Qwen3.5에 대한 직접 Inference SDK 호출에는 [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) 또는 [자가 호스팅 Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted)가 필요합니다. 호스팅된 액세스를 사용하려면 위에 설명된 Workflow 경로를 사용하세요.
{% endhint %}

{% stepper %}
{% step %}

### API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요 [Roboflow API 설정 페이지](https://app.roboflow.com/settings/api) 그리고 셸에서 사용할 수 있도록 설정하세요:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### 의존성 설치하기

다음을 설치하세요 [Inference SDK](https://docs.roboflow.com/deployment/self-hosted/self-hosted):

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### 모델 실행하기

설정하세요 `api_url` 전용 배포 URL 또는 로컬 추론 서버로.

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="qwen3_5-2b",
    prompt="이 이미지를 간단히 설명해 주세요.",
    max_new_tokens=256,
)
print(result["response"])
```

{% endstep %}
{% endstepper %}

위의 코드는 모델 응답을 터미널에 출력합니다:

```
흰색 티셔츠와 빨간 반바지를 입은 한 사람이 어깨에 검은색 배낭을 메고 있으며, 그 위에 비글 한 마리가 올라타 있습니다. 장면은 주거 지역의 야외에서 펼쳐지며, 배경에는 현대적인 아파트 건물들이 있고 인도 따라 녹지가 있습니다. 그 사람은 큰 창문이 있는 건물 근처를 걷고 있거나 서 있는 것으로 보입니다.
```

<figure><img src="/files/93b7e0602dcfab4ebe1f15292b1b024a87ea802c" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
설정하세요 `api_url` 배포 대상에 맞게 설정하세요:

* `http://localhost:9001` 로컬 [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 서버.
* 사용자 [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) 비공개 엔드포인트용 URL.
  {% endhint %}

Roboflow에서 자신만의 Qwen3.5 체크포인트를 학습하고, 모델별 `{workspace}/{model-slug}` ID (참조 [버전, 학습, 및 모델](/models/ko/versions-trainings-and-models.md)).

{% embed url="<https://www.youtube.com/watch?v=Y8CR6IzLDaw>" %}

## Inference(자가 호스팅)와 함께 사용

Qwen3.5는 다음을 사용해 직접 로드할 수도 있습니다. [`inference`](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 패키지를 사용하며, HTTP로 호출하지 않아도 됩니다.

{% stepper %}
{% step %}

### 패키지 설치하기

```bash
pip install "inference[transformers]"
```

사용 `inference-gpu[transformers]` 를 GPU 머신에서 사용하세요.
{% endstep %}

{% step %}

### 모델 실행하기

```python
from inference.models.qwen3_5vl.qwen3_5vl_inference_models import (
    InferenceModelsQwen35VLAdapter,
)

model = InferenceModelsQwen35VLAdapter(
    model_id="qwen3_5-0.8b",
    api_key="YOUR_API_KEY",
)

image = "https://media.roboflow.com/dog.jpeg"
prompt = "이 이미지에 개가 몇 마리 있나요?"

preprocessed, metadata = model.preprocess(image, prompt)
predictions = model.predict(preprocessed)
result = model.postprocess(predictions, metadata)

print(result[0].response)
```

{% endstep %}
{% endstepper %}

Qwen3.5는 모델이 답변하기 전에 추론 토큰을 생성하는 "thinking" 모드도 지원합니다.

### Workflows의 실행 모드

다음에서 사용될 때 [Workflow](https://docs.roboflow.com/workflows), Qwen3.5는 다음 두 모드 중 하나로 실행됩니다:

* **로컬 실행** : 모델이 사용자 Inference 서버에서 실행됩니다(GPU 권장).
* **원격 실행**: 모델은 원격 Inference 서버에서 HTTP로 호출됩니다.
