> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/ko/supported-models/qwen3-vl.md).

# Qwen3-VL

Qwen3-VL은 Alibaba의 비전-언어 모델입니다. 이미지를 하나와 텍스트 프롬프트를 입력받아 텍스트 응답을 반환합니다. 우리는 다음을 통해 Qwen3-VL을 지원합니다 [서버리스 클라우드 API](https://docs.roboflow.com/deployment/roboflow-cloud/serverless-api), [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments), 및 [자체 호스팅 추론](https://docs.roboflow.com/deployment/self-hosted/self-hosted).

## Qwen3-VL API

{% stepper %}
{% step %}

### API 키 받기

Roboflow 계정을 만들고 다음에서 키를 찾으세요 [Roboflow API 설정 페이지](https://app.roboflow.com/settings/api) 그리고 셸에서 사용할 수 있도록 설정하세요:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### 종속성 설치

다음을 설치하세요 [Inference SDK](https://docs.roboflow.com/deployment/self-hosted/self-hosted):

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### 모델 실행

샘플은 다음을 프롬프트합니다 `qwen3vl-2b-instruct` 이미지를 설명하기 위해 체크포인트를 사용하고 응답을 출력합니다.

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="qwen3vl-2b-instruct",
    prompt="이 이미지를 간단히 설명해 주세요.",
    max_new_tokens=128,
)
print(result["response"])

```

{% endstep %}
{% endstepper %}

위 코드는 모델 응답을 터미널에 출력합니다:

```
흰색 티셔츠와 빨간 반바지를 입은 한 남자가 어깨에 비글 한 마리를 메고 있다. 개는 검은 하네스를 착용하고 있으며 앞을 보고 있다. 남자는 배경에 아파트 건물이 보이는 주거 지역의 포장된 길을 걷고 있다. 왼쪽에는 초록색 잔디와 흰 꽃이 있는 작은 정원이 있다.
```

<figure><img src="/files/36f183f86c362db5608df2504a5dfa5f4ba38467" alt=""><figcaption></figcaption></figure>

## Qwen3-VL 추론 속도

다음으로 측정한 지연 시간 [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1x NVIDIA L4에서, 배치 크기 1로, 고정된 프롬프트에서 greedy decoding으로 정확히 128개 토큰을 생성할 때 측정했습니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이를 추정할 때는 tokens/sec를 사용하세요.

<table data-search="false"><thead><tr><th>별칭</th><th>지연 시간, 128개 토큰(ms)</th><th>토큰/초</th></tr></thead><tbody><tr><td><code>qwen3vl-2b-instruct</code></td><td>4057</td><td>32</td></tr><tr><td><code>qwen25-vl-7b</code></td><td>5603</td><td>23</td></tr></tbody></table>

`qwen25-vl-7b` 는 이전의 Qwen2.5-VL 체크포인트입니다. 이 별칭 네임스페이스를 공유하고 동일한 블록을 통해 실행되기 때문에 여기에 나와 있습니다.

{% hint style="info" %}
설정하세요 `api_url` 배포 대상에 맞게:

* `https://serverless.roboflow.com` 서버리스 클라우드 API용.
* `http://localhost:9001` 로컬 [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 서버.
* 귀하의 [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) 비공개 엔드포인트용 URL.
  {% endhint %}

Roboflow에서 자신만의 Qwen3-VL 체크포인트를 학습하고 모델별 이름으로 `{workspace}/{model-slug}` ID를 사용하세요(참조 [버전, 학습 및 모델](/models/ko/versions-trainings-and-models.md)).
