> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/ko/supported-models/qwen3-vl.md).

# Qwen3-VL

Qwen3-VL은 Alibaba의 비전-언어 모델입니다. 이미지와 텍스트 프롬프트를 받아 텍스트 응답을 반환합니다. 저희는 Qwen3-VL을 저희의 [서버리스 클라우드 API](https://docs.roboflow.com/deployment/roboflow-cloud/serverless-api), [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments), 및 [자체 호스팅 추론](https://docs.roboflow.com/deployment/self-hosted/self-hosted).

## Qwen3-VL API

{% stepper %}
{% step %}

### API 키 받기

Roboflow 계정을 만들고, [Roboflow API 설정 페이지](https://app.roboflow.com/settings/api) 에서 키를 찾아 셸에서 사용할 수 있게 하세요:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### 의존성을 설치하세요

설치하세요 [Inference SDK](https://docs.roboflow.com/deployment/self-hosted/self-hosted):

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### 모델 실행

샘플은 다음을 `qwen3vl-2b-instruct` 체크포인트를 사용해 이미지를 설명하고 응답을 출력합니다.

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient, InferenceConfiguration

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
).configure(InferenceConfiguration(api_key_transport="header"))
result = client.infer_lmm(
    image,
    model_id="qwen3vl-2b-instruct",
    prompt="이 이미지를 간단히 설명하세요.",
    max_new_tokens=128,
)
print(result["response"])
```

{% endstep %}
{% endstepper %}

위 코드는 모델 응답을 터미널에 출력합니다:

```
흰 티셔츠와 빨간 반바지를 입은 한 남자가 비글 한 마리를 어깨에 메고 있습니다. 개는 검은색 하네스를 착용하고 있으며 앞을 바라보고 있습니다. 남자는 아파트 건물이 배경에 보이는 주거 지역의 포장된 길을 걷고 있습니다. 왼쪽에는 초록 잔디와 하얀 꽃이 있는 작은 정원이 있습니다.
```

<figure><img src="/files/36f183f86c362db5608df2504a5dfa5f4ba38467" alt=""><figcaption></figcaption></figure>

## Qwen3-VL 추론 속도

다음을 사용하여 측정한 지연 시간 [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 고정된 프롬프트에서 그리디 디코딩으로 정확히 128개 토큰을 생성하며, 1x NVIDIA L4에서 배치 크기 1로 측정했습니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이를 추정할 때는 tokens/sec를 사용하세요.

<table data-search="false"><thead><tr><th>별칭</th><th>지연 시간, 128개 토큰(ms)</th><th>토큰/초</th></tr></thead><tbody><tr><td><code>qwen3vl-2b-instruct</code></td><td>4057</td><td>32</td></tr><tr><td><code>qwen25-vl-7b</code></td><td>5603</td><td>23</td></tr></tbody></table>

`qwen25-vl-7b` 는 이전의 Qwen2.5-VL 체크포인트입니다. 이 항목이 여기에 있는 이유는 이 별칭 네임스페이스를 공유하고 동일한 블록을 통해 실행되기 때문입니다.

{% hint style="info" %}
설정하세요 `api_url` 를 배포 대상에 맞게:

* `https://serverless.roboflow.com` 는 서버리스 클라우드 API용입니다.
* `http://localhost:9001` 로컬 [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 서버용입니다.
* 귀하의 [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) 는 비공개 엔드포인트의 URL입니다.
  {% endhint %}

Roboflow에서 자신만의 Qwen3-VL 체크포인트를 학습시키고 이를 모델별 `{workspace}/{model-slug}` ID(참조 [버전, 학습, 모델](/models/ko/versions-trainings-and-models.md)).
