For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3-VL

Alibaba의 Qwen3-VL 비전-언어 모델을 Serverless Cloud API를 통해 사용하세요.

Qwen3-VL은 Alibaba의 비전-언어 모델입니다. 이미지와 텍스트 프롬프트를 입력받아 텍스트 응답을 반환합니다. 우리는 우리의 Serverless Cloud API, 전용 배포, 그리고 자가 호스팅 추론.

코드 예시

1

API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요. Roboflow API 설정 페이지 에서 다음과 같이 셸에서 사용할 수 있도록 합니다:

export ROBOFLOW_API_KEY="your-key-here"
2

의존성 설치

다음을 설치하세요 Inference SDK:

pip install -U inference-sdk supervision
3

모델 실행

이 샘플은 다음을 qwen3vl-2b-instruct 체크포인트를 사용해 이미지를 설명하고 응답을 출력합니다.

import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="qwen3vl-2b-instruct",
    prompt="이 이미지를 간단히 설명해 주세요.",
    max_new_tokens=128,
)
print(result["response"])

위 코드는 모델 응답을 터미널에 출력합니다:

흰색 티셔츠와 빨간 반바지를 입은 남자가 어깨에 비글을 태우고 있습니다. 개는 검은 하네스를 착용하고 있으며 앞을 보고 있습니다. 남자는 배경에 아파트 건물이 보이는 주거 지역의 포장된 길을 걷고 있습니다. 왼쪽에는 푸른 잔디와 흰 꽃이 있는 작은 정원이 있습니다.

추론 속도

지연 시간 측정 기준: Roboflow Inference 1x NVIDIA L4, 배치 크기 1, 고정된 프롬프트에서 greedy 디코딩으로 정확히 128개의 토큰을 생성하여 측정했습니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이를 추정하려면 토큰/초를 사용하세요.

별칭
지연 시간, 128 토큰(ms)
토큰/초

qwen3vl-2b-instruct

4057

32

qwen25-vl-7b

5603

23

qwen25-vl-7b 는 이전 Qwen2.5-VL 체크포인트입니다. 이 항목은 이 별칭 네임스페이스를 공유하고 동일한 블록을 통해 실행되기 때문에 여기에 나열되어 있습니다.

설정 api_url 를 배포 대상에 맞게:

  • https://serverless.roboflow.com 서버리스 클라우드 API용입니다.

  • http://localhost:9001 로컬 Inference 서버용.

  • 당신의 전용 배포 비공개 엔드포인트용 URL.

Roboflow에서 자신만의 Qwen3-VL 체크포인트를 학습하고, 모델별 {workspace}/{model-slug} ID를 사용하세요(참조: 버전, 학습, 및 모델).

마지막 업데이트

도움이 되었나요?