For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.5

Workflows, Dedicated Deployments 또는 self-hosted Inference를 통해 Alibaba의 Qwen3.5-VL vision-language model을 사용합니다.

Qwen3.5는 Alibaba의 비전-언어 모델 패밀리입니다. 이미지를 입력하고 텍스트 프롬프트를 받으면 텍스트 응답을 반환합니다. 두 개의 사전 학습된 체크포인트를 사용할 수 있습니다:

별칭
매개변수

qwen3_5-0.8b

0.8B

qwen3_5-2b

2B

정확도

공식 model card의 주요 비전-언어 벤치마크(비사고 모드) (0.8B, 2B):

벤치마크

qwen3_5-0.8b

qwen3_5-2b

MMMU

47.4

64.2

MathVista (mini)

58.6

73.9

MMBench (EN v1.1)

68.0

81.3

추론 속도

다음 기준으로 측정한 지연 시간 Roboflow Inference 1x NVIDIA L4에서 배치 크기 1로, 고정 프롬프트에서 greedy decoding을 사용해 정확히 128개의 토큰을 생성할 때의 결과입니다. 지연 시간은 출력 길이에 따라 증가하므로, 다른 길이를 추정할 때는 tokens/sec를 사용하세요.

별칭
지연 시간, 128 토큰(ms)
Tokens/sec

qwen3_5-0.8b

3307

39

qwen3_5-2b

3688

35

Workflows를 통해 Qwen 3.5 VL 사용하기

Qwen 3.5 VL은 사전 구성된 Workflow Models page의 "Open-Source Models" 탭에서 사용할 수 있습니다. "Qwen VL"을 선택하고, 모델 변형과 프롬프트를 고른 다음, "Test API"를 클릭하여 Workflow를 Workspace에 포크하고 추론을 시작합니다.

이 Workflow는 통합된 qwen_vlm@v1 블록을 사용하며, 여러 Qwen VL 세대를 지원합니다:

모델
매개변수

Qwen 3.5 VL 0.8B

0.8B

Qwen 3.5 VL 2B

2B

Qwen 3 VL 2B

2B

Qwen 2.5 VL 7B

7B

Inference SDK를 통해 Qwen 3.5 VL 사용하기

Qwen3.5에 대한 직접 Inference SDK 호출에는 Dedicated Deployment 또는 자체 호스팅 Inference호스팅된 액세스를 사용하려면 위에서 설명한 Workflow 경로를 사용하세요.

1

API Key를 받으세요

Roboflow 계정을 만들고, 다음에서 키를 찾으세요: Roboflow API 설정 페이지 그리고 이를 셸에서 사용할 수 있도록 설정하세요:

2

종속성을 설치하세요

다음을 설치하세요 Inference SDK:

3

모델을 실행하세요

설정 api_url 를 Dedicated Deployment URL 또는 로컬 Inference server에.

위의 코드는 모델 응답을 터미널에 출력합니다:

설정 api_url 을 배포 대상에 맞게 설정하세요:

Roboflow에서 자신만의 Qwen3.5 체크포인트를 학습하고, 모델별 {workspace}/{model-slug} ID로 호출할 수 있습니다(참조 Versions, Trainings, and Models).

마지막 업데이트

도움이 되었나요?