For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.5

Alibaba의 Qwen3.5-VL 비전-언어 모델을 Workflows, Dedicated Deployment 또는 자체 호스팅 Inference를 통해 사용하세요.

Qwen3.5는 Alibaba의 비전-언어 모델 패밀리입니다. 이미지를 입력과 텍스트 프롬프트를 받아 텍스트 응답을 반환합니다. 두 개의 사전 학습된 체크포인트를 사용할 수 있습니다:

별칭
매개변수

qwen3_5-0.8b

0.8B

qwen3_5-2b

2B

정확도

공식 모델 카드의 주요 비전-언어 벤치마크(비사고 모드) (0.8B, 2B):

벤치마크

qwen3_5-0.8b

qwen3_5-2b

MMMU

47.4

64.2

MathVista (mini)

58.6

73.9

MMBench (EN v1.1)

68.0

81.3

추론 속도

다음을 사용해 측정한 지연 시간 Roboflow Inference 1x NVIDIA L4에서, 배치 크기 1, 고정된 프롬프트로 그리디 디코딩을 사용해 정확히 128개의 토큰을 생성할 때 측정했습니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이를 추정할 때는 토큰/초를 사용하세요.

별칭
지연 시간, 128토큰(ms)
토큰/초

qwen3_5-0.8b

3307

39

qwen3_5-2b

3688

35

Workflows를 통해 Qwen 3.5 VL 사용

Qwen 3.5 VL은 사전 구성된 Workflow Models 페이지의 "Open-Source Models" 탭에서 사용할 수 있습니다. "Qwen VL"을 선택하고 모델 변형과 프롬프트를 고른 다음, "Test API"를 클릭하여 Workflow를 Workspace로 포크하고 추론을 시작하세요.

이 Workflow는 통합된 qwen_vlm@v1 블록을 사용하며, 여러 Qwen VL 세대를 지원합니다:

모델
매개변수

Qwen 3.5 VL 0.8B

0.8B

Qwen 3.5 VL 2B

2B

Qwen 3 VL 2B

2B

Qwen 2.5 VL 7B

7B

Inference SDK를 통해 Qwen 3.5 VL 사용

Qwen3.5에 대한 직접 Inference SDK 호출에는 전용 배포 또는 자가 호스팅 Inference가 필요합니다. 호스팅된 액세스를 사용하려면 위에 설명된 Workflow 경로를 사용하세요.

1

API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요 Roboflow API 설정 페이지 그리고 셸에서 사용할 수 있도록 설정하세요:

2

의존성 설치하기

다음을 설치하세요 Inference SDK:

3

모델 실행하기

설정하세요 api_url 전용 배포 URL 또는 로컬 추론 서버로.

위의 코드는 모델 응답을 터미널에 출력합니다:

설정하세요 api_url 배포 대상에 맞게 설정하세요:

Roboflow에서 자신만의 Qwen3.5 체크포인트를 학습하고, 모델별 {workspace}/{model-slug} ID (참조 버전, 학습, 및 모델).

Inference(자가 호스팅)와 함께 사용

Qwen3.5는 다음을 사용해 직접 로드할 수도 있습니다. inference 패키지를 사용하며, HTTP로 호출하지 않아도 됩니다.

1

패키지 설치하기

사용 inference-gpu[transformers] 를 GPU 머신에서 사용하세요.

2

모델 실행하기

Qwen3.5는 모델이 답변하기 전에 추론 토큰을 생성하는 "thinking" 모드도 지원합니다.

Workflows의 실행 모드

다음에서 사용될 때 Workflow, Qwen3.5는 다음 두 모드 중 하나로 실행됩니다:

  • 로컬 실행 : 모델이 사용자 Inference 서버에서 실행됩니다(GPU 권장).

  • 원격 실행: 모델은 원격 Inference 서버에서 HTTP로 호출됩니다.

마지막 업데이트

도움이 되었나요?