For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen-VL

모든 Qwen 비전 모델을 기본 방식 또는 OpenRouter를 통해 실행합니다.

Roboflow 인프라에서 기본적으로 실행하거나 OpenRouter를 통해 모든 Qwen 비전-언어 모델을 실행하세요.

임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:

  • 열린 프롬프트 (제약 없음) - 어떤 프롬프트든 사용하여 원시 응답을 생성합니다

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지의 텍스트를 인식합니다

  • 시각 질의응답 (visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다

  • 짧은 캡션 생성 (caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다

  • 캡션 생성 (detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다

  • 단일 레이블 분류 (classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다

  • 다중 레이블 분류 (multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다

  • 프롬프트 없는 객체 탐지 (object-detection) - 모델이 이미지의 주요 객체에 대한 바운딩 박스를 탐지하여 반환합니다

  • 구조화된 출력 생성 (structured-answering) - 모델이 지정된 필드가 포함된 JSON 응답을 반환합니다

🛠️ 백엔드 선택

  • 네이티브(Roboflow) - 작은 Qwen-VL 모델(0.8B–7B)은 다른 Roboflow 모델과 동일한 인프라에서 실행됩니다. 지연 시간이 더 짧습니다. OCR, 캡셔닝, 시각적 질의응답 같은 작업에 권장됩니다.

  • OpenRouter - 대형 호스팅 Qwen 모델(9B–397B)은 다음을 통해 접근할 수 있습니다 OpenRouter. 기본적으로 Roboflow가 관리하는 API 키를 사용하며 Roboflow 크레딧이 청구됩니다. 직접 붙여 넣은 sk-or-... 키를 입력란에 API 키 Roboflow 청구를 우회하려면 입력란을 사용하세요. 더 큰 모델(분류, 객체 탐지, 구조화된 답변)의 이점을 얻는 구조화된 작업에 권장됩니다.

model_version 드롭다운에는 지원되는 모든 변형이 나열되며, 각 변형은 하나의 백엔드에 연결됩니다. 검증기가 선택한 백엔드와 모델 간의 불일치를 감지합니다.

🔒 개인정보 보호 필터(OpenRouter만 해당)

  • 데이터 수집 안 함 (기본값) – 제공업체가 입력값으로 학습하지 않을 수 있습니다.

  • 데이터 수집 허용 – 더 넓은 제공업체 풀.

  • 데이터 보존 없음 – 가장 엄격하며, 아무것도 보존하지 않는 제공업체로 제한합니다.

유형 식별자

단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/qwen_vlm@v1 워크플로우에 이 블록을 단계로 추가하려면.

속성

이름

유형

설명

참조

name

str

이 단계에 대한 고유 식별자를 입력하세요..

API 키

str

OpenRouter API 키(backend=openrouter일 때만 사용됨). 기본값은 Roboflow의 관리형 키입니다. 직접 제공하세요 sk-or-... 키를 제공하세요..

privacy_level

str

제공자 개인정보 보호 필터(backend=openrouter일 때만 사용됨). 더 엄격한 수준은 제공자 풀을 줄이며 관리형 키의 호출당 비용을 증가시킬 수 있습니다..

최대 토큰 수

정수

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..

온도

float

샘플링 온도(backend=openrouter일 때만 사용됨). 네이티브 Qwen-VL 런타임은 temperature 조절 값을 허용하지 않습니다. 범위 0.0-2.0 - 높을수록 더 무작위적 / "창의적인" 생성이 됩니다..

최대 동시 요청 수

정수

이미지 배치에 대해 병렬로 실행할 OpenRouter 요청의 최대 수(backend=openrouter일 때만 사용됨). 네이티브 백엔드는 이미지를 순차적으로 처리합니다. 설정하지 않으면 전역 Workflows Execution Engine 기본값으로 대체됩니다. OpenRouter 속도 제한에 걸리면 이를 제한하세요..

백엔드

str

추론을 실행할 위치. Native = Roboflow 인프라. OpenRouter = OpenRouter를 통한 대형 호스팅 Qwen 모델..

model_version

str

네이티브 Qwen-VL 변형. 사전 학습된 모델을 선택하거나 미세 조정된 모델 작업공간의 Qwen3 미세 조정을 사용하려면..

fine_tuned_model_id

str

작업공간의 미세 조정된 Qwen3-VL 모델, 다음 workspace/version 형식..

openrouter_model_version

str

OpenRouter에서 호스팅되는 Qwen 변형..

작업 유형

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

prompt

str

Qwen 모델에 대한 텍스트 프롬프트.

enable_thinking

bool

Qwen3.5-VL의 추론 모드를 활성화합니다. 이 모드에서는 모델이 답변 전에 사고 토큰을 출력합니다. 추론 흔적은 다음에 반환됩니다 생각 출력. 이 기능은 Qwen 3.5 VL 2B 체크포인트(및 이를 기반으로 한 Qwen3-VL 미세 조정)만 지원하며, 그 외에서는 무시됩니다..

출력 구조

Dict[str, str]

예상 JSON 응답의 구조를 담은 딕셔너리.

클래스

List[str]

사용할 클래스 목록.

참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.

런타임 호환성

인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 Qwen-VL 버전 v1 을 가지고 있는지.

입력 및 출력 바인딩
  • 입력

    • API 키 (Union[ROBOFLOW_MANAGED_KEY, secret, string]): OpenRouter API 키(backend=openrouter일 때만 사용됨). 기본값은 Roboflow의 관리형 키입니다. 직접 제공하세요 sk-or-... 키를 제공하세요..

    • 온도 (float): 샘플링 온도(backend=openrouter일 때만 사용됨). 네이티브 Qwen-VL 런타임은 temperature 조절 값을 허용하지 않습니다. 범위 0.0-2.0 - 높을수록 더 무작위적 / "창의적인" 생성이 됩니다..

    • 이미지 (이미지): 추론할 이미지입니다..

    • model_version (string): 네이티브 Qwen-VL 변형. 사전 학습된 모델을 선택하거나 미세 조정된 모델 작업공간의 Qwen3 미세 조정을 사용하려면..

    • fine_tuned_model_id (Union[roboflow_model_id, string]): 작업공간의 미세 조정된 Qwen3-VL 모델, 다음 workspace/version 형식..

    • openrouter_model_version (string): OpenRouter에서 호스팅되는 Qwen 변형..

    • prompt (string): Qwen 모델에 대한 텍스트 프롬프트.

    • 클래스 (list_of_values): 사용할 클래스 목록.

  • 출력

예시 JSON 정의

마지막 업데이트

도움이 되었나요?