For the complete documentation index, see llms.txt. This page is also available as Markdown.

OpenAI

비전 기능이 있는 OpenAI의 GPT 모델을 실행합니다.

v5

비전 기능을 갖춘 OpenAI의 GPT 모델(GPT-5 및 GPT-4o 포함)에 질문하세요.

임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:

  • 자유 프롬프트 (제약 없음) - 원하는 프롬프트를 사용하여 원시 응답을 생성합니다

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지 내 텍스트를 인식합니다

  • 시각적 질의응답 (visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다

  • 짧은 캡션 생성 (caption) - 모델이 이미지의 짧은 설명을 제공합니다

  • 캡션 생성 (detailed-caption) - 모델이 이미지의 긴 설명을 제공합니다

  • 단일 레이블 분류 (classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다

  • 다중 레이블 분류 (multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다

  • 프롬프트 없는 객체 탐지 (object-detection) - 모델이 이미지에서 두드러진 객체를 탐지하고 경계 상자를 반환합니다

  • 구조화된 출력 생성 (structured-answering) - 모델이 지정된 필드를 포함한 JSON 응답을 반환합니다

object-detection 작업은 대규모 벤치마크에서 선택된 모델별 프롬프트 계약을 사용합니다 - 사용 roboflow_core/vlm_as_detector@v2 출력 중 어떤 것이든 예측으로 변환하려면:

  • 대부분의 모델(GPT-5.2 및 그 이후 버전, 그리고 알 수 없는/향후 모델)은 반환합니다 {"detections": [...]}box_2d 형식의 박스를 [x_min, y_min, x_max, y_max] 형식(업로드된 이미지의 절대 픽셀 좌표)과 레이블 키를 반환하며, 이는 구조화된 출력을 통해 강제됩니다.

  • GPT-5.1/GPT-5 생성 모델은 기존의 정규화된 딕셔너리(x_min/y_min/x_max/y_max 0.0-1.0 범위의 class_nameconfidence).

  • GPT-4.x/GPT-4o 및 nano 계열 모델은 절대 픽셀 좌표의 일반 JSON 목록을 반환합니다. box_2d 항목.

절대 좌표 형식은 신뢰도 점수를 제공하지 않습니다. roboflow_core/vlm_as_detector@v2 이 탐지 결과에 신뢰도 점수를 1.0, 따라서 후속 신뢰도 필터링은 이러한 형식에서는 의미가 없습니다.

이미지는 가장 긴 변이 2048px를 넘지 않도록 축소되며, 이 작업에서는 무손실 PNG로 전송됩니다.

OpenAI API 키를 제공하거나 값을 rf_key:account (또는 rf_key:user:<id>)로 설정하여 Roboflow의 API를 통해 요청을 프록시하세요.

유형 식별자

다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v5 워크플로에 블록을 단계로 추가합니다.

속성

이름

유형

설명

참조

name

str

이 단계의 고유 식별자를 입력하세요..

task_type

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

prompt

str

OpenAI 모델에 전달할 텍스트 프롬프트입니다.

output_structure

Dict[str, str]

예상 JSON 응답의 구조를 담은 딕셔너리입니다.

classes

List[str]

사용할 클래스 목록입니다.

api_key

str

귀하의 OpenAI API 키입니다.

model_version

str

사용할 모델입니다.

reasoning_effort

str

추론을 제어합니다. 값을 낮추면 더 빠른 응답과 더 적은 토큰을 얻을 수 있습니다. GPT-5.1 이상 모델은 기본값이 'none'(추론 없음)이며 'none', 'low', 'medium', 'high'를 지원합니다. GPT-5.2는 'xhigh'도 지원합니다. GPT-5 모델은 기본값이 'medium'이며 'minimal', 'low', 'medium', 'high'를 지원합니다..

image_detail

str

이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다. 다음에는 적용되지 않습니다. object-detection 작업에는 적용되지 않으며, 이 작업은 항상 detail 힌트 없이 이미지를 전송합니다..

max_tokens

int

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다. 지정하지 않으면 모델의 기본 제한을 사용합니다. 최소값은 16입니다..

temperature

float

모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..

max_concurrent_requests

int

입력 이미지 배치가 제공될 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에 전역 구성된 값으로 기본 설정됩니다. OpenAI 제한에 걸리면 이 값을 제한하세요..

참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.

런타임 호환성

requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v5 에서

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.

    • classes (list_of_values): 사용할 클래스 목록입니다.

    • api_key (Union[ROBOFLOW_MANAGED_KEY, secret, string]): 귀하의 OpenAI API 키입니다.

    • model_version (string): 사용할 모델입니다.

    • reasoning_effort (string): 추론을 제어합니다. 값을 낮추면 더 빠른 응답과 더 적은 토큰을 얻을 수 있습니다. GPT-5.1 이상 모델은 기본값이 'none'(추론 없음)이며 'none', 'low', 'medium', 'high'를 지원합니다. GPT-5.2는 'xhigh'도 지원합니다. GPT-5 모델은 기본값이 'medium'이며 'minimal', 'low', 'medium', 'high'를 지원합니다..

    • image_detail (string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다. 다음에는 적용되지 않습니다. object-detection 작업에는 적용되지 않으며, 이 작업은 항상 detail 힌트 없이 이미지를 전송합니다..

    • temperature (float): 모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..

  • 출력

예시 JSON 정의

v4

비전 기능을 갖춘 OpenAI의 GPT 모델(GPT-5 및 GPT-4o 포함)에 질문하세요.

임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:

  • 자유 프롬프트 (제약 없음) - 원하는 프롬프트를 사용하여 원시 응답을 생성합니다

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지 내 텍스트를 인식합니다

  • 시각적 질의응답 (visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다

  • 짧은 캡션 생성 (caption) - 모델이 이미지의 짧은 설명을 제공합니다

  • 캡션 생성 (detailed-caption) - 모델이 이미지의 긴 설명을 제공합니다

  • 단일 레이블 분류 (classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다

  • 다중 레이블 분류 (multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다

  • 프롬프트 없는 객체 탐지 (object-detection) - 모델이 이미지에서 두드러진 객체를 탐지하고 경계 상자를 반환합니다

  • 구조화된 출력 생성 (structured-answering) - 모델이 지정된 필드를 포함한 JSON 응답을 반환합니다

OpenAI API 키를 제공하거나 값을 rf_key:account (또는 rf_key:user:<id>)로 설정하여 Roboflow의 API를 통해 요청을 프록시하세요.

유형 식별자

다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v4 워크플로에 블록을 단계로 추가합니다.

속성

이름

유형

설명

참조

name

str

이 단계의 고유 식별자를 입력하세요..

task_type

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

prompt

str

OpenAI 모델에 전달할 텍스트 프롬프트입니다.

output_structure

Dict[str, str]

예상 JSON 응답의 구조를 담은 딕셔너리입니다.

classes

List[str]

사용할 클래스 목록입니다.

api_key

str

귀하의 OpenAI API 키입니다.

model_version

str

사용할 모델입니다.

reasoning_effort

str

추론을 제어합니다. 값을 낮추면 더 빠른 응답과 더 적은 토큰을 얻을 수 있습니다. GPT-5.1 이상 모델은 기본값이 'none'(추론 없음)이며 'none', 'low', 'medium', 'high'를 지원합니다. GPT-5.2는 'xhigh'도 지원합니다. GPT-5 모델은 기본값이 'medium'이며 'minimal', 'low', 'medium', 'high'를 지원합니다..

image_detail

str

이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..

max_tokens

int

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다. 지정하지 않으면 모델의 기본 제한을 사용합니다. 최소값은 16입니다..

temperature

float

모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..

max_concurrent_requests

int

입력 이미지 배치가 제공될 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에 전역 구성된 값으로 기본 설정됩니다. OpenAI 제한에 걸리면 이 값을 제한하세요..

참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.

런타임 호환성

requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v4 에서

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.

    • classes (list_of_values): 사용할 클래스 목록입니다.

    • api_key (Union[ROBOFLOW_MANAGED_KEY, secret, string]): 귀하의 OpenAI API 키입니다.

    • model_version (string): 사용할 모델입니다.

    • reasoning_effort (string): 추론을 제어합니다. 값을 낮추면 더 빠른 응답과 더 적은 토큰을 얻을 수 있습니다. GPT-5.1 이상 모델은 기본값이 'none'(추론 없음)이며 'none', 'low', 'medium', 'high'를 지원합니다. GPT-5.2는 'xhigh'도 지원합니다. GPT-5 모델은 기본값이 'medium'이며 'minimal', 'low', 'medium', 'high'를 지원합니다..

    • image_detail (string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..

    • temperature (float): 모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..

  • 출력

예시 JSON 정의

v3

비전 기능을 갖춘 OpenAI의 GPT 모델(GPT-5 및 GPT-4o 포함)에 질문하세요.

임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:

  • 자유 프롬프트 (제약 없음) - 원하는 프롬프트를 사용하여 원시 응답을 생성합니다

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지 내 텍스트를 인식합니다

  • 시각적 질의응답 (visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다

  • 짧은 캡션 생성 (caption) - 모델이 이미지의 짧은 설명을 제공합니다

  • 캡션 생성 (detailed-caption) - 모델이 이미지의 긴 설명을 제공합니다

  • 단일 레이블 분류 (classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다

  • 다중 레이블 분류 (multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다

  • 구조화된 출력 생성 (structured-answering) - 모델이 지정된 필드를 포함한 JSON 응답을 반환합니다

OpenAI API 키를 제공하거나 값을 rf_key:account (또는 rf_key:user:<id>)로 설정하여 Roboflow의 API를 통해 요청을 프록시하세요.

유형 식별자

다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v3 워크플로에 블록을 단계로 추가합니다.

속성

이름

유형

설명

참조

name

str

이 단계의 고유 식별자를 입력하세요..

task_type

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

prompt

str

OpenAI 모델에 전달할 텍스트 프롬프트입니다.

output_structure

Dict[str, str]

예상 JSON 응답의 구조를 담은 딕셔너리입니다.

classes

List[str]

사용할 클래스 목록입니다.

api_key

str

귀하의 OpenAI API 키입니다.

model_version

str

사용할 모델입니다.

image_detail

str

이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..

max_tokens

int

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..

temperature

float

모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..

max_concurrent_requests

int

입력 이미지 배치가 제공될 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에 전역 구성된 값으로 기본 설정됩니다. OpenAI 제한에 걸리면 이 값을 제한하세요..

참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.

런타임 호환성

requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v3 에서

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.

    • classes (list_of_values): 사용할 클래스 목록입니다.

    • api_key (Union[ROBOFLOW_MANAGED_KEY, secret, string]): 귀하의 OpenAI API 키입니다.

    • model_version (string): 사용할 모델입니다.

    • image_detail (string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..

    • temperature (float): 모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..

  • 출력

예시 JSON 정의

v2

비전 기능을 갖춘 OpenAI의 GPT 모델(GPT-4o 및 GPT-5 포함)에 질문하세요.

임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:

  • 자유 프롬프트 (제약 없음) - 원하는 프롬프트를 사용하여 원시 응답을 생성합니다

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지 내 텍스트를 인식합니다

  • 시각적 질의응답 (visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다

  • 짧은 캡션 생성 (caption) - 모델이 이미지의 짧은 설명을 제공합니다

  • 캡션 생성 (detailed-caption) - 모델이 이미지의 긴 설명을 제공합니다

  • 단일 레이블 분류 (classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다

  • 다중 레이블 분류 (multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다

  • 구조화된 출력 생성 (structured-answering) - 모델이 지정된 필드를 포함한 JSON 응답을 반환합니다

Vision이 포함된 GPT-4 모델을 사용하려면 OpenAI API 키를 제공해야 합니다.

유형 식별자

다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v2 워크플로에 블록을 단계로 추가합니다.

속성

이름

유형

설명

참조

name

str

이 단계의 고유 식별자를 입력하세요..

task_type

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

prompt

str

OpenAI 모델에 전달할 텍스트 프롬프트입니다.

output_structure

Dict[str, str]

예상 JSON 응답의 구조를 담은 딕셔너리입니다.

classes

List[str]

사용할 클래스 목록입니다.

api_key

str

귀하의 OpenAI API 키입니다.

model_version

str

사용할 모델입니다.

image_detail

str

이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..

max_tokens

int

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..

temperature

float

모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..

max_concurrent_requests

int

입력 이미지 배치가 제공될 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에 전역 구성된 값으로 기본 설정됩니다. OpenAI 제한에 걸리면 이 값을 제한하세요..

참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.

런타임 호환성

requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v2 에서

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.

    • classes (list_of_values): 사용할 클래스 목록입니다.

    • api_key (Union[secret, string]): 귀하의 OpenAI API 키입니다.

    • model_version (string): 사용할 모델입니다.

    • image_detail (string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..

    • temperature (float): 모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..

  • 출력

예시 JSON 정의

v1

Vision 모델이 포함된 OpenAI의 GPT-4에 질문하세요.

OpenAIBlock에 임의의 텍스트 프롬프트를 지정할 수 있습니다.

Vision이 포함된 GPT-4 모델을 사용하려면 OpenAI API 키를 제공해야 합니다.

이 모델은 이전에 LMM 블록의 일부였습니다.

유형 식별자

다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v1 워크플로에 블록을 단계로 추가합니다.

속성

이름

유형

설명

참조

name

str

이 단계의 고유 식별자를 입력하세요..

prompt

str

OpenAI 모델에 전달할 텍스트 프롬프트입니다.

openai_api_key

str

귀하의 OpenAI API 키입니다.

openai_model

str

사용할 모델입니다.

json_output_format

Dict[str, str]

요청된 출력 필드의 이름을 해당 설명에 매핑하는 딕셔너리를 보관합니다.

image_detail

str

이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..

max_tokens

int

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..

참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.

런타임 호환성

requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v1 에서

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.

    • openai_api_key (Union[secret, string]): 귀하의 OpenAI API 키입니다.

    • openai_model (string): 사용할 모델입니다.

    • image_detail (string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..

  • 출력

    • parent_id (parent_id): 단계 출력의 부모 식별자입니다.

    • root_parent_id (parent_id): 단계 출력의 부모 식별자입니다.

    • 이미지 (image_metadata): supervision에 필요한 이미지 메타데이터가 담긴 딕셔너리입니다.

    • structured_output (dictionary): 딕셔너리.

    • raw_output (string): 문자열 값.

    • * (*): 임의의 요소와 동일한 값.

예시 JSON 정의

마지막 업데이트

도움이 되었나요?