OpenAI
비전 기능이 있는 OpenAI의 GPT 모델을 실행합니다.
v5
비전 기능을 갖춘 OpenAI의 GPT 모델(GPT-5 및 GPT-4o 포함)에 질문하세요.
임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:
자유 프롬프트 (
제약 없음) - 원하는 프롬프트를 사용하여 원시 응답을 생성합니다텍스트 인식(OCR) (
ocr) - 모델이 이미지 내 텍스트를 인식합니다시각적 질의응답 (
visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다짧은 캡션 생성 (
caption) - 모델이 이미지의 짧은 설명을 제공합니다캡션 생성 (
detailed-caption) - 모델이 이미지의 긴 설명을 제공합니다단일 레이블 분류 (
classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다다중 레이블 분류 (
multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다프롬프트 없는 객체 탐지 (
object-detection) - 모델이 이미지에서 두드러진 객체를 탐지하고 경계 상자를 반환합니다구조화된 출력 생성 (
structured-answering) - 모델이 지정된 필드를 포함한 JSON 응답을 반환합니다
이 object-detection 작업은 대규모 벤치마크에서 선택된 모델별 프롬프트 계약을 사용합니다 - 사용 roboflow_core/vlm_as_detector@v2 출력 중 어떤 것이든 예측으로 변환하려면:
대부분의 모델(GPT-5.2 및 그 이후 버전, 그리고 알 수 없는/향후 모델)은 반환합니다
{"detections": [...]}와box_2d형식의 박스를[x_min, y_min, x_max, y_max]형식(업로드된 이미지의 절대 픽셀 좌표)과레이블키를 반환하며, 이는 구조화된 출력을 통해 강제됩니다.GPT-5.1/GPT-5 생성 모델은 기존의 정규화된 딕셔너리(
x_min/y_min/x_max/y_max0.0-1.0 범위의class_name및confidence).GPT-4.x/GPT-4o 및 nano 계열 모델은 절대 픽셀 좌표의 일반 JSON 목록을 반환합니다.
box_2d항목.
절대 좌표 형식은 신뢰도 점수를 제공하지 않습니다. roboflow_core/vlm_as_detector@v2 이 탐지 결과에 신뢰도 점수를 1.0, 따라서 후속 신뢰도 필터링은 이러한 형식에서는 의미가 없습니다.
이미지는 가장 긴 변이 2048px를 넘지 않도록 축소되며, 이 작업에서는 무손실 PNG로 전송됩니다.
OpenAI API 키를 제공하거나 값을 rf_key:account (또는 rf_key:user:<id>)로 설정하여 Roboflow의 API를 통해 요청을 프록시하세요.
유형 식별자
다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v5 워크플로에 블록을 단계로 추가합니다.
속성
이름
유형
설명
참조
name
str
이 단계의 고유 식별자를 입력하세요..
❌
task_type
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
prompt
str
OpenAI 모델에 전달할 텍스트 프롬프트입니다.
✅
output_structure
Dict[str, str]
예상 JSON 응답의 구조를 담은 딕셔너리입니다.
❌
classes
List[str]
사용할 클래스 목록입니다.
✅
api_key
str
귀하의 OpenAI API 키입니다.
✅
model_version
str
사용할 모델입니다.
✅
reasoning_effort
str
추론을 제어합니다. 값을 낮추면 더 빠른 응답과 더 적은 토큰을 얻을 수 있습니다. GPT-5.1 이상 모델은 기본값이 'none'(추론 없음)이며 'none', 'low', 'medium', 'high'를 지원합니다. GPT-5.2는 'xhigh'도 지원합니다. GPT-5 모델은 기본값이 'medium'이며 'minimal', 'low', 'medium', 'high'를 지원합니다..
✅
image_detail
str
이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다. 다음에는 적용되지 않습니다. object-detection 작업에는 적용되지 않으며, 이 작업은 항상 detail 힌트 없이 이미지를 전송합니다..
✅
max_tokens
int
모델이 응답에서 생성할 수 있는 최대 토큰 수입니다. 지정하지 않으면 모델의 기본 제한을 사용합니다. 최소값은 16입니다..
❌
temperature
float
모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..
✅
max_concurrent_requests
int
입력 이미지 배치가 제공될 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에 전역 구성된 값으로 기본 설정됩니다. OpenAI 제한에 걸리면 이 값을 제한하세요..
❌
이 참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.
런타임 호환성
requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v5 에서
입력 및 출력 바인딩
입력
이미지(이미지): 추론할 이미지입니다..prompt(string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.classes(list_of_values): 사용할 클래스 목록입니다.api_key(Union[ROBOFLOW_MANAGED_KEY,secret,string]): 귀하의 OpenAI API 키입니다.model_version(string): 사용할 모델입니다.reasoning_effort(string): 추론을 제어합니다. 값을 낮추면 더 빠른 응답과 더 적은 토큰을 얻을 수 있습니다. GPT-5.1 이상 모델은 기본값이 'none'(추론 없음)이며 'none', 'low', 'medium', 'high'를 지원합니다. GPT-5.2는 'xhigh'도 지원합니다. GPT-5 모델은 기본값이 'medium'이며 'minimal', 'low', 'medium', 'high'를 지원합니다..image_detail(string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다. 다음에는 적용되지 않습니다.object-detection작업에는 적용되지 않으며, 이 작업은 항상 detail 힌트 없이 이미지를 전송합니다..temperature(float): 모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..
출력
출력(Union[string,language_model_output]): 문자열 값, 만약string또는 LLM / VLM 출력, 만약language_model_output.classes(list_of_values): 모든 유형의 값 목록.
v4
비전 기능을 갖춘 OpenAI의 GPT 모델(GPT-5 및 GPT-4o 포함)에 질문하세요.
임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:
자유 프롬프트 (
제약 없음) - 원하는 프롬프트를 사용하여 원시 응답을 생성합니다텍스트 인식(OCR) (
ocr) - 모델이 이미지 내 텍스트를 인식합니다시각적 질의응답 (
visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다짧은 캡션 생성 (
caption) - 모델이 이미지의 짧은 설명을 제공합니다캡션 생성 (
detailed-caption) - 모델이 이미지의 긴 설명을 제공합니다단일 레이블 분류 (
classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다다중 레이블 분류 (
multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다프롬프트 없는 객체 탐지 (
object-detection) - 모델이 이미지에서 두드러진 객체를 탐지하고 경계 상자를 반환합니다구조화된 출력 생성 (
structured-answering) - 모델이 지정된 필드를 포함한 JSON 응답을 반환합니다
OpenAI API 키를 제공하거나 값을 rf_key:account (또는 rf_key:user:<id>)로 설정하여 Roboflow의 API를 통해 요청을 프록시하세요.
유형 식별자
다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v4 워크플로에 블록을 단계로 추가합니다.
속성
이름
유형
설명
참조
name
str
이 단계의 고유 식별자를 입력하세요..
❌
task_type
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
prompt
str
OpenAI 모델에 전달할 텍스트 프롬프트입니다.
✅
output_structure
Dict[str, str]
예상 JSON 응답의 구조를 담은 딕셔너리입니다.
❌
classes
List[str]
사용할 클래스 목록입니다.
✅
api_key
str
귀하의 OpenAI API 키입니다.
✅
model_version
str
사용할 모델입니다.
✅
reasoning_effort
str
추론을 제어합니다. 값을 낮추면 더 빠른 응답과 더 적은 토큰을 얻을 수 있습니다. GPT-5.1 이상 모델은 기본값이 'none'(추론 없음)이며 'none', 'low', 'medium', 'high'를 지원합니다. GPT-5.2는 'xhigh'도 지원합니다. GPT-5 모델은 기본값이 'medium'이며 'minimal', 'low', 'medium', 'high'를 지원합니다..
✅
image_detail
str
이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..
✅
max_tokens
int
모델이 응답에서 생성할 수 있는 최대 토큰 수입니다. 지정하지 않으면 모델의 기본 제한을 사용합니다. 최소값은 16입니다..
❌
temperature
float
모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..
✅
max_concurrent_requests
int
입력 이미지 배치가 제공될 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에 전역 구성된 값으로 기본 설정됩니다. OpenAI 제한에 걸리면 이 값을 제한하세요..
❌
이 참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.
런타임 호환성
requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v4 에서
입력 및 출력 바인딩
입력
이미지(이미지): 추론할 이미지입니다..prompt(string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.classes(list_of_values): 사용할 클래스 목록입니다.api_key(Union[ROBOFLOW_MANAGED_KEY,secret,string]): 귀하의 OpenAI API 키입니다.model_version(string): 사용할 모델입니다.reasoning_effort(string): 추론을 제어합니다. 값을 낮추면 더 빠른 응답과 더 적은 토큰을 얻을 수 있습니다. GPT-5.1 이상 모델은 기본값이 'none'(추론 없음)이며 'none', 'low', 'medium', 'high'를 지원합니다. GPT-5.2는 'xhigh'도 지원합니다. GPT-5 모델은 기본값이 'medium'이며 'minimal', 'low', 'medium', 'high'를 지원합니다..image_detail(string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..temperature(float): 모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..
출력
출력(Union[string,language_model_output]): 문자열 값, 만약string또는 LLM / VLM 출력, 만약language_model_output.classes(list_of_values): 모든 유형의 값 목록.
v3
비전 기능을 갖춘 OpenAI의 GPT 모델(GPT-5 및 GPT-4o 포함)에 질문하세요.
임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:
자유 프롬프트 (
제약 없음) - 원하는 프롬프트를 사용하여 원시 응답을 생성합니다텍스트 인식(OCR) (
ocr) - 모델이 이미지 내 텍스트를 인식합니다시각적 질의응답 (
visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다짧은 캡션 생성 (
caption) - 모델이 이미지의 짧은 설명을 제공합니다캡션 생성 (
detailed-caption) - 모델이 이미지의 긴 설명을 제공합니다단일 레이블 분류 (
classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다다중 레이블 분류 (
multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다구조화된 출력 생성 (
structured-answering) - 모델이 지정된 필드를 포함한 JSON 응답을 반환합니다
OpenAI API 키를 제공하거나 값을 rf_key:account (또는 rf_key:user:<id>)로 설정하여 Roboflow의 API를 통해 요청을 프록시하세요.
유형 식별자
다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v3 워크플로에 블록을 단계로 추가합니다.
속성
이름
유형
설명
참조
name
str
이 단계의 고유 식별자를 입력하세요..
❌
task_type
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
prompt
str
OpenAI 모델에 전달할 텍스트 프롬프트입니다.
✅
output_structure
Dict[str, str]
예상 JSON 응답의 구조를 담은 딕셔너리입니다.
❌
classes
List[str]
사용할 클래스 목록입니다.
✅
api_key
str
귀하의 OpenAI API 키입니다.
✅
model_version
str
사용할 모델입니다.
✅
image_detail
str
이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..
✅
max_tokens
int
모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..
❌
temperature
float
모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..
✅
max_concurrent_requests
int
입력 이미지 배치가 제공될 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에 전역 구성된 값으로 기본 설정됩니다. OpenAI 제한에 걸리면 이 값을 제한하세요..
❌
이 참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.
런타임 호환성
requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v3 에서
입력 및 출력 바인딩
입력
이미지(이미지): 추론할 이미지입니다..prompt(string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.classes(list_of_values): 사용할 클래스 목록입니다.api_key(Union[ROBOFLOW_MANAGED_KEY,secret,string]): 귀하의 OpenAI API 키입니다.model_version(string): 사용할 모델입니다.image_detail(string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..temperature(float): 모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..
출력
출력(Union[string,language_model_output]): 문자열 값, 만약string또는 LLM / VLM 출력, 만약language_model_output.classes(list_of_values): 모든 유형의 값 목록.
v2
비전 기능을 갖춘 OpenAI의 GPT 모델(GPT-4o 및 GPT-5 포함)에 질문하세요.
임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:
자유 프롬프트 (
제약 없음) - 원하는 프롬프트를 사용하여 원시 응답을 생성합니다텍스트 인식(OCR) (
ocr) - 모델이 이미지 내 텍스트를 인식합니다시각적 질의응답 (
visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다짧은 캡션 생성 (
caption) - 모델이 이미지의 짧은 설명을 제공합니다캡션 생성 (
detailed-caption) - 모델이 이미지의 긴 설명을 제공합니다단일 레이블 분류 (
classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다다중 레이블 분류 (
multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다구조화된 출력 생성 (
structured-answering) - 모델이 지정된 필드를 포함한 JSON 응답을 반환합니다
Vision이 포함된 GPT-4 모델을 사용하려면 OpenAI API 키를 제공해야 합니다.
유형 식별자
다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v2 워크플로에 블록을 단계로 추가합니다.
속성
이름
유형
설명
참조
name
str
이 단계의 고유 식별자를 입력하세요..
❌
task_type
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
prompt
str
OpenAI 모델에 전달할 텍스트 프롬프트입니다.
✅
output_structure
Dict[str, str]
예상 JSON 응답의 구조를 담은 딕셔너리입니다.
❌
classes
List[str]
사용할 클래스 목록입니다.
✅
api_key
str
귀하의 OpenAI API 키입니다.
✅
model_version
str
사용할 모델입니다.
✅
image_detail
str
이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..
✅
max_tokens
int
모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..
❌
temperature
float
모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..
✅
max_concurrent_requests
int
입력 이미지 배치가 제공될 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에 전역 구성된 값으로 기본 설정됩니다. OpenAI 제한에 걸리면 이 값을 제한하세요..
❌
이 참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.
런타임 호환성
requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v2 에서
입력 및 출력 바인딩
입력
이미지(이미지): 추론할 이미지입니다..prompt(string): OpenAI 모델에 전달할 텍스트 프롬프트입니다.classes(list_of_values): 사용할 클래스 목록입니다.model_version(string): 사용할 모델입니다.image_detail(string): 이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..temperature(float): 모델에서 샘플링할 때의 온도 값입니다. 범위는 0.0-2.0이며, 값이 높을수록 생성 결과는 더 무작위적이며 / "창의적"입니다..
출력
출력(Union[string,language_model_output]): 문자열 값, 만약string또는 LLM / VLM 출력, 만약language_model_output.classes(list_of_values): 모든 유형의 값 목록.
v1
Vision 모델이 포함된 OpenAI의 GPT-4에 질문하세요.
OpenAIBlock에 임의의 텍스트 프롬프트를 지정할 수 있습니다.
Vision이 포함된 GPT-4 모델을 사용하려면 OpenAI API 키를 제공해야 합니다.
이 모델은 이전에 LMM 블록의 일부였습니다.
유형 식별자
다음 식별자를 단계의 "type" 필드에 사용하세요: roboflow_core/open_ai@v1 워크플로에 블록을 단계로 추가합니다.
속성
이름
유형
설명
참조
name
str
이 단계의 고유 식별자를 입력하세요..
❌
prompt
str
OpenAI 모델에 전달할 텍스트 프롬프트입니다.
✅
openai_api_key
str
귀하의 OpenAI API 키입니다.
✅
openai_model
str
사용할 모델입니다.
✅
json_output_format
Dict[str, str]
요청된 출력 필드의 이름을 해당 설명에 매핑하는 딕셔너리를 보관합니다.
❌
image_detail
str
이미지의 품질을 나타내며, 'high'는 고해상도이며 높은 충실도로 처리하거나 표시해야 함을 의미합니다..
✅
max_tokens
int
모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..
❌
이 참조 열은 workflow 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다. 자세한 내용은 workflow 런타임을 참조하세요. 자세한 내용은 Bindings 을 참조하세요.
런타임 호환성
requires_internet - 에어갭/오프라인 배포: 이 블록은 완전히 오프라인/에어갭 배포에서는 접근할 수 없는 서비스에 의존합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 종류에 따라 달라집니다. OpenAI 버전이 어떤 바인딩 종류를 가지는지 확인하세요. OpenAI 버전 v1 에서
입력 및 출력 바인딩
출력
parent_id(parent_id): 단계 출력의 부모 식별자입니다.root_parent_id(parent_id): 단계 출력의 부모 식별자입니다.이미지(image_metadata): supervision에 필요한 이미지 메타데이터가 담긴 딕셔너리입니다.structured_output(dictionary): 딕셔너리.raw_output(string): 문자열 값.*(*): 임의의 요소와 동일한 값.
마지막 업데이트
도움이 되었나요?