For the complete documentation index, see llms.txt. This page is also available as Markdown.

Google Gemini

시각 기능이 있는 Google의 Gemini 모델을 실행합니다.

v3

비전 기능이 있는 Google의 Gemini 모델에 질문을 하세요.

임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:

  • 열린 프롬프트 (제약 없음) - 어떤 프롬프트든 사용하여 원시 응답을 생성합니다

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지의 텍스트를 인식합니다

  • 시각 질의응답 (visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다

  • 짧은 캡션 생성 (caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다

  • 캡션 생성 (detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다

  • 단일 레이블 분류 (classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다

  • 다중 레이블 분류 (multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다

  • 프롬프트 없는 객체 탐지 (object-detection) - 모델이 이미지의 주요 객체에 대한 바운딩 박스를 탐지하여 반환합니다

  • 구조화된 출력 생성 (structured-answering) - 모델이 지정된 필드가 포함된 JSON 응답을 반환합니다

API 키 옵션

이 블록은 두 가지 API 키 모드를 지원합니다:

  1. Roboflow 관리형 API 키(기본값) - 사용 rf_key:account 하여 Roboflow의 API를 통해 요청을 프록시합니다:

    • 간편한 설정 - Google AI API 키가 필요하지 않습니다

    • 안전함 - 인증에는 워크플로 API 키가 사용됩니다

    • 사용량 기반 요금제 - 사용한 모델에 따라 토큰당 요금이 부과됩니다

  2. 사용자 지정 Google AI API 키 - 직접 Google AI API 키를 제공합니다:

    • API 사용에 대한 완전한 제어

    • Google에 직접 결제합니다

경고!

이 블록은 다음을 사용합니다 /v1beta Google Gemini 모델의 API - 구현은 향후 변경될 수 있으며, 하위 호환성이 보장되지 않습니다.

유형 식별자

단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/google_gemini@v3 워크플로우에 이 블록을 단계로 추가하려면.

속성

이름

유형

설명

참조

name

str

이 단계에 대한 고유 식별자를 입력하세요..

작업 유형

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

prompt

str

Gemini 모델에 대한 텍스트 프롬프트.

출력 구조

Dict[str, str]

예상 JSON 응답의 구조를 담은 딕셔너리.

클래스

List[str]

사용할 클래스 목록.

API 키

str

귀하의 Google AI API 키 또는 Roboflow의 관리형 API 키를 사용하려면 'rf_key:account'.

model_version

str

사용할 모델입니다.

thinking_level

str

Gemini 3+ 모델의 내부 추론 깊이를 제어합니다. 'low'는 지연 시간과 비용을 최소화하며(간단한 작업에 가장 적합), 'high'는 추론 깊이를 최대화합니다(기본값). Gemini 3 및 최신 모델만 지원됩니다..

온도

float

모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..

최대 토큰 수

정수

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다. 지정하지 않으면 모델의 기본 제한을 사용합니다..

google_code_execution

bool

Gemini 모델에 대한 기본 코드 실행을 활성화합니다..

최대 동시 요청 수

정수

입력 이미지 배치가 제공되었을 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에서 전역으로 구성된 값으로 기본 설정됩니다. Google Gemini API 제한에 걸리면 제한하세요..

참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.

런타임 호환성

인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 Google Gemini 버전 v3 을 가지고 있는지.

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): Gemini 모델에 대한 텍스트 프롬프트.

    • 클래스 (list_of_values): 사용할 클래스 목록.

    • API 키 (Union[ROBOFLOW_MANAGED_KEY, secret, string]): 귀하의 Google AI API 키 또는 Roboflow의 관리형 API 키를 사용하려면 'rf_key:account'.

    • model_version (string): 사용할 모델입니다.

    • thinking_level (string): Gemini 3+ 모델의 내부 추론 깊이를 제어합니다. 'low'는 지연 시간과 비용을 최소화하며(간단한 작업에 가장 적합), 'high'는 추론 깊이를 최대화합니다(기본값). Gemini 3 및 최신 모델만 지원됩니다..

    • 온도 (float): 모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..

    • google_code_execution (boolean): Gemini 모델에 대한 기본 코드 실행을 활성화합니다..

  • 출력

예시 JSON 정의

v2

비전 기능이 있는 Google의 Gemini 모델에 질문을 하세요.

임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:

  • 열린 프롬프트 (제약 없음) - 어떤 프롬프트든 사용하여 원시 응답을 생성합니다

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지의 텍스트를 인식합니다

  • 시각 질의응답 (visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다

  • 짧은 캡션 생성 (caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다

  • 캡션 생성 (detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다

  • 단일 레이블 분류 (classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다

  • 다중 레이블 분류 (multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다

  • 프롬프트 없는 객체 탐지 (object-detection) - 모델이 이미지의 주요 객체에 대한 바운딩 박스를 탐지하여 반환합니다

  • 구조화된 출력 생성 (structured-answering) - 모델이 지정된 필드가 포함된 JSON 응답을 반환합니다

Gemini 모델을 사용하려면 Google AI API 키를 제공해야 합니다.

경고!

이 블록은 다음을 사용합니다 /v1beta Google Gemini 모델의 API - 구현은 향후 변경될 수 있으며, 하위 호환성이 보장되지 않습니다.

유형 식별자

단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/google_gemini@v2 워크플로우에 이 블록을 단계로 추가하려면.

속성

이름

유형

설명

참조

name

str

이 단계에 대한 고유 식별자를 입력하세요..

작업 유형

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

prompt

str

Gemini 모델에 대한 텍스트 프롬프트.

출력 구조

Dict[str, str]

예상 JSON 응답의 구조를 담은 딕셔너리.

클래스

List[str]

사용할 클래스 목록.

API 키

str

귀하의 Google AI API 키.

model_version

str

사용할 모델입니다.

thinking_level

str

Gemini 3+ 모델의 내부 추론 깊이를 제어합니다. 'low'는 지연 시간과 비용을 최소화하며(간단한 작업에 가장 적합), 'high'는 추론 깊이를 최대화합니다(기본값). Gemini 3 및 최신 모델만 지원됩니다..

온도

float

모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..

최대 토큰 수

정수

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다. 지정하지 않으면 모델의 기본 제한을 사용합니다..

최대 동시 요청 수

정수

입력 이미지 배치가 제공되었을 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에서 전역으로 구성된 값으로 기본 설정됩니다. Google Gemini API 제한에 걸리면 제한하세요..

참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.

런타임 호환성

인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 Google Gemini 버전 v2 을 가지고 있는지.

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): Gemini 모델에 대한 텍스트 프롬프트.

    • 클래스 (list_of_values): 사용할 클래스 목록.

    • API 키 (Union[secret, string]): 귀하의 Google AI API 키.

    • model_version (string): 사용할 모델입니다.

    • thinking_level (string): Gemini 3+ 모델의 내부 추론 깊이를 제어합니다. 'low'는 지연 시간과 비용을 최소화하며(간단한 작업에 가장 적합), 'high'는 추론 깊이를 최대화합니다(기본값). Gemini 3 및 최신 모델만 지원됩니다..

    • 온도 (float): 모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..

  • 출력

예시 JSON 정의

v1

비전 기능이 있는 Google의 Gemini 모델에 질문을 하세요.

임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:

  • 열린 프롬프트 (제약 없음) - 어떤 프롬프트든 사용하여 원시 응답을 생성합니다

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지의 텍스트를 인식합니다

  • 시각 질의응답 (visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다

  • 짧은 캡션 생성 (caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다

  • 캡션 생성 (detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다

  • 단일 레이블 분류 (classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다

  • 다중 레이블 분류 (multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다

  • 프롬프트 없는 객체 탐지 (object-detection) - 모델이 이미지의 주요 객체에 대한 바운딩 박스를 탐지하여 반환합니다

  • 구조화된 출력 생성 (structured-answering) - 모델이 지정된 필드가 포함된 JSON 응답을 반환합니다

Gemini 모델을 사용하려면 Google AI API 키를 제공해야 합니다.

경고!

이 블록은 다음을 사용합니다 /v1beta Google Gemini 모델의 API - 구현은 향후 변경될 수 있으며, 하위 호환성이 보장되지 않습니다.

유형 식별자

단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/google_gemini@v1 워크플로우에 이 블록을 단계로 추가하려면.

속성

이름

유형

설명

참조

name

str

이 단계에 대한 고유 식별자를 입력하세요..

작업 유형

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

prompt

str

Gemini 모델에 대한 텍스트 프롬프트.

출력 구조

Dict[str, str]

예상 JSON 응답의 구조를 담은 딕셔너리.

클래스

List[str]

사용할 클래스 목록.

API 키

str

귀하의 Google AI API 키.

model_version

str

사용할 모델입니다.

최대 토큰 수

정수

모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..

온도

float

모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..

최대 동시 요청 수

정수

입력 이미지 배치가 제공되었을 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에서 전역으로 구성된 값으로 기본 설정됩니다. Google Gemini API 제한에 걸리면 제한하세요..

참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.

런타임 호환성

인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 Google Gemini 버전 v1 을 가지고 있는지.

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): Gemini 모델에 대한 텍스트 프롬프트.

    • 클래스 (list_of_values): 사용할 클래스 목록.

    • API 키 (Union[secret, string]): 귀하의 Google AI API 키.

    • model_version (string): 사용할 모델입니다.

    • 온도 (float): 모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..

  • 출력

예시 JSON 정의

마지막 업데이트

도움이 되었나요?