Google Gemini
시각 기능이 있는 Google의 Gemini 모델을 실행합니다.
v3
비전 기능이 있는 Google의 Gemini 모델에 질문을 하세요.
임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:
열린 프롬프트 (
제약 없음) - 어떤 프롬프트든 사용하여 원시 응답을 생성합니다텍스트 인식(OCR) (
ocr) - 모델이 이미지의 텍스트를 인식합니다시각 질의응답 (
visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다짧은 캡션 생성 (
caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다캡션 생성 (
detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다단일 레이블 분류 (
classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다다중 레이블 분류 (
multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다프롬프트 없는 객체 탐지 (
object-detection) - 모델이 이미지의 주요 객체에 대한 바운딩 박스를 탐지하여 반환합니다구조화된 출력 생성 (
structured-answering) - 모델이 지정된 필드가 포함된 JSON 응답을 반환합니다
API 키 옵션
이 블록은 두 가지 API 키 모드를 지원합니다:
Roboflow 관리형 API 키(기본값) - 사용
rf_key:account하여 Roboflow의 API를 통해 요청을 프록시합니다:간편한 설정 - Google AI API 키가 필요하지 않습니다
안전함 - 인증에는 워크플로 API 키가 사용됩니다
사용량 기반 요금제 - 사용한 모델에 따라 토큰당 요금이 부과됩니다
사용자 지정 Google AI API 키 - 직접 Google AI API 키를 제공합니다:
API 사용에 대한 완전한 제어
Google에 직접 결제합니다
경고!
이 블록은 다음을 사용합니다 /v1beta Google Gemini 모델의 API - 구현은 향후 변경될 수 있으며, 하위 호환성이 보장되지 않습니다.
유형 식별자
단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/google_gemini@v3 워크플로우에 이 블록을 단계로 추가하려면.
속성
이름
유형
설명
참조
name
str
이 단계에 대한 고유 식별자를 입력하세요..
❌
작업 유형
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
prompt
str
Gemini 모델에 대한 텍스트 프롬프트.
✅
출력 구조
Dict[str, str]
예상 JSON 응답의 구조를 담은 딕셔너리.
❌
클래스
List[str]
사용할 클래스 목록.
✅
API 키
str
귀하의 Google AI API 키 또는 Roboflow의 관리형 API 키를 사용하려면 'rf_key:account'.
✅
model_version
str
사용할 모델입니다.
✅
thinking_level
str
Gemini 3+ 모델의 내부 추론 깊이를 제어합니다. 'low'는 지연 시간과 비용을 최소화하며(간단한 작업에 가장 적합), 'high'는 추론 깊이를 최대화합니다(기본값). Gemini 3 및 최신 모델만 지원됩니다..
✅
온도
float
모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..
✅
최대 토큰 수
정수
모델이 응답에서 생성할 수 있는 최대 토큰 수입니다. 지정하지 않으면 모델의 기본 제한을 사용합니다..
❌
google_code_execution
bool
Gemini 모델에 대한 기본 코드 실행을 활성화합니다..
✅
최대 동시 요청 수
정수
입력 이미지 배치가 제공되었을 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에서 전역으로 구성된 값으로 기본 설정됩니다. Google Gemini API 제한에 걸리면 제한하세요..
❌
이 참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.
런타임 호환성
인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 Google Gemini 버전 v3 을 가지고 있는지.
입력 및 출력 바인딩
입력
이미지(이미지): 추론할 이미지입니다..prompt(string): Gemini 모델에 대한 텍스트 프롬프트.클래스(list_of_values): 사용할 클래스 목록.API 키(Union[ROBOFLOW_MANAGED_KEY,secret,string]): 귀하의 Google AI API 키 또는 Roboflow의 관리형 API 키를 사용하려면 'rf_key:account'.model_version(string): 사용할 모델입니다.thinking_level(string): Gemini 3+ 모델의 내부 추론 깊이를 제어합니다. 'low'는 지연 시간과 비용을 최소화하며(간단한 작업에 가장 적합), 'high'는 추론 깊이를 최대화합니다(기본값). Gemini 3 및 최신 모델만 지원됩니다..온도(float): 모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..google_code_execution(boolean): Gemini 모델에 대한 기본 코드 실행을 활성화합니다..
출력
클래스(list_of_values): 모든 유형의 값 목록.
v2
비전 기능이 있는 Google의 Gemini 모델에 질문을 하세요.
임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:
열린 프롬프트 (
제약 없음) - 어떤 프롬프트든 사용하여 원시 응답을 생성합니다텍스트 인식(OCR) (
ocr) - 모델이 이미지의 텍스트를 인식합니다시각 질의응답 (
visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다짧은 캡션 생성 (
caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다캡션 생성 (
detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다단일 레이블 분류 (
classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다다중 레이블 분류 (
multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다프롬프트 없는 객체 탐지 (
object-detection) - 모델이 이미지의 주요 객체에 대한 바운딩 박스를 탐지하여 반환합니다구조화된 출력 생성 (
structured-answering) - 모델이 지정된 필드가 포함된 JSON 응답을 반환합니다
Gemini 모델을 사용하려면 Google AI API 키를 제공해야 합니다.
경고!
이 블록은 다음을 사용합니다 /v1beta Google Gemini 모델의 API - 구현은 향후 변경될 수 있으며, 하위 호환성이 보장되지 않습니다.
유형 식별자
단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/google_gemini@v2 워크플로우에 이 블록을 단계로 추가하려면.
속성
이름
유형
설명
참조
name
str
이 단계에 대한 고유 식별자를 입력하세요..
❌
작업 유형
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
prompt
str
Gemini 모델에 대한 텍스트 프롬프트.
✅
출력 구조
Dict[str, str]
예상 JSON 응답의 구조를 담은 딕셔너리.
❌
클래스
List[str]
사용할 클래스 목록.
✅
API 키
str
귀하의 Google AI API 키.
✅
model_version
str
사용할 모델입니다.
✅
thinking_level
str
Gemini 3+ 모델의 내부 추론 깊이를 제어합니다. 'low'는 지연 시간과 비용을 최소화하며(간단한 작업에 가장 적합), 'high'는 추론 깊이를 최대화합니다(기본값). Gemini 3 및 최신 모델만 지원됩니다..
✅
온도
float
모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..
✅
최대 토큰 수
정수
모델이 응답에서 생성할 수 있는 최대 토큰 수입니다. 지정하지 않으면 모델의 기본 제한을 사용합니다..
❌
최대 동시 요청 수
정수
입력 이미지 배치가 제공되었을 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에서 전역으로 구성된 값으로 기본 설정됩니다. Google Gemini API 제한에 걸리면 제한하세요..
❌
이 참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.
런타임 호환성
인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 Google Gemini 버전 v2 을 가지고 있는지.
입력 및 출력 바인딩
입력
이미지(이미지): 추론할 이미지입니다..prompt(string): Gemini 모델에 대한 텍스트 프롬프트.클래스(list_of_values): 사용할 클래스 목록.model_version(string): 사용할 모델입니다.thinking_level(string): Gemini 3+ 모델의 내부 추론 깊이를 제어합니다. 'low'는 지연 시간과 비용을 최소화하며(간단한 작업에 가장 적합), 'high'는 추론 깊이를 최대화합니다(기본값). Gemini 3 및 최신 모델만 지원됩니다..온도(float): 모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..
출력
클래스(list_of_values): 모든 유형의 값 목록.
v1
비전 기능이 있는 Google의 Gemini 모델에 질문을 하세요.
임의의 텍스트 프롬프트나 미리 정의된 프롬프트를 지정할 수 있으며, 이 블록은 다음 유형의 프롬프트를 지원합니다:
열린 프롬프트 (
제약 없음) - 어떤 프롬프트든 사용하여 원시 응답을 생성합니다텍스트 인식(OCR) (
ocr) - 모델이 이미지의 텍스트를 인식합니다시각 질의응답 (
visual-question-answering) - 모델이 프롬프트에 제출한 질문에 답합니다짧은 캡션 생성 (
caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다캡션 생성 (
detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다단일 레이블 분류 (
classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나로 분류합니다다중 레이블 분류 (
multi-label-classification) - 모델이 이미지 콘텐츠를 제공된 클래스 중 하나 이상으로 분류합니다프롬프트 없는 객체 탐지 (
object-detection) - 모델이 이미지의 주요 객체에 대한 바운딩 박스를 탐지하여 반환합니다구조화된 출력 생성 (
structured-answering) - 모델이 지정된 필드가 포함된 JSON 응답을 반환합니다
Gemini 모델을 사용하려면 Google AI API 키를 제공해야 합니다.
경고!
이 블록은 다음을 사용합니다 /v1beta Google Gemini 모델의 API - 구현은 향후 변경될 수 있으며, 하위 호환성이 보장되지 않습니다.
유형 식별자
단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/google_gemini@v1 워크플로우에 이 블록을 단계로 추가하려면.
속성
이름
유형
설명
참조
name
str
이 단계에 대한 고유 식별자를 입력하세요..
❌
작업 유형
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
prompt
str
Gemini 모델에 대한 텍스트 프롬프트.
✅
출력 구조
Dict[str, str]
예상 JSON 응답의 구조를 담은 딕셔너리.
❌
클래스
List[str]
사용할 클래스 목록.
✅
API 키
str
귀하의 Google AI API 키.
✅
model_version
str
사용할 모델입니다.
✅
최대 토큰 수
정수
모델이 응답에서 생성할 수 있는 최대 토큰 수입니다..
❌
온도
float
모델에서 샘플링할 온도 - 0.0~2.0 범위의 값이며, 값이 높을수록 생성 결과가 더 무작위적 / "창의적"이 됩니다..
✅
최대 동시 요청 수
정수
입력 이미지 배치가 제공되었을 때 블록이 실행할 수 있는 동시 요청 수입니다. 지정하지 않으면 블록은 Workflows Execution Engine에서 전역으로 구성된 값으로 기본 설정됩니다. Google Gemini API 제한에 걸리면 제한하세요..
❌
이 참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.
런타임 호환성
인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 Google Gemini 버전 v1 을 가지고 있는지.
입력 및 출력 바인딩
출력
클래스(list_of_values): 모든 유형의 값 목록.
마지막 업데이트
도움이 되었나요?