For the complete documentation index, see llms.txt. This page is also available as Markdown.

Google Gemini

विज़न क्षमताओं वाले Google के Gemini मॉडल को चलाएँ।

v3

Google के विज़न क्षमताओं वाले Gemini मॉडल से एक प्रश्न पूछें।

आप मनचाहे टेक्स्ट प्रॉम्प्ट या पूर्वनिर्धारित प्रॉम्प्ट निर्दिष्ट कर सकते हैं, यह ब्लॉक निम्नलिखित प्रकार के प्रॉम्प्ट का समर्थन करता है:

  • ओपन प्रॉम्प्ट (अप्रतिबंधित) - कच्चा उत्तर जनरेट करने के लिए कोई भी प्रॉम्प्ट उपयोग करें

  • टेक्स्ट पहचान (OCR) (ocr) - मॉडल छवि में टेक्स्ट को पहचानता है

  • दृश्य प्रश्नोत्तर (visual-question-answering) - मॉडल आपके द्वारा प्रॉम्प्ट में सबमिट किए गए प्रश्न का उत्तर देता है

  • कैप्शनिंग (संक्षिप्त) (caption) - मॉडल छवि का संक्षिप्त विवरण प्रदान करता है

  • कैप्शनिंग (detailed-caption) - मॉडल छवि का विस्तृत विवरण प्रदान करता है

  • एकल-लेबल वर्गीकरण (classification) - मॉडल छवि की सामग्री को दिए गए वर्गों में से एक के रूप में वर्गीकृत करता है

  • बहु-लेबल वर्गीकरण (multi-label-classification) - मॉडल छवि की सामग्री को दिए गए वर्गों में से एक या अधिक के रूप में वर्गीकृत करता है

  • बिना प्रॉम्प्ट के ऑब्जेक्ट डिटेक्शन (object-detection) - मॉडल छवि में प्रमुख ऑब्जेक्ट्स के लिए बाउंडिंग बॉक्स का पता लगाता है और उन्हें लौटाता है

  • संरचित आउटपुट जनरेशन (structured-answering) - मॉडल निर्दिष्ट फ़ील्ड्स के साथ एक JSON प्रतिक्रिया लौटाता है

API कुंजी विकल्प

यह ब्लॉक API कुंजी के दो मोड समर्थित करता है:

  1. Roboflow प्रबंधित API कुंजी (डिफ़ॉल्ट) - उपयोग करें rf_key:account Roboflow के API के माध्यम से अनुरोधों को प्रॉक्सी करने के लिए:

    • सरल सेटअप - Google AI API कुंजी की आवश्यकता नहीं

    • सुरक्षित - प्रमाणीकरण के लिए आपकी वर्कफ़्लो API कुंजी का उपयोग किया जाता है

    • उपयोग-आधारित बिलिंग - उपयोग किए गए मॉडल के आधार पर प्रति टोकन शुल्क लगाया जाता है

  2. कस्टम Google AI API कुंजी - अपनी स्वयं की Google AI API कुंजी प्रदान करें:

    • API उपयोग पर पूर्ण नियंत्रण

    • आप सीधे Google को भुगतान करते हैं

चेतावनी!

यह ब्लॉक उपयोग करता है /v1beta Google Gemini मॉडल के API का - कार्यान्वयन भविष्य में बदल सकता है, पिछली संगतता की गारंटी के बिना।

प्रकार पहचानकर्ता

स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/google_gemini@v3 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।

गुण

नाम

प्रकार

विवरण

संदर्भ

name

str

इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..

task_type

str

मॉडल द्वारा निष्पादित किया जाने वाला कार्य प्रकार। मान आवश्यक पैरामीटर और आउटपुट प्रतिक्रिया निर्धारित करता है..

प्रॉम्प्ट

str

Gemini मॉडल के लिए पाठ प्रॉम्प्ट।

output_structure

Dict[str, str]

अपेक्षित JSON प्रतिक्रिया की संरचना वाली डिक्शनरी।

classes

List[str]

उपयोग की जाने वाली वर्गों की सूची।

api_key

str

Roboflow की प्रबंधित API कुंजी का उपयोग करने के लिए आपकी Google AI API कुंजी या 'rf_key:account'।

मॉडल संस्करण

str

उपयोग किया जाने वाला मॉडल।

thinking_level

str

Gemini 3+ मॉडलों के लिए आंतरिक तर्क की गहराई नियंत्रित करता है। 'low' विलंबता और लागत को कम करता है (सरल कार्यों के लिए सर्वोत्तम), 'high' तर्क की गहराई को अधिकतम करता है (डिफ़ॉल्ट)। केवल Gemini 3 और नए मॉडलों द्वारा समर्थित।

temperature

float

मॉडल से सैंपल करने के लिए तापमान - मान 0.0-2.0 की सीमा में, जितना अधिक होगा - जनरेशन उतनी ही अधिक यादृच्छिक / "रचनात्मक" होंगी..

max_tokens

int

मॉडल अपने उत्तर में अधिकतम कितने टोकन उत्पन्न कर सकता है। यदि निर्दिष्ट नहीं है, तो मॉडल अपनी डिफ़ॉल्ट सीमा का उपयोग करेगा।

google_code_execution

bool

Gemini मॉडल के लिए मूल (native) कोड निष्पादन सक्षम करें।

max_concurrent_requests

int

इनपुट छवियों का बैच प्रदान किए जाने पर ब्लॉक द्वारा निष्पादित की जा सकने वाली समकालिक अनुरोधों की संख्या। यदि नहीं दिया गया - तो ब्लॉक Workflows Execution Engine में वैश्विक रूप से कॉन्फ़िगर किए गए मान का उपयोग करेगा। यदि आप Google Gemini API सीमाओं तक पहुँचते हैं, तो कृपया इसे सीमित करें।

यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।

रनटाइम संगतता

requires_internet - air-gapped / offline deployments : यह ब्लॉक ऐसी सेवा पर निर्भर करता है जो पूरी तरह ऑफ़लाइन / air-gapped deployments से पहुँचा नहीं जा सकता।

इनपुट और आउटपुट बाइंडिंग्स

उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार Google Gemini संस्करण v3 है।

इनपुट और आउटपुट बाइंडिंग्स
  • इनपुट

    • छवियाँ (छवि): जिस छवि पर अनुमान लगाना है..

    • प्रॉम्प्ट (string): Gemini मॉडल के लिए पाठ प्रॉम्प्ट।

    • classes (list_of_values): उपयोग की जाने वाली वर्गों की सूची।

    • api_key (Union[ROBOFLOW_MANAGED_KEY, secret, string]): आपकी Google AI API कुंजी या Roboflow की प्रबंधित API कुंजी का उपयोग करने के लिए 'rf_key:account'।

    • मॉडल संस्करण (string): उपयोग किया जाने वाला मॉडल।

    • thinking_level (string): Gemini 3+ मॉडलों के लिए आंतरिक तर्क की गहराई नियंत्रित करता है। 'low' विलंबता और लागत को कम करता है (सरल कार्यों के लिए सर्वोत्तम), 'high' तर्क की गहराई को अधिकतम करता है (डिफ़ॉल्ट)। केवल Gemini 3 और नए मॉडलों द्वारा समर्थित।

    • temperature (float): मॉडल से सैंपल करने के लिए तापमान - मान 0.0-2.0 की सीमा में, जितना अधिक होगा - जनरेशन उतनी ही अधिक यादृच्छिक / "रचनात्मक" होंगी..

    • google_code_execution (boolean): Gemini मॉडल के लिए मूल (native) कोड निष्पादन सक्षम करें।

  • आउटपुट

    • आउटपुट (Union[string, language_model_output]): स्ट्रिंग मान यदि string या LLM / VLM आउटपुट यदि language_model_output.

    • classes (list_of_values): किसी भी प्रकार के मानों की सूची।

उदाहरण JSON परिभाषा

v2

Google के विज़न क्षमताओं वाले Gemini मॉडल से एक प्रश्न पूछें।

आप मनचाहे टेक्स्ट प्रॉम्प्ट या पूर्वनिर्धारित प्रॉम्प्ट निर्दिष्ट कर सकते हैं, यह ब्लॉक निम्नलिखित प्रकार के प्रॉम्प्ट का समर्थन करता है:

  • ओपन प्रॉम्प्ट (अप्रतिबंधित) - कच्चा उत्तर जनरेट करने के लिए कोई भी प्रॉम्प्ट उपयोग करें

  • टेक्स्ट पहचान (OCR) (ocr) - मॉडल छवि में टेक्स्ट को पहचानता है

  • दृश्य प्रश्नोत्तर (visual-question-answering) - मॉडल आपके द्वारा प्रॉम्प्ट में सबमिट किए गए प्रश्न का उत्तर देता है

  • कैप्शनिंग (संक्षिप्त) (caption) - मॉडल छवि का संक्षिप्त विवरण प्रदान करता है

  • कैप्शनिंग (detailed-caption) - मॉडल छवि का विस्तृत विवरण प्रदान करता है

  • एकल-लेबल वर्गीकरण (classification) - मॉडल छवि की सामग्री को दिए गए वर्गों में से एक के रूप में वर्गीकृत करता है

  • बहु-लेबल वर्गीकरण (multi-label-classification) - मॉडल छवि की सामग्री को दिए गए वर्गों में से एक या अधिक के रूप में वर्गीकृत करता है

  • बिना प्रॉम्प्ट के ऑब्जेक्ट डिटेक्शन (object-detection) - मॉडल छवि में प्रमुख ऑब्जेक्ट्स के लिए बाउंडिंग बॉक्स का पता लगाता है और उन्हें लौटाता है

  • संरचित आउटपुट जनरेशन (structured-answering) - मॉडल निर्दिष्ट फ़ील्ड्स के साथ एक JSON प्रतिक्रिया लौटाता है

Gemini मॉडल का उपयोग करने के लिए आपको अपनी Google AI API कुंजी प्रदान करनी होगी।

चेतावनी!

यह ब्लॉक उपयोग करता है /v1beta Google Gemini मॉडल के API का - कार्यान्वयन भविष्य में बदल सकता है, पिछली संगतता की गारंटी के बिना।

प्रकार पहचानकर्ता

स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/google_gemini@v2 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।

गुण

नाम

प्रकार

विवरण

संदर्भ

name

str

इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..

task_type

str

मॉडल द्वारा निष्पादित किया जाने वाला कार्य प्रकार। मान आवश्यक पैरामीटर और आउटपुट प्रतिक्रिया निर्धारित करता है..

प्रॉम्प्ट

str

Gemini मॉडल के लिए पाठ प्रॉम्प्ट।

output_structure

Dict[str, str]

अपेक्षित JSON प्रतिक्रिया की संरचना वाली डिक्शनरी।

classes

List[str]

उपयोग की जाने वाली वर्गों की सूची।

api_key

str

आपकी Google AI API कुंजी।

मॉडल संस्करण

str

उपयोग किया जाने वाला मॉडल।

thinking_level

str

Gemini 3+ मॉडलों के लिए आंतरिक तर्क की गहराई नियंत्रित करता है। 'low' विलंबता और लागत को कम करता है (सरल कार्यों के लिए सर्वोत्तम), 'high' तर्क की गहराई को अधिकतम करता है (डिफ़ॉल्ट)। केवल Gemini 3 और नए मॉडलों द्वारा समर्थित।

temperature

float

मॉडल से सैंपल करने के लिए तापमान - मान 0.0-2.0 की सीमा में, जितना अधिक होगा - जनरेशन उतनी ही अधिक यादृच्छिक / "रचनात्मक" होंगी..

max_tokens

int

मॉडल अपने उत्तर में अधिकतम कितने टोकन उत्पन्न कर सकता है। यदि निर्दिष्ट नहीं है, तो मॉडल अपनी डिफ़ॉल्ट सीमा का उपयोग करेगा।

max_concurrent_requests

int

इनपुट छवियों का बैच प्रदान किए जाने पर ब्लॉक द्वारा निष्पादित की जा सकने वाली समकालिक अनुरोधों की संख्या। यदि नहीं दिया गया - तो ब्लॉक Workflows Execution Engine में वैश्विक रूप से कॉन्फ़िगर किए गए मान का उपयोग करेगा। यदि आप Google Gemini API सीमाओं तक पहुँचते हैं, तो कृपया इसे सीमित करें।

यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।

रनटाइम संगतता

requires_internet - air-gapped / offline deployments : यह ब्लॉक ऐसी सेवा पर निर्भर करता है जो पूरी तरह ऑफ़लाइन / air-gapped deployments से पहुँचा नहीं जा सकता।

इनपुट और आउटपुट बाइंडिंग्स

उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार Google Gemini संस्करण v2 है।

इनपुट और आउटपुट बाइंडिंग्स
  • इनपुट

    • छवियाँ (छवि): जिस छवि पर अनुमान लगाना है..

    • प्रॉम्प्ट (string): Gemini मॉडल के लिए पाठ प्रॉम्प्ट।

    • classes (list_of_values): उपयोग की जाने वाली वर्गों की सूची।

    • api_key (Union[secret, string]): आपकी Google AI API कुंजी।

    • मॉडल संस्करण (string): उपयोग किया जाने वाला मॉडल।

    • thinking_level (string): Gemini 3+ मॉडलों के लिए आंतरिक तर्क की गहराई नियंत्रित करता है। 'low' विलंबता और लागत को कम करता है (सरल कार्यों के लिए सर्वोत्तम), 'high' तर्क की गहराई को अधिकतम करता है (डिफ़ॉल्ट)। केवल Gemini 3 और नए मॉडलों द्वारा समर्थित।

    • temperature (float): मॉडल से सैंपल करने के लिए तापमान - मान 0.0-2.0 की सीमा में, जितना अधिक होगा - जनरेशन उतनी ही अधिक यादृच्छिक / "रचनात्मक" होंगी..

  • आउटपुट

    • आउटपुट (Union[string, language_model_output]): स्ट्रिंग मान यदि string या LLM / VLM आउटपुट यदि language_model_output.

    • classes (list_of_values): किसी भी प्रकार के मानों की सूची।

उदाहरण JSON परिभाषा

v1

Google के विज़न क्षमताओं वाले Gemini मॉडल से एक प्रश्न पूछें।

आप मनचाहे टेक्स्ट प्रॉम्प्ट या पूर्वनिर्धारित प्रॉम्प्ट निर्दिष्ट कर सकते हैं, यह ब्लॉक निम्नलिखित प्रकार के प्रॉम्प्ट का समर्थन करता है:

  • ओपन प्रॉम्प्ट (अप्रतिबंधित) - कच्चा उत्तर जनरेट करने के लिए कोई भी प्रॉम्प्ट उपयोग करें

  • टेक्स्ट पहचान (OCR) (ocr) - मॉडल छवि में टेक्स्ट को पहचानता है

  • दृश्य प्रश्नोत्तर (visual-question-answering) - मॉडल आपके द्वारा प्रॉम्प्ट में सबमिट किए गए प्रश्न का उत्तर देता है

  • कैप्शनिंग (संक्षिप्त) (caption) - मॉडल छवि का संक्षिप्त विवरण प्रदान करता है

  • कैप्शनिंग (detailed-caption) - मॉडल छवि का विस्तृत विवरण प्रदान करता है

  • एकल-लेबल वर्गीकरण (classification) - मॉडल छवि की सामग्री को दिए गए वर्गों में से एक के रूप में वर्गीकृत करता है

  • बहु-लेबल वर्गीकरण (multi-label-classification) - मॉडल छवि की सामग्री को दिए गए वर्गों में से एक या अधिक के रूप में वर्गीकृत करता है

  • बिना प्रॉम्प्ट के ऑब्जेक्ट डिटेक्शन (object-detection) - मॉडल छवि में प्रमुख ऑब्जेक्ट्स के लिए बाउंडिंग बॉक्स का पता लगाता है और उन्हें लौटाता है

  • संरचित आउटपुट जनरेशन (structured-answering) - मॉडल निर्दिष्ट फ़ील्ड्स के साथ एक JSON प्रतिक्रिया लौटाता है

Gemini मॉडल का उपयोग करने के लिए आपको अपनी Google AI API कुंजी प्रदान करनी होगी।

चेतावनी!

यह ब्लॉक उपयोग करता है /v1beta Google Gemini मॉडल के API का - कार्यान्वयन भविष्य में बदल सकता है, पिछली संगतता की गारंटी के बिना।

प्रकार पहचानकर्ता

स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/google_gemini@v1 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।

गुण

नाम

प्रकार

विवरण

संदर्भ

name

str

इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..

task_type

str

मॉडल द्वारा निष्पादित किया जाने वाला कार्य प्रकार। मान आवश्यक पैरामीटर और आउटपुट प्रतिक्रिया निर्धारित करता है..

प्रॉम्प्ट

str

Gemini मॉडल के लिए पाठ प्रॉम्प्ट।

output_structure

Dict[str, str]

अपेक्षित JSON प्रतिक्रिया की संरचना वाली डिक्शनरी।

classes

List[str]

उपयोग की जाने वाली वर्गों की सूची।

api_key

str

आपकी Google AI API कुंजी।

मॉडल संस्करण

str

उपयोग किया जाने वाला मॉडल।

max_tokens

int

टोकनों की अधिकतम संख्या जो मॉडल अपनी response में जनरेट कर सकता है..

temperature

float

मॉडल से सैंपल करने के लिए तापमान - मान 0.0-2.0 की सीमा में, जितना अधिक होगा - जनरेशन उतनी ही अधिक यादृच्छिक / "रचनात्मक" होंगी..

max_concurrent_requests

int

इनपुट छवियों का बैच प्रदान किए जाने पर ब्लॉक द्वारा निष्पादित की जा सकने वाली समकालिक अनुरोधों की संख्या। यदि नहीं दिया गया - तो ब्लॉक Workflows Execution Engine में वैश्विक रूप से कॉन्फ़िगर किए गए मान का उपयोग करेगा। यदि आप Google Gemini API सीमाओं तक पहुँचते हैं, तो कृपया इसे सीमित करें।

यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।

रनटाइम संगतता

requires_internet - air-gapped / offline deployments : यह ब्लॉक ऐसी सेवा पर निर्भर करता है जो पूरी तरह ऑफ़लाइन / air-gapped deployments से पहुँचा नहीं जा सकता।

इनपुट और आउटपुट बाइंडिंग्स

उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार Google Gemini संस्करण v1 है।

इनपुट और आउटपुट बाइंडिंग्स
  • इनपुट

    • छवियाँ (छवि): जिस छवि पर अनुमान लगाना है..

    • प्रॉम्प्ट (string): Gemini मॉडल के लिए पाठ प्रॉम्प्ट।

    • classes (list_of_values): उपयोग की जाने वाली वर्गों की सूची।

    • api_key (Union[secret, string]): आपकी Google AI API कुंजी।

    • मॉडल संस्करण (string): उपयोग किया जाने वाला मॉडल।

    • temperature (float): मॉडल से सैंपल करने के लिए तापमान - मान 0.0-2.0 की सीमा में, जितना अधिक होगा - जनरेशन उतनी ही अधिक यादृच्छिक / "रचनात्मक" होंगी..

  • आउटपुट

    • आउटपुट (Union[string, language_model_output]): स्ट्रिंग मान यदि string या LLM / VLM आउटपुट यदि language_model_output.

    • classes (list_of_values): किसी भी प्रकार के मानों की सूची।

उदाहरण JSON परिभाषा

अंतिम अपडेट

क्या यह उपयोगी था?