For the complete documentation index, see llms.txt. This page is also available as Markdown.

PaliGemma 2

हमारे Serverless Cloud API के माध्यम से Google के PaliGemma 2 विज़न-लैंग्वेज मॉडल का उपयोग करें

PaliGemma 2 गूगल का विज़न-लैंग्वेज मॉडल है। यह एक छवि और एक टेक्स्ट प्रॉम्प्ट स्वीकार करता है और एक टेक्स्ट प्रतिक्रिया लौटाता है। हम PaliGemma 2 को अपने सर्वरलेस क्लाउड API, समर्पित डिप्लॉयमेंट्स , और स्व-होस्टेड इनफ़ेरेंस.

कोड उदाहरण

1

अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ खोजें Roboflow API सेटिंग्स पेज और इसे अपने शेल में उपलब्ध कराएँ:

export ROBOFLOW_API_KEY="your-key-here"
2

निर्भरताओं को इंस्टॉल करें

इंस्टॉल करें Inference SDK:

pip install -U inference-sdk supervision
3

मॉडल चलाएँ

नमूना प्रीट्रेंड paligemma2-3b-pt-224 चेकपॉइंट को एक कैप्शन प्रॉम्प्ट के साथ कॉल करता है।

import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="paligemma2-3b-pt-224",
    prompt="caption en",
    max_new_tokens=64,
)
print(result["response"])

ऊपर दिया गया कोड मॉडल की प्रतिक्रिया को टर्मिनल पर प्रिंट करता है:

यहाँ एक कुत्ता एक आदमी के कंधे पर दिखाई दे रहा है

इन्फरेंस गति

लेटेंसी मापी गई Roboflow Inference 1x NVIDIA L4 पर, बैच साइज़ 1 के साथ, एक निश्चित प्रॉम्प्ट से greedy decoding का उपयोग करके ठीक 128 टोकन जनरेट करते हुए। लेटेंसी आउटपुट लंबाई के साथ स्केल होती है, इसलिए अन्य लंबाइयों का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

उपनाम
लेटेंसी, 128 टोकन (मि.से.)
टोकन/सेकंड

paligemma2-3b-pt-224

3986

32

सेट करें api_url अपने डिप्लॉयमेंट लक्ष्य से मेल कराने के लिए:

आप Roboflow पर अपना खुद का PaliGemma 2 चेकपॉइंट ट्रेन कर सकते हैं और इसे उसके प्रति-मॉडल {workspace}/{model-slug} ID में बदलें (देखें संस्करण, प्रशिक्षण और मॉडल ) द्वारा कॉल कर सकते हैं। देखें इनफ़ेरेंस दस्तावेज़ीकरण अतिरिक्त प्रॉम्प्ट फ़ॉर्मैट और समर्थित चेकपॉइंट्स के लिए।

PaliGemma 1 (लेगेसी)

मूल PaliGemma रिलीज़ अभी भी inference पैकेज के माध्यम से अपने हार्डवेयर पर लोड की जा सकती है। नई परियोजनाओं को ऊपर दिया गया PaliGemma 2 उपयोग करना चाहिए; यह अनुभाग मौजूदा इंटीग्रेशन्स के लिए रखा गया है।

पैकेज इंस्टॉल करें:

का उपयोग करें inference-gpu[transformers] एक GPU मशीन पर।

विज़ुअल प्रश्न-उत्तर

ऑब्जेक्ट डिटेक्शन

PaliGemma डिटेक्शन्स को <loc####> टोकन के रूप में आउटपुट करता है, JSON के बजाय, इसलिए दृश्यांकन से पहले प्रतिक्रिया को पार्स करना होगा। इस प्रकार प्रॉम्प्ट करें detect <class>; <class> और टोकनों को बॉक्स में डिकोड करें:

परिणामस्वरूप प्राप्त sv.Detections को supervision बॉक्स बनाने के लिए annotators को पास करें।

अंतिम अपडेट

क्या यह उपयोगी था?