For the complete documentation index, see llms.txt. This page is also available as Markdown.

Cosmos 3 Edge

हमारे Serverless Cloud API के माध्यम से NVIDIA के Cosmos 3 Edge विज़न-लैंग्वेज वर्ल्ड मॉडल का उपयोग करें

Cosmos 3 Edge NVIDIA का vision-language "world model" है। इसे भौतिक दृश्य समझने के लिए ट्यून किया गया है: वस्तुओं के बीच स्थानिक संबंधों पर तर्क करना, दृश्यों को सुरक्षा स्थितियों के विरुद्ध जाँचना, और यह अनुमान लगाना कि आगे क्या होने की संभावना है। यह एक छवि और एक टेक्स्ट प्रॉम्प्ट स्वीकार करता है और एक टेक्स्ट प्रतिक्रिया लौटाता है, साथ ही इसके व्यवहार को निर्देशित करने के लिए एक वैकल्पिक सिस्टम प्रॉम्प्ट भी। हम Cosmos 3 Edge को अपने सर्वरलेस क्लाउड API, समर्पित परिनियोजन, और स्व-होस्टेड Inference.

Self-hosted Cosmos 3 Edge के लिए CUDA-सक्षम GPU आवश्यक है। यह CPU पर नहीं चल सकता। इसे यहाँ चलाएँ सर्वरलेस क्लाउड API, एक समर्पित परिनियोजन GPU के साथ, या GPU-समर्थित स्व-होस्टेड Inference सर्वर।

कोड नमूना

1

अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ खोजें Roboflow API सेटिंग्स पृष्ठ और इसे अपने शेल में उपलब्ध कराएँ:

export ROBOFLOW_API_KEY="your-key-here"
2

निर्भरताएँ इंस्टॉल करें

इंस्टॉल करें Inference SDK:

pip install inference-sdk
3

मॉडल चलाएँ

यह नमूना nvidia/cosmos-3-edge मॉडल से किसी छवि के बारे में भौतिक-तर्क का प्रश्न पूछता है और प्रतिक्रिया प्रिंट करता है।

import os
import cv2
from inference_sdk import InferenceHTTPClient

image = cv2.imread("my-image.jpg")
client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="nvidia/cosmos-3-edge",
    prompt="इस दृश्य में आगे क्या होने की संभावना है?",
    max_new_tokens=128,
)
print(result["response"])

उपरोक्त कोड मॉडल की प्रतिक्रिया को टर्मिनल पर प्रिंट करता है। यहाँ नमूना छवि पर प्राप्त परिणाम है:

Cosmos 3 Edge predicting what will happen next in a street scene with a red SUV
Cosmos 3 Edge दृश्य में आगे क्या होने की संभावना है, इसका अनुमान लगाता है।

वर्कफ़्लो में उपयोग करें

Cosmos 3 Edge उपलब्ध है वर्कफ़्लोज़ में "Cosmos 3" ब्लॉक के रूप में। यह ब्लॉक एक छवि और एक वैकल्पिक टेक्स्ट प्रॉम्प्ट (डिफ़ॉल्ट "इस छवि में क्या है, इसका वर्णन करें।"), साथ ही एक वैकल्पिक सिस्टम प्रॉम्प्ट लेता है, और मॉडल की टेक्स्ट प्रतिक्रिया आउटपुट करता है। आप उस आउटपुट को पार्सिंग, फ़िल्टरिंग, या सूचनाओं के लिए डाउनस्ट्रीम ब्लॉकों में चेन कर सकते हैं।

सेट करें api_url को अपने परिनियोजन लक्ष्य से मेल खाने के लिए:

Inference (self-hosted) के साथ उपयोग करें

Cosmos 3 Edge एक Inference सर्वर पर भी चलता है जिसे आप स्वयं होस्ट करते हैं।

Cosmos image के साथ एक स्थानीय सर्वर शुरू करें:

फिर वही SDK कोड अपने सर्वर की ओर इंगित करें:

Inference Python package के साथ उपयोग करें

आप मॉडल को in-process भी चला सकते हैं Inference Python package के साथ, बिना HTTP server के। क्योंकि Cosmos निर्भरताएँ केवल -cosmos3 Docker image में ship होती हैं, इसलिए अपना script उसी image के अंदर चलाएँ। बनाएँ app.py:

फिर इसे Cosmos image के अंदर चलाएँ:

यह /tmp/model-cache mount डाउनलोड किए गए वेट्स को रन के बीच बनाए रखता है। यह वही cache directory है inference server start इस्तेमाल करता है।

अंतिम अपडेट

क्या यह उपयोगी था?