For the complete documentation index, see llms.txt. This page is also available as Markdown.

SAM2 वीडियो ट्रैकर

SAM2 के streaming camera predictor के साथ वीडियो फ्रेम्स के across वस्तुओं को segment और track करें।

लाइव वीडियो स्ट्रीम पर Segment Anything 2 को फ्रेम-दर-फ्रेम चलाएँ, प्रति-वीडियो अस्थायी मेमोरी बनाए रखते हुए ताकि ऑब्जेक्ट पहचानों को फ्रेमों के बीच सुरक्षित रखा जा सके।

अपस्ट्रीम डिटेक्टर (जैसे YOLO ब्लॉक) से बॉक्स डिटेक्शनों को प्रॉम्प्ट्स के रूप में फीड करें। यह ब्लॉक स्थिति को कुंजीबद्ध करके एकल SAM2 कैमरा प्रेडिक्टर को कई वीडियो स्ट्रीम्स में मल्टिप्लेक्स करता है video_metadata.video_identifier; इस पर निर्भर करते हुए prompt_mode, यह या तो प्रॉम्प्ट्स को समय-समय पर पुनः-सीड करता है या बस मौजूदा ट्रैक्स को आगे बढ़ाता है।

एक स्थायी WebRTC सत्र में उपयोग के लिए अभिप्रेत, जो एक समय में एक फ्रेम देता है और प्रत्येक फ्रेम को वीडियो मेटाडेटा के साथ टैग करता है।

प्रकार पहचानकर्ता

स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/segment_anything_2_video@v1 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।

गुण

नाम

प्रकार

विवरण

संदर्भ

name

str

इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..

model_id

str

स्ट्रीमिंग वीडियो ट्रैकर मॉडल ID जिसे inference_models. यह sam2video परिवार चार Hiera बैकबोन आकारों के साथ आता है; छोटा गति और गुणवत्ता के बीच डिफ़ॉल्ट संतुलन है। sam3trackervideo SAM3 का दृश्य-प्रॉम्प्टेड ट्रैकर है - बड़े बैकबोन के साथ वही प्रॉम्प्ट अनुबंध, लंबे वीडियो और भीड़-भाड़ वाले दृश्यों में पहचान बनाए रखने में उल्लेखनीय रूप से बेहतर, लेकिन अधिक गणनात्मक लागत पर..

prompt_mode

str

कब उपभोग करें बॉक्स को SAM2 प्रॉम्प्ट्स के रूप में। first_frame प्रति सत्र एक बार प्रॉम्प्ट करता है और फिर ट्रैक करता है; every_n_frames हर prompt_interval फ्रेम; every_frame हर फ्रेम पर पुनः-सीड करता है। जिन फ्रेमों पर पुनः-सीडिंग नहीं होती, बॉक्स को अनदेखा कर दिया जाता है और ब्लॉक बस प्रसारित करता है..

prompt_interval

int

के लिए prompt_mode=every_n_frames: हर N फ्रेम पर पुनः-प्रॉम्प्ट करें..

थ्रेशहोल्ड

float

निकाले गए मास्क के लिए न्यूनतम विश्वास..

यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।

रनटाइम संगतता

सॉफ्ट - रनटाइम hosted_serverless, dedicated_deployment; निष्पादन दूरस्थ; इनपुट वीडियो : ब्लॉक प्रति-वीडियो स्थिति को प्रक्रिया मेमोरी में बनाए रखता है (video_metadata.video_identifier द्वारा कुंजीबद्ध)। स्टेटलेस या मल्टी-रिप्लिका HTTP रनटाइम्स पर दूरस्थ स्टेप निष्पादन के साथ, क्रमिक अनुरोधों को अलग-अलग वर्कर प्रक्रियाएँ सर्व कर सकती हैं, इसलिए कॉल्स के बीच स्थिति रीसेट हो जाती है और आउटपुट ट्रैकिंग / काउंटिंग / एग्रीगेशन के लिए अर्थहीन हो जाता है। स्थिर फ़्रेम-से-फ़्रेम परिणामों के लिए एक स्थायी WebRTC सत्र में स्थानीय स्टेप निष्पादन का उपयोग करें।

कठिन - रनटाइम self_hosted_cpu; निष्पादन स्थानीय : GPU की आवश्यकता है; स्ट्रीमिंग SAM2 वीडियो मॉडल को CUDA चाहिए।

सॉफ्ट - इनपुट छवि : ब्लॉक वीडियो या दोहराए गए-फ़्रेम वर्कफ़्लो से समयगत संदर्भ पर निर्भर करता है। एक स्थिर छवि/फ़ोटो के साथ, ट्रैक करने, तुलना करने, समेकित करने या दृश्यीकृत करने के लिए कोई अर्थपूर्ण इतिहास नहीं होता, इसलिए ब्लॉक बहुत कम या कोई लाभ नहीं देता।

इनपुट और आउटपुट बाइंडिंग्स

उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार SAM2 वीडियो ट्रैकर संस्करण v1 है।

इनपुट और आउटपुट बाइंडिंग्स
  • इनपुट

    • छवियाँ (छवि): जिस छवि पर अनुमान लगाना है..

    • बॉक्स (Union[object_detection_prediction, instance_segmentation_prediction, keypoint_detection_prediction]): SAM2 प्रॉम्प्ट्स के रूप में उपयोग करने के लिए बाउंडिंग बॉक्स। केवल उन फ्रेमों पर पढ़ा जाता है जहाँ ब्लॉक पुनः-प्रॉम्प्ट करता है (देखें prompt_mode)..

    • model_id (roboflow_model_id): स्ट्रीमिंग वीडियो ट्रैकर मॉडल ID जिसे inference_models. यह sam2video परिवार चार Hiera बैकबोन आकारों के साथ आता है; छोटा गति और गुणवत्ता के बीच डिफ़ॉल्ट संतुलन है। sam3trackervideo SAM3 का दृश्य-प्रॉम्प्टेड ट्रैकर है - बड़े बैकबोन के साथ वही प्रॉम्प्ट अनुबंध, लंबे वीडियो और भीड़-भाड़ वाले दृश्यों में पहचान बनाए रखने में उल्लेखनीय रूप से बेहतर, लेकिन अधिक गणनात्मक लागत पर..

    • prompt_interval (पूर्णांक): के लिए prompt_mode=every_n_frames: हर N फ्रेम पर पुनः-प्रॉम्प्ट करें..

    • थ्रेशहोल्ड (float): निकाले गए मास्क के लिए न्यूनतम विश्वास..

  • आउटपुट

    • predictions (instance_segmentation_prediction): sv.Detections(...) object के रूप में पहचाने गए bounding boxes और segmentation masks के साथ prediction।

उदाहरण JSON परिभाषा

अंतिम अपडेट

क्या यह उपयोगी था?