SAM2 वीडियो ट्रैकर
SAM2 के streaming camera predictor के साथ वीडियो फ्रेम्स के across वस्तुओं को segment और track करें।
लाइव वीडियो स्ट्रीम पर Segment Anything 2 को फ्रेम-दर-फ्रेम चलाएँ, प्रति-वीडियो अस्थायी मेमोरी बनाए रखते हुए ताकि ऑब्जेक्ट पहचानों को फ्रेमों के बीच सुरक्षित रखा जा सके।
अपस्ट्रीम डिटेक्टर (जैसे YOLO ब्लॉक) से बॉक्स डिटेक्शनों को प्रॉम्प्ट्स के रूप में फीड करें। यह ब्लॉक स्थिति को कुंजीबद्ध करके एकल SAM2 कैमरा प्रेडिक्टर को कई वीडियो स्ट्रीम्स में मल्टिप्लेक्स करता है video_metadata.video_identifier; इस पर निर्भर करते हुए prompt_mode, यह या तो प्रॉम्प्ट्स को समय-समय पर पुनः-सीड करता है या बस मौजूदा ट्रैक्स को आगे बढ़ाता है।
एक स्थायी WebRTC सत्र में उपयोग के लिए अभिप्रेत, जो एक समय में एक फ्रेम देता है और प्रत्येक फ्रेम को वीडियो मेटाडेटा के साथ टैग करता है।
प्रकार पहचानकर्ता
स्टेप में निम्नलिखित पहचानकर्ता का उपयोग करें "type" फ़ील्ड: roboflow_core/segment_anything_2_video@v1 अपने वर्कफ़्लो में ब्लॉक को एक स्टेप के रूप में जोड़ने के लिए।
गुण
नाम
प्रकार
विवरण
संदर्भ
name
str
इस स्टेप के लिए एक विशिष्ट पहचानकर्ता दर्ज करें..
❌
model_id
str
स्ट्रीमिंग वीडियो ट्रैकर मॉडल ID जिसे inference_models. यह sam2video परिवार चार Hiera बैकबोन आकारों के साथ आता है; छोटा गति और गुणवत्ता के बीच डिफ़ॉल्ट संतुलन है। sam3trackervideo SAM3 का दृश्य-प्रॉम्प्टेड ट्रैकर है - बड़े बैकबोन के साथ वही प्रॉम्प्ट अनुबंध, लंबे वीडियो और भीड़-भाड़ वाले दृश्यों में पहचान बनाए रखने में उल्लेखनीय रूप से बेहतर, लेकिन अधिक गणनात्मक लागत पर..
✅
prompt_mode
str
कब उपभोग करें बॉक्स को SAM2 प्रॉम्प्ट्स के रूप में। first_frame प्रति सत्र एक बार प्रॉम्प्ट करता है और फिर ट्रैक करता है; every_n_frames हर prompt_interval फ्रेम; every_frame हर फ्रेम पर पुनः-सीड करता है। जिन फ्रेमों पर पुनः-सीडिंग नहीं होती, बॉक्स को अनदेखा कर दिया जाता है और ब्लॉक बस प्रसारित करता है..
❌
prompt_interval
int
के लिए prompt_mode=every_n_frames: हर N फ्रेम पर पुनः-प्रॉम्प्ट करें..
✅
थ्रेशहोल्ड
float
निकाले गए मास्क के लिए न्यूनतम विश्वास..
✅
यह संदर्भ स्तंभ यह इंगित करता है कि संपत्ति को वर्कफ़्लो रनटाइम में उपलब्ध गतिशील मानों के साथ पैरामीटराइज़ किया जा सकता है वर्कफ़्लो रनटाइम। देखें बाइंडिंग्स अधिक जानकारी के लिए।
रनटाइम संगतता
सॉफ्ट - रनटाइम hosted_serverless, dedicated_deployment; निष्पादन दूरस्थ; इनपुट वीडियो : ब्लॉक प्रति-वीडियो स्थिति को प्रक्रिया मेमोरी में बनाए रखता है (video_metadata.video_identifier द्वारा कुंजीबद्ध)। स्टेटलेस या मल्टी-रिप्लिका HTTP रनटाइम्स पर दूरस्थ स्टेप निष्पादन के साथ, क्रमिक अनुरोधों को अलग-अलग वर्कर प्रक्रियाएँ सर्व कर सकती हैं, इसलिए कॉल्स के बीच स्थिति रीसेट हो जाती है और आउटपुट ट्रैकिंग / काउंटिंग / एग्रीगेशन के लिए अर्थहीन हो जाता है। स्थिर फ़्रेम-से-फ़्रेम परिणामों के लिए एक स्थायी WebRTC सत्र में स्थानीय स्टेप निष्पादन का उपयोग करें।
कठिन - रनटाइम self_hosted_cpu; निष्पादन स्थानीय : GPU की आवश्यकता है; स्ट्रीमिंग SAM2 वीडियो मॉडल को CUDA चाहिए।
सॉफ्ट - इनपुट छवि : ब्लॉक वीडियो या दोहराए गए-फ़्रेम वर्कफ़्लो से समयगत संदर्भ पर निर्भर करता है। एक स्थिर छवि/फ़ोटो के साथ, ट्रैक करने, तुलना करने, समेकित करने या दृश्यीकृत करने के लिए कोई अर्थपूर्ण इतिहास नहीं होता, इसलिए ब्लॉक बहुत कम या कोई लाभ नहीं देता।
इनपुट और आउटपुट बाइंडिंग्स
उपलब्ध कनेक्शन उसके बाइंडिंग प्रकारों पर निर्भर करते हैं। देखें कि कौन-से बाइंडिंग प्रकार SAM2 वीडियो ट्रैकर संस्करण v1 है।
इनपुट और आउटपुट बाइंडिंग्स
इनपुट
छवियाँ(छवि): जिस छवि पर अनुमान लगाना है..बॉक्स(Union[object_detection_prediction,instance_segmentation_prediction,keypoint_detection_prediction]): SAM2 प्रॉम्प्ट्स के रूप में उपयोग करने के लिए बाउंडिंग बॉक्स। केवल उन फ्रेमों पर पढ़ा जाता है जहाँ ब्लॉक पुनः-प्रॉम्प्ट करता है (देखेंprompt_mode)..model_id(roboflow_model_id): स्ट्रीमिंग वीडियो ट्रैकर मॉडल ID जिसेinference_models. यहsam2videoपरिवार चार Hiera बैकबोन आकारों के साथ आता है;छोटागति और गुणवत्ता के बीच डिफ़ॉल्ट संतुलन है।sam3trackervideoSAM3 का दृश्य-प्रॉम्प्टेड ट्रैकर है - बड़े बैकबोन के साथ वही प्रॉम्प्ट अनुबंध, लंबे वीडियो और भीड़-भाड़ वाले दृश्यों में पहचान बनाए रखने में उल्लेखनीय रूप से बेहतर, लेकिन अधिक गणनात्मक लागत पर..prompt_interval(पूर्णांक): के लिएprompt_mode=every_n_frames: हर N फ्रेम पर पुनः-प्रॉम्प्ट करें..थ्रेशहोल्ड(float): निकाले गए मास्क के लिए न्यूनतम विश्वास..
आउटपुट
predictions(instance_segmentation_prediction): sv.Detections(...) object के रूप में पहचाने गए bounding boxes और segmentation masks के साथ prediction।
अंतिम अपडेट
क्या यह उपयोगी था?