डेटासेट संस्करण बनाएं
मॉडल प्रशिक्षण में उपयोग के लिए एक डेटासेट संस्करण बनाएं।
के बारे में
एक वर्शन आपके डेटासेट का किसी निश्चित समय का स्नैपशॉट होता है। हम इन वर्शनों को इसलिए रखते हैं क्योंकि आपके मॉडल के हर इटरेशन में किन-किन इमेजों, प्रीप्रोसेसिंग, और ऑगमेंटेशन चरणों का उपयोग हुआ था, इसका सटीक रिकॉर्ड रखकर आप परिणामों को दोबारा उत्पन्न करने की क्षमता बनाए रखते हैं। इससे आप विभिन्न मॉडलों और फ्रेमवर्क्स पर वैज्ञानिक रूप से परीक्षण कर सकते हैं, और साथ ही यह भरोसा भी बना रहता है कि परिणाम मॉडल के बदलावों के कारण हैं, न कि डेटा पाइपलाइन में किसी बग/परिवर्तन के कारण।
मुख्य अवधारणाएँ: वर्कस्पेसेज़ और प्रोजेक्ट्स क्या हैं?
एक बार जब कोई वर्शन बना दिया जाता है, तो वह समय में स्थिर हो जाता है, जिसका मतलब है कि प्रोजेक्ट में किए गए बदलाव—चाहे वे इमेज जोड़ना/हटाना हों, एनोटेशन हों, या अन्य डेटा—उन वर्शनों को प्रभावित नहीं करेंगे जो पहले बनाए गए थे।
वेब ऐप
डेटासेट वर्शन कैसे बनाएं
डेटासेट वर्शन बनाने के लिए, अपने Roboflow प्रोजेक्ट से जुड़े साइडबार में "Versions" पर क्लिक करें। फिर, "Generate New Version" पर क्लिक करें।
इस पेज से, आप train/test/valid स्प्लिट सेट कर सकते हैं और अपने नए डेटासेट वर्शन के लिए प्रीप्रोसेसिंग चरण तथा ऑगमेंटेशन निर्दिष्ट कर सकते हैं।

एक बार जब आप अपने डेटा पर लागू करने के लिए इच्छित प्रीप्रोसेसिंग चरण और ऑगमेंटेशन निर्दिष्ट कर लेते हैं, तो "Generate" पर क्लिक करें। इससे एक नया डेटासेट वर्शन जनरेट होगा। फिर आप इस डेटासेट वर्शन का उपयोग Roboflow में मॉडल को प्रशिक्षित करने के लिए कर सकते हैं। आप यह भी अपने डेटासेट को एक्सपोर्ट करें ताकि उसे मैन्युअली मॉडल प्रशिक्षण में उपयोग किया जा सके।
ट्रेन/वैलिडेशन/टेस्ट स्प्लिट्स को पुनः समायोजित करना
वर्शन बनाने की प्रक्रिया के दौरान, आप अपने ट्रेनिंग, वैलिडेशन और टेस्ट सेट के विभाजन का संतुलन भी फिर से समायोजित कर सकते हैं। ऐसा करने के लिए, "Step 2: Train/Test Split" पर जाएँ और "Rebalance" बटन पर क्लिक करें।

अनुशंसित स्प्लिट 70/20/10 (train/valid/test) है, जो अधिकांश डेटासेट्स के लिए एक अच्छा शुरुआती बिंदु है। इसे कभी भी पुनर्स्थापित करने के लिए "Reset" पर क्लिक करें।
ट्रेन, वैलिडेशन, और टेस्ट प्रतिशत सेट करें, फिर चुनें कि इमेजों को कैसे पुनः असाइन किया जाए:
"Move as few as possible" इमेजों को उनके मौजूदा स्प्लिट में रखता है और केवल लक्ष्य प्रतिशत तक पहुँचने के लिए आवश्यक उतनी ही इमेजों को स्थानांतरित करता है।
"Random shuffle" प्रत्येक इमेज को स्प्लिट्स के बीच यादृच्छिक रूप से पुनः असाइन करता है।
"Random shuffle per upload batch or annotation job" हर अपलोड बैच या पूर्ण एनोटेशन जॉब को अलग-अलग शफल करता है, ताकि हर बैच और जॉब लक्ष्य प्रतिशत से मेल खाए।
आप rebalance को विशिष्ट क्लासेज़ तक भी सीमित कर सकते हैं। क्लासेज़ चुनने से मूव केवल उन इमेजों तक सीमित हो जाते हैं जिनमें सिर्फ वे क्लासेज़ हों, और विधि "Move as few as possible" पर स्विच हो जाती है।
बड़े डेटासेट्स के लिए, rebalance एक बैकग्राउंड टास्क के रूप में प्रति-चरण प्रगति के साथ चलता है। यह जारी रहते हुए आप डायलॉग बंद कर सकते हैं, और Activity Center में इसे ट्रैक कर सकते हैं।
पायथन SDK
एक वर्शन प्रीप्रोसेसिंग और ऑगमेंटेशन चरणों के चुने हुए सेट को लागू करके प्रोजेक्ट के लेबल किए गए डेटा का स्नैपशॉट स्थिर कर देता है। वर्शन के विरुद्ध ट्रेन करें, सीधे प्रोजेक्ट के विरुद्ध नहीं।
Project.generate_version() नया वर्शन नंबर लौटाता है, जिसे आप इसे पास कर सकते हैं project.version(...) ताकि आपको एक वर्शन हैंडल मिल सके।
augmentation.image.versions वर्शन आकार के लिए अधिकतम गुणक है, और आपकी योजना इसे सीमित करती है। यदि आप इसे इससे अधिक सेट करते हैं, तो जनरेशन विफल हो जाता है। देखें ऑगमेंटेशन सीमित करना.
यहाँ सेटिंग्स का एक पूरा उदाहरण है। नीचे प्रत्येक गुण के लिए विस्तृत व्याख्या दी गई है।
अंतिम अपडेट
क्या यह उपयोगी था?