पॉलिसी ट्रेनिंग
AY-Robots मैनेज्ड GPU पर मैनिपुलेशन पॉलिसी ट्रेन करता है, ताकि आप ट्रेनिंग हार्डवेयर के मालिक बने बिना रिकॉर्ड किए गए एपिसोड से अपनी आर्म पर चलने वाली पॉलिसी तक पहुंच सकें। यह पेज समर्थित पॉलिसी प्रकार, ट्रेनिंग रन पेज, चेकपॉइंट, और आपके एपिसोड काउंट से यथार्थवादी रूप से किन नतीजों की उम्मीद करनी चाहिए, इसे कवर करता है।
अंतिम अपडेट 2026-08-09
बिना अपने GPU के ट्रेनिंग
मैनिपुलेशन पॉलिसी ट्रेन करना एक GPU वर्कलोड है, और आधुनिक vision-language-action मॉडल को एक सामान्य वर्कस्टेशन से कहीं ज़्यादा VRAM चाहिए। AY-Robots पर ट्रेनिंग प्लेटफ़ॉर्म द्वारा मैनेज किए गए क्लाउड GPU पर चलती है: आप एक डेटासेट और एक पॉलिसी प्रकार चुनते हैं, रन शुरू करते हैं, और ब्राउज़र से इसकी प्रगति देखते हैं। कोई CUDA सेटअप नहीं, कोई ड्राइवर मैचिंग नहीं, और बनाए रखने के लिए कोई एनवायरनमेंट नहीं।
इनपुट हमेशा Dashboard > Datasets से एक क्लाउड डेटासेट होता है। टेलीऑपरेशन सेशन से रिकॉर्ड की गई या LeRobot फ़ॉर्मैट में अपलोड की गई कोई भी चीज़ इसके लिए योग्य है, जिसमें मर्ज किए गए डेटासेट भी शामिल हैं। ट्रेन करने से पहले क्यूरेट करें: Failure लेबल वाले एपिसोड आमतौर पर ट्रेनिंग सेट से बाहर होने चाहिए, और एपिसोड ब्राउज़र में दस मिनट की समीक्षा खराब डेमोंस्ट्रेशन से सीखने में लगने वाले GPU के घंटों को बचाती है।
समर्थित पॉलिसी
चार पॉलिसी परिवार समर्थित हैं। ये साइज़, ट्रेनिंग लागत, और आपके डेटा से कितना सीख सकते हैं, इसमें अलग हैं, इसलिए सही चुनाव किसी सामान्य रैंकिंग से ज़्यादा आपके टास्क और डेटासेट पर निर्भर करता है।
| पॉलिसी | प्रकार | विशेषताएं |
|---|---|---|
| ACT | Transformer, action chunking | सिंगल स्टेप के बजाय भविष्य के एक्शन के छोटे हिस्से प्रेडिक्ट करती है। कॉम्पैक्ट, अपेक्षाकृत तेज़ी से ट्रेन होती है, और एक साफ़ तौर पर तय एक टास्क के लिए ठोस पहला विकल्प है। |
| Diffusion Policy | एक्शन सीक्वेंस पर Diffusion | डेमोंस्ट्रेट किए गए एक्शन के पूरे वितरण को मॉडल करती है, जो तब मदद करता है जब आपके डेमोंस्ट्रेशन टास्क को एक से ज़्यादा वैध तरीकों से हल करते हैं। ACT से ज़्यादा भारी और ट्रेन करने में धीमी, और इनफ़रेंस पर भी धीमी। |
| SmolVLA | छोटा vision-language-action मॉडल | भाषा-आधारित: आपके एपिसोड की टास्क स्ट्रिंग इनपुट का हिस्सा बन जाती है। बड़े फ़ाउंडेशन मॉडल के बिना भाषा-कंडीशनिंग चाहिए तो एक अच्छा बीच का रास्ता। |
| GR00T फ़ाइन-ट्यून | फ़ाउंडेशन मॉडल फ़ाइन-ट्यून | आपके एपिसोड पर एक बड़े प्री-ट्रेन्ड रोबोटिक्स फ़ाउंडेशन मॉडल को फ़ाइन-ट्यून करती है। चारों में सबसे ऊंची सीमा, सबसे ऊंची ट्रेनिंग लागत, और सख़्त डेटासेट फ़ॉर्मैट ज़रूरत के साथ। |
GR00T फ़ाइन-ट्यूनिंग केवल LeRobot फ़ॉर्मैट वर्ज़न 2.1 वाले डेटासेट स्वीकार करती है। एक v3.0 डेटासेट सबमिशन पर नहीं, डेटा लोडिंग के दौरान फ़ेल होगा, इसलिए रन शुरू करने से पहले फ़ॉर्मैट वर्ज़न जांचें। प्लेटफ़ॉर्म पर रिकॉर्ड किए गए डेटासेट जैसे हैं वैसे इस्तेमाल हो सकते हैं; बाहरी अपलोड के लिए, पहले meta/info.json में वर्ज़न वेरिफ़ाई करें।
एक रन शुरू करना
- 1डेटासेट चुनें
Dashboard > Training खोलें और ट्रेन करने के लिए डेटासेट चुनें। एपिसोड काउंट और robot type दिखाए जाते हैं ताकि आप पुष्टि कर सकें कि आपने सही चुना है।
- 2पॉलिसी चुनें
समर्थित पॉलिसी प्रकारों में से एक चुनें। अगर आप निश्चित नहीं हैं, तो ACT से शुरू करें: यह जानने का सबसे सस्ता तरीका है कि क्या आपका डेटासेट बिल्कुल भी कुछ ट्रेन करने लायक है।
- 3लॉन्च करें
रन शुरू करें। इसे एक job id और अपना खुद का रन पेज मिलता है, और आप ब्राउज़र बंद कर सकते हैं: ट्रेनिंग सर्वर-साइड जारी रहती है और जब भी आप वापस आते हैं पेज लाइव स्थिति दिखाता है।
ट्रेनिंग रन पेज
हर रन का एक समर्पित पेज होता है जो वे दो सवाल जवाब देता है जो ट्रेनिंग के दौरान असल में आपके मन में होते हैं: क्या यह सीख रही है, और क्या मशीन ठीक है। सीखने की प्रगति loss, learning rate शेड्यूल, और gradient norm के चार्ट के रूप में दिखती है। एक loss जो तुरंत सपाट हो जाए या एक gradient norm जो फट पड़े, आपको जल्दी बता देता है कि यह रन इंतज़ार के लायक नहीं है।
मशीन की सेहत साथ में दिखती है: GPU उपयोग और मेमोरी, साथ ही ट्रेनिंग मशीन के host मेट्रिक्स। एक फ़ेज़ टाइमलाइन दिखाती है कि रन अभी कहां है, एनवायरनमेंट तैयारी से लेकर डेटा लोडिंग, ट्रेनिंग लूप, और चेकपॉइंट अपलोड तक। जब कुछ गड़बड़ लगे, बिल्ट-इन लॉग व्यूअर बिना किसी SSH एक्सेस के आपको रॉ ट्रेनिंग लॉग देता है, जो आमतौर पर यह देखने के लिए काफ़ी है कि गड़बड़ी आपके डेटासेट में है या रन में ही।
चेकपॉइंट और फिर से शुरू करना
चेकपॉइंट हर रन के लिए अलग स्टोर होते हैं, किसी साझा पूल में नहीं, इसलिए किसी रन पेज पर सूचीबद्ध चेकपॉइंट हमेशा ठीक उसी रन और उसके कॉन्फ़िगरेशन के होते हैं। यह जितना लगता है उससे ज़्यादा मायने रखता है: अलग-अलग सेटिंग वाले रन के बीच चेकपॉइंट मिलाना चुपचाप खराब हुई पॉलिसी का एक क्लासिक कारण है।
अगर कोई रन बीच में रुक जाए, तो आप शुरुआत से करने के बजाय उसके सबसे नए चेकपॉइंट से फिर से शुरू कर सकते हैं। बीच के चेकपॉइंट भी अपने आप में उपयोगी होते हैं: जब कोई लंबा रन अंत के करीब ओवरफ़िट होने लगे, तो अक्सर पहले वाला चेकपॉइंट असली आर्म पर आख़िरी वाले से बेहतर चलता है।
ट्रेन की गई पॉलिसी को अपनी आर्म पर चलाना
एक पूरी हो चुकी पॉलिसी को सीधे आपके रोबोट पर वापस डिप्लॉय किया जा सकता है। कॉकपिट में, अपनी कनेक्टेड आर्म के लिए ट्रेन की गई पॉलिसी चुनें और इनफ़रेंस शुरू करें: वह पॉलिसी अब वे जॉइंट कमांड बनाती है जो पहले आप टेलीऑपरेशन से बनाते थे। आर्म वही robot type होनी चाहिए जिस पर डेटासेट रिकॉर्ड हुआ था, और सीन को ट्रेनिंग सीन जैसा दिखना चाहिए, कैमरा प्लेसमेंट सहित।
पहले इनफ़रेंस रन को डेमो नहीं, प्रयोग की तरह लें। इमरजेंसी स्टॉप को हाथ के पास रखें, ऐसी शुरुआती स्थिति से शुरू करें जो आपके डेमोंस्ट्रेट की हुई स्थिति के करीब हो, और उम्मीद करें कि पॉलिसी उन चीज़ों के प्रति संवेदनशील होगी जो शायद आप नोटिस भी न करें: हिला हुआ कैमरा, अलग लाइटिंग, या कोई ऐसी ऑब्जेक्ट जो डेटासेट में कभी नहीं थी।
आपको कितने एपिसोड चाहिए
प्लेटफ़ॉर्म पर सबसे आम ट्रेनिंग गलती कोई गलत हाइपरपैरामीटर नहीं है, यह बहुत कम डेटा पर ट्रेन करके यह मान लेना है कि पॉलिसी प्रकार काम नहीं करता। एक tabletop टास्क के लिए एक सामान्य नियम के तौर पर: लगभग 50 एपिसोड आपको एक ऐसी पॉलिसी देते हैं जिसका सामान्यीकरण संकीर्ण होता है और जो आपकी डेमोंस्ट्रेट की हुई शुरुआती स्थितियों के करीब से सफल होती है। लगभग 100 से 200 एपिसोड उस एक टास्क के लिए वर्कस्पेस में इस्तेमाल लायक मज़बूती देते हैं, बशर्ते आपने एपिसोड के बीच ऑब्जेक्ट प्लेसमेंट में बदलाव किया हो।
ज़्यादा सक्षम पॉलिसी प्रकार इसे रद्द नहीं करते। 20 एपिसोड पर एक GR00T फ़ाइन-ट्यून फिर भी खराब सामान्यीकरण करेगा; बड़े मॉडल जो देते हैं वह है डेटा उपलब्ध होने पर एक बेहतर सीमा। अगर आपका बजट सीमित है, तो इसे बड़े मॉडल पर खर्च करने से पहले ज़्यादा विविध एपिसोड पर खर्च करें।
अक्सर पूछे जाने वाले प्रश्न
एक ट्रेनिंग रन में कितना समय लगता है?▾
यह पॉलिसी प्रकार और डेटासेट साइज़ पर निर्भर करता है, इसलिए कोई एक ईमानदार संख्या नहीं है। ACT आमतौर पर चारों में सबसे तेज़ है, GR00T फ़ाइन-ट्यून सबसे धीमा। रन पेज पर फ़ेज़ टाइमलाइन और loss चार्ट जल्दी दिखा देते हैं कि रन आगे बढ़ रहा है या नहीं।
क्या मैं मिले हुए डेटासेट पर ट्रेन कर सकता हूं?▾
हां। मिले हुए डेटासेट सामान्य डेटासेट ही हैं; मर्ज वेलिडेशन पहले ही fps, features, और robot type की संगति की गारंटी दे चुकी है। एक ही टास्क की रिकॉर्डिंग मिलाना 100 से 200 एपिसोड की रेंज तक पहुंचने के सबसे असरदार तरीकों में से एक है।
मेरा GR00T रन डेटा लोडिंग के दौरान फ़ेल हो रहा है। मुझे पहले क्या जांचना चाहिए?▾
डेटासेट फ़ॉर्मैट वर्ज़न। GR00T फ़ाइन-ट्यूनिंग को LeRobot v2.1 चाहिए, और एक v3.0 डेटासेट ठीक वहीं फ़ेल होता है। अपने डेटासेट के meta/info.json में वर्ज़न जांचें।
क्या मुझे ट्रेनिंग से पहले फ़ेल हुए एपिसोड हटा देने चाहिए?▾
आमतौर पर हां। Failure लेबल वाले एपिसोड पॉलिसी को वही असफल व्यवहार सिखाते हैं। Recovery एपिसोड अलग हैं: वे दिखाते हैं कि गलती कैसे सुधारी जाए और अक्सर रखने लायक होते हैं।
क्या ट्रेनिंग के दौरान मुझे ब्राउज़र खुला रखना ज़रूरी है?▾
नहीं। रन सर्वर-साइड चलते हैं। जब भी आप वापस आते हैं रन पेज मौजूदा स्थिति, चार्ट, और लॉग दिखाता है, और चाहे कोई देख रहा हो या नहीं, चेकपॉइंट सेव होते रहते हैं।
AY-Robots टेलीऑपरेशन रिकॉर्डिंग को LeRobot फ़ॉर्मैट में कैसे स्टोर करता है: एपिसोड स्ट्रक्चर, डैशबोर्ड एपिसोड ब्राउज़र, अपलोड मर्जिंग, और मार्केटप्लेस।
AY-Robots पर समर्थित हर रोबोट आर्म उसके स्पेसिफ़िकेशन के साथ: SO-100, Koch v1.1, Franka FR3, FP3 और Panda, WidowX-250, और ALOHA ViperX-300।