पॉलिसी ट्रेनिंग
AY-Robots मॅनेज्ड GPU वर मॅनिप्युलेशन पॉलिसी ट्रेन करते, त्यामुळे तुम्ही ट्रेनिंग हार्डवेअरची मालकी न बाळगता रेकॉर्ड केलेल्या एपिसोडपासून तुमच्या आर्मवर चालणाऱ्या पॉलिसीपर्यंत पोहोचू शकता. हे पान सपोर्टेड पॉलिसी प्रकार, ट्रेनिंग रन पान, चेकपॉइंट्स, आणि तुमच्या एपिसोड संख्येवरून वास्तवात काय अपेक्षित धरावे हे कव्हर करते.
शेवटचे अद्ययावत 2026-08-09
तुमच्याच GPU शिवाय ट्रेनिंग
मॅनिप्युलेशन पॉलिसी ट्रेन करणे हे GPU वर्कलोड आहे, आणि आधुनिक व्हिजन-लँग्वेज-अॅक्शन मॉडेल्सना सामान्य वर्कस्टेशनकडे असते त्यापेक्षा जास्त VRAM लागते. AY-Robots वर ट्रेनिंग प्लॅटफॉर्मने मॅनेज केलेल्या क्लाउड GPU वर चालते: तुम्ही एक डेटासेट व पॉलिसी प्रकार निवडता, रन सुरू करता, आणि ब्राउझरमधून त्याची प्रगती पाहता. CUDA सेटअप, ड्रायव्हर जुळवणी, किंवा मेंटेन करायचे एन्व्हायर्नमेंट काहीही नसते.
इनपुट नेहमी Dashboard > Datasets मधील क्लाउड डेटासेट असतो. तुम्ही टेलिऑपरेशन सेशनद्वारे रेकॉर्ड केलेले किंवा LeRobot फॉरमॅटमध्ये अपलोड केलेले काहीही, मर्ज केलेल्या डेटासेटसह, यासाठी पात्र असते. ट्रेन करण्यापूर्वी क्युरेट करा: Failure लेबल असलेले एपिसोड सहसा ट्रेनिंग सेटच्या बाहेर ठेवावेत, आणि एपिसोड ब्राउझरमध्ये दहा मिनिटांचे पुनरावलोकन वाईट डेमॉन्स्ट्रेशन्समधून शिकण्यात खर्च होणारे तासन्तास GPU वेळ वाचवते.
सपोर्टेड पॉलिसीज
चार पॉलिसी फॅमिली सपोर्टेड आहेत. त्या आकार, ट्रेनिंग खर्च, आणि तुमच्या डेटातून किती शिकू शकतात यात वेगळ्या आहेत, त्यामुळे योग्य निवड कोणत्याही सर्वसाधारण रँकिंगपेक्षा तुमच्या काम व डेटासेटवर जास्त अवलंबून असते.
| पॉलिसी | प्रकार | वैशिष्ट्ये |
|---|---|---|
| ACT | ट्रान्सफॉर्मर, अॅक्शन चंकिंग | एकल टप्प्यांऐवजी भविष्यातील अॅक्शन्सचे छोटे चंक्स प्रेडिक्ट करते. कॉम्पॅक्ट, तुलनेने वेगाने ट्रेन होते, आणि एका स्पष्टपणे परिभाषित कामासाठी ठोस पहिली निवड आहे. |
| Diffusion Policy | अॅक्शन सिक्वेन्सवर डिफ्यूजन | डेमॉन्स्ट्रेट केलेल्या अॅक्शन्सचे संपूर्ण वितरण मॉडेल करते, जे तुमचे डेमॉन्स्ट्रेशन्स काम एकापेक्षा जास्त वैध मार्गांनी सोडवत असल्यास उपयुक्त ठरते. ACT पेक्षा ट्रेन करायला जड आणि इन्फरन्सला कमी वेगवान. |
| SmolVLA | लहान व्हिजन-लँग्वेज-अॅक्शन मॉडेल | भाषा-आधारित: तुमच्या एपिसोडमधील टास्क स्ट्रिंग इनपुटचा भाग बनते. मोठ्या फाउंडेशन मॉडेलशिवाय भाषा-आधारितता हवी असल्यास एक चांगला मध्यम मार्ग. |
| GR00T फाइन-ट्यून | फाउंडेशन मॉडेल फाइन-ट्यून | तुमच्या एपिसोडवर एक मोठे प्रीट्रेन्ड रोबोटिक्स फाउंडेशन मॉडेल फाइन-ट्यून करते. चौघांपैकी सर्वात उंच मर्यादा, सर्वात जास्त ट्रेनिंग खर्चासह, आणि कडक डेटासेट फॉरमॅट गरजेसह. |
GR00T फाइन-ट्युनिंग फक्त LeRobot फॉरमॅट व्हर्जन 2.1 मधील डेटासेट स्वीकारते. v3.0 डेटासेट सबमिशनला नाही तर डेटा लोडिंगदरम्यान अयशस्वी होईल, त्यामुळे रन सुरू करण्यापूर्वी फॉरमॅट व्हर्जन तपासा. प्लॅटफॉर्मवर रेकॉर्ड केलेले डेटासेट जसे आहेत तसे वापरता येतात; बाह्य अपलोडसाठी, आधी meta/info.json मधील व्हर्जन तपासा.
रन सुरू करणे
- 1डेटासेट निवडा
Dashboard > Training उघडा आणि ट्रेन करायचा डेटासेट निवडा. एपिसोड संख्या व रोबोट प्रकार दाखवले जातात, त्यामुळे तुम्ही योग्य तो निवडला आहे याची खात्री करता येते.
- 2पॉलिसी निवडा
सपोर्टेड पॉलिसी प्रकारांपैकी एक निवडा. खात्री नसल्यास, ACT पासून सुरुवात करा: तुमचा डेटासेट काहीही ट्रेन करण्याइतका चांगला आहे का हे शोधण्याचा तो सर्वात स्वस्त मार्ग आहे.
- 3लाँच करा
रन सुरू करा. त्याला एक job id आणि स्वतःचे रन पान मिळते, आणि तुम्ही ब्राउझर बंद करू शकता: ट्रेनिंग सर्व्हर-साइड सुरूच राहते आणि तुम्ही परत आल्यावर पान थेट स्थिती दाखवते.
ट्रेनिंग रन पान
प्रत्येक रनला एक स्वतंत्र पान असते जे ट्रेनिंगदरम्यान तुम्हाला प्रत्यक्षात पडणाऱ्या दोन प्रश्नांची उत्तरे देते: ते शिकत आहे का, आणि मशीन ठीक आहे का. लर्निंग प्रगती लॉस, लर्निंग रेट शेड्यूल, आणि ग्रेडियंट नॉर्मच्या चार्ट्सद्वारे दाखवली जाते. लगेच स्थिर होणारा लॉस किंवा प्रचंड वाढणारा ग्रेडियंट नॉर्म रन थांबून राहण्यालायक आहे का हे लवकर सांगतो.
मशीन हेल्थ त्याचसोबत दाखवली जाते: GPU वापर व मेमरी, तसेच ट्रेनिंग मशीनचे होस्ट मेट्रिक्स. एक फेज टाइमलाइन रन सध्या कुठे आहे हे दाखवते, एन्व्हायर्नमेंट तयारीपासून डेटा लोडिंग, प्रत्यक्ष ट्रेनिंग लूप, आणि चेकपॉइंट अपलोडपर्यंत. काहीतरी चुकीचे वाटत असल्यास, अंगभूत लॉग व्ह्यूअर कोणत्याही SSH अॅक्सेसशिवाय रॉ ट्रेनिंग लॉग्ज देतो, जे अपयश तुमच्या डेटासेटमुळे आहे की रनमुळेच हे पाहण्यासाठी सहसा पुरेसे असते.
चेकपॉइंट्स आणि पुन्हा सुरू करणे
चेकपॉइंट्स एकत्रित पूलमध्ये नाही, तर प्रत्येक रननुसार साठवले जातात, त्यामुळे रन पानावर सूचीबद्ध चेकपॉइंट्स नेहमी नेमक्या त्याच रन व त्याच्या कॉन्फिगरेशनचे असतात. हे वाटते त्यापेक्षा जास्त महत्त्वाचे आहे: वेगवेगळ्या सेटिंग्ज असलेल्या रनमधील चेकपॉइंट्स मिसळणे हे शांतपणे बिघडलेल्या पॉलिसींचे एक ठराविक कारण आहे.
रन मध्येच थांबल्यास, नव्याने सुरू करण्याऐवजी तुम्ही त्याच्या शेवटच्या चेकपॉइंटवरून पुन्हा सुरू करू शकता. मधले चेकपॉइंट्सही स्वतःच उपयुक्त असतात: लांब रन शेवटाकडे ओव्हरफिट होऊ लागल्यास, आधीचा चेकपॉइंट खऱ्या आर्मवर अंतिम चेकपॉइंटपेक्षा अनेकदा जास्त चांगला चालतो.
ट्रेन केलेली पॉलिसी तुमच्या आर्मवर चालवणे
पूर्ण झालेली पॉलिसी थेट तुमच्या रोबोटवर परत डिप्लॉय करता येते. कॉकपिटमध्ये, तुमच्या कनेक्टेड आर्मसाठी ट्रेन केलेली पॉलिसी निवडा आणि इन्फरन्स सुरू करा: आता ती पॉलिसी तेच जॉइंट कमांड्स तयार करते जे आधी तुम्ही टेलिऑपरेशनद्वारे तयार करत होता. आर्म डेटासेट ज्या रोबोट प्रकारावर रेकॉर्ड केला होता तोच असावा, आणि दृश्य ट्रेनिंग दृश्यांसारखेच असावे, कॅमेरा प्लेसमेंटसह.
पहिले इन्फरन्स रन डेमो नव्हे, तर प्रयोग म्हणून वागवा. इमर्जन्सी स्टॉप हाताशी ठेवा, तुम्ही डेमॉन्स्ट्रेट केलेल्या जवळच्या सुरुवातीच्या स्थितीपासून सुरुवात करा, आणि पॉलिसी तुम्हाला लक्षातही न येणाऱ्या गोष्टींना संवेदनशील असेल अशी अपेक्षा ठेवा: हलवलेला कॅमेरा, वेगळी प्रकाशयोजना, किंवा डेटासेटमध्ये कधीच नसलेली वस्तू.
तुम्हाला किती एपिसोड लागतात
प्लॅटफॉर्मवरील सर्वात सामान्य ट्रेनिंग चूक चुकीचा हायपरपॅरामीटर नसून खूप कमी डेटावर ट्रेन करून पॉलिसी प्रकार काम करत नाही असा निष्कर्ष काढणे ही आहे. एका टेबलटॉप कामासाठी अंदाजे नियम: सुमारे 50 एपिसोड तुम्हाला अशी पॉलिसी देतात जी तुम्ही डेमॉन्स्ट्रेट केलेल्या जवळच्या सुरुवातीच्या स्थितींमधून यशस्वी होते, अरुंद सामान्यीकरणासह. सुमारे 100 ते 200 एपिसोड, तुम्ही एपिसोड्समध्ये वस्तूंची जागा बदलली असल्यास, त्या एका कामासाठी वर्कस्पेसभर वापरण्यायोग्य मजबुती देतात.
जास्त सक्षम पॉलिसी प्रकार हे रद्द करत नाहीत. 20 एपिसोडवरील GR00T फाइन-ट्यूनही सामान्यीकरणात कमकुवतच राहील; डेटा पुरेसा असल्यावर मोठे मॉडेल्स तुम्हाला जी उंच मर्यादा देतात तेच त्यांचे मूल्य आहे. बजेट मर्यादित असल्यास, मोठ्या मॉडेलवर खर्च करण्याआधी जास्त वैविध्यपूर्ण एपिसोडवर खर्च करा.
वारंवार विचारले जाणारे प्रश्न
ट्रेनिंग रनला किती वेळ लागतो?▾
हे पॉलिसी प्रकार व डेटासेट आकारावर अवलंबून असते, त्यामुळे एकच प्रामाणिक आकडा नाही. ACT सामान्यतः चौघांपैकी सर्वात जलद असतो, GR00T फाइन-ट्यून सर्वात संथ. रन पानावरील फेज टाइमलाइन व लॉस चार्ट्स रन प्रगती करत आहे का हे लवकर दाखवतात.
मी मर्ज केलेल्या डेटासेटवर ट्रेन करू शकतो का?▾
होय. मर्ज केलेले डेटासेट हे सामान्य डेटासेटच असतात; मर्ज व्हॅलिडेशनने आधीच सुसंगत fps, फीचर्स, आणि रोबोट प्रकाराची खात्री केलेली असते. एकाच कामाच्या रेकॉर्डिंग्ज मर्ज करणे हा 100 ते 200 एपिसोड रेंज गाठण्याचा सर्वात परिणामकारक मार्गांपैकी एक आहे.
माझा GR00T रन डेटा लोडिंगदरम्यान अयशस्वी होतो. मी आधी काय तपासावे?▾
डेटासेट फॉरमॅट व्हर्जन. GR00T फाइन-ट्युनिंगसाठी LeRobot v2.1 आवश्यक आहे, आणि v3.0 डेटासेट नेमके तिथेच अयशस्वी होतो. तुमच्या डेटासेटच्या meta/info.json मधील व्हर्जन तपासा.
ट्रेनिंगपूर्वी मी अयशस्वी एपिसोड काढून टाकावेत का?▾
सहसा हो. Failure लेबल असलेले एपिसोड पॉलिसीला अयशस्वी वर्तन शिकवतात. Recovery एपिसोड वेगळे असतात: ते चूक कशी सुधारायची हे दाखवतात आणि सहसा ठेवण्यायोग्य असतात.
ट्रेनिंगदरम्यान मला ब्राउझर उघडा ठेवावा लागतो का?▾
नाही. रन सर्व्हर-साइड चालतात. तुम्ही परत आल्यावर रन पान सध्याची स्थिती, चार्ट्स, आणि लॉग्ज दाखवते, आणि कोणी पाहत आहे की नाही याची पर्वा न करता चेकपॉइंट्स सेव्ह होतात.
AY-Robots टेलिऑपरेशन रेकॉर्डिंग्ज LeRobot फॉरमॅटमध्ये कशी साठवते: एपिसोड रचना, डॅशबोर्डवरील एपिसोड ब्राउझर, अपलोड्स मर्ज करणे, आणि मार्केटप्लेस.
AY-Robots वर सपोर्टेड प्रत्येक रोबोट आर्म आणि त्याच्या स्पेसिफिकेशन्ससह: SO-100, Koch v1.1, Franka FR3, FP3 व Panda, WidowX-250, आणि ALOHA ViperX-300.