पोलिसी तालिम
AY-Robots ले म्यानिपुलेसन पोलिसीहरूलाई व्यवस्थित GPU मा तालिम दिन्छ, त्यसैले तपाईंले तालिम हार्डवेयर नराखी रेकर्ड गरिएका एपिसोडदेखि आफ्नो आर्ममा चल्ने पोलिसीसम्म पुग्न सक्नुहुन्छ। यो पृष्ठले समर्थित पोलिसी प्रकार, तालिम रन पृष्ठ, चेकपोइन्ट, र तपाईंको एपिसोड गणनाबाट यथार्थ रूपमा के नतिजा अपेक्षा गर्ने भन्ने कुरा समेट्छ।
अन्तिम अद्यावधिक 2026-08-09
आफ्नै GPU बिना तालिम
म्यानिपुलेसन पोलिसी तालिम दिनु एउटा GPU कार्यभार हो, र आधुनिक भिजन-ल्याङ्ग्वेज-एक्सन मोडेलहरूलाई सामान्य वर्कस्टेसनमा भन्दा बढी VRAM चाहिन्छ। AY-Robots मा, तालिम प्लेटफर्मले व्यवस्थित गर्ने क्लाउड GPU मा चल्छ: तपाईंले डेटासेट र पोलिसी प्रकार छान्नुहुन्छ, रन सुरु गर्नुहुन्छ, र यसको प्रगति ब्राउजरबाट हेर्नुहुन्छ। कुनै CUDA सेटअप, ड्राइभर मिलान, वा मर्मत गर्नुपर्ने एन्भायरनमेन्ट छैन।
इनपुट सधैं Dashboard > Datasets बाटको क्लाउड डेटासेट हो। टेलिअपरेसन सत्रमार्फत रेकर्ड गरेको वा LeRobot ढाँचामा अपलोड गरेको जुनसुकै कुरा, जोडिएका डेटासेटहरूसहित, योग्य हुन्छ। तालिम दिनुअघि क्युरेट गर्नुहोस्: Failure लेबल भएका एपिसोडहरू सामान्यतया तालिम सेटबाट बाहिर हुनुपर्छ, र एपिसोड ब्राउजरमा दस मिनेटको समीक्षाले खराब डेमोन्स्ट्रेसनबाट सिक्न खर्च हुने घण्टौंको GPU समय जोगाउँछ।
समर्थित पोलिसीहरू
चारवटा पोलिसी परिवार समर्थित छन्। ती आकार, तालिम लागत, र तपाईंको डेटाबाट कति ग्रहण गर्न सक्छन् भन्नेमा फरक हुन्छन्, त्यसैले सही छनोट कुनै सामान्य क्रमांकनभन्दा तपाईंको कार्य र डेटासेटमा बढी निर्भर हुन्छ।
| पोलिसी | प्रकार | विशेषता |
|---|---|---|
| ACT | ट्रान्सफर्मर, एक्सन चङ्किङ | एउटा-एउटा चरणको साटो भविष्यका क्रियाहरूको छोटो टुक्रा भविष्यवाणी गर्छ। सानो, तुलनात्मक रूपमा छिटो तालिम पाउँछ, र एउटा स्पष्ट रूपमा परिभाषित कार्यका लागि राम्रो पहिलो छनोट हो। |
| Diffusion Policy | एक्सन क्रमहरूमा डिफ्युजन | देखाइएका क्रियाहरूको पूरा वितरण मोडेल गर्छ, जुन तपाईंका डेमोन्स्ट्रेसनले कार्यलाई एकभन्दा बढी वैध तरिकाले समाधान गर्दा उपयोगी हुन्छ। ACT भन्दा तालिम दिन गाह्रो र इन्फरेन्समा ढिलो। |
| SmolVLA | सानो भिजन-ल्याङ्ग्वेज-एक्सन मोडेल | भाषा-अनुकूलित: तपाईंका एपिसोडको कार्य स्ट्रिङ इनपुटको हिस्सा बन्छ। ठूलो फाउन्डेसन मोडेल बिना भाषा अनुकूलन चाहनेका लागि राम्रो बीचको बिन्दु। |
| GR00T फाइनट्युन | फाउन्डेसन मोडेल फाइनट्युन | तपाईंका एपिसोडमा ठूलो प्रि-ट्रेन्ड रोबोटिक्स फाउन्डेसन मोडेल फाइनट्युन गर्छ। चारमध्ये सबैभन्दा उच्च सीमा, सबैभन्दा उच्च तालिम लागतमा, र कडा डेटासेट ढाँचा आवश्यकतासहित। |
GR00T फाइनट्युनिङले LeRobot ढाँचा भर्सन 2.1 भएका डेटासेटहरू मात्र स्वीकार गर्छ। v3.0 डेटासेट सबमिसनमा होइन, डेटा लोडिङको बेला असफल हुन्छ, त्यसैले रन सुरु गर्नुअघि ढाँचा भर्सन जाँच्नुहोस्। प्लेटफर्ममा रेकर्ड गरिएका डेटासेटहरू जस्ताको तस्तै प्रयोग गर्न सकिन्छ; बाह्य अपलोडका लागि, पहिले meta/info.json मा भर्सन प्रमाणित गर्नुहोस्।
रन सुरु गर्दै
- 1डेटासेट छान्नुहोस्
Dashboard > Training खोल्नुहोस् र तालिम दिने डेटासेट छान्नुहोस्। तपाईंले सही डेटासेट छान्नुभएको पुष्टि गर्न एपिसोड गणना र रोबोट प्रकार देखाइन्छ।
- 2पोलिसी छान्नुहोस्
समर्थित पोलिसी प्रकारमध्ये एउटा छान्नुहोस्। तपाईं निश्चित हुनुहुन्न भने, ACT बाट सुरु गर्नुहोस्: तपाईंको डेटासेट कुनै पनि कुरा तालिम दिन योग्य छ कि छैन भनी पत्ता लगाउने यो सबैभन्दा सस्तो तरिका हो।
- 3सुरु गर्नुहोस्
रन सुरु गर्नुहोस्। यसले एउटा जब आईडी र आफ्नै रन पृष्ठ पाउँछ, र तपाईं ब्राउजर बन्द गर्न सक्नुहुन्छ: तालिम सर्भर-साइडमा जारी रहन्छ र तपाईं फर्किंदा पृष्ठले लाइभ स्थिति देखाउँछ।
तालिम रन पृष्ठ
हरेक रनको आफ्नै समर्पित पृष्ठ हुन्छ जसले तालिमको बेला तपाईंसँग वास्तवमा हुने दुई प्रश्नको जवाफ दिन्छ: यसले सिकिरहेको छ कि छैन, र मेसिन स्वस्थ छ कि छैन। सिकाइको प्रगति loss, लर्निङ रेट सेड्युल, र ग्रेडिएन्ट नर्मका चार्टको रूपमा देखाइन्छ। तुरुन्तै समथर हुने loss वा फुट्ने ग्रेडिएन्ट नर्मले रन कुर्न लायकको छैन भनी सुरुमै भन्छ।
मेसिन स्वास्थ्य छेउछाउ देखाइन्छ: GPU उपयोग र मेमोरी, साथै तालिम मेसिनको होस्ट मेट्रिक। एउटा फेज टाइमलाइनले रन हाल कहाँ छ भनी देखाउँछ, एन्भायरनमेन्ट तयारीदेखि डेटा लोडिङ, तालिम लूप आफैं, र चेकपोइन्ट अपलोडसम्म। केही बेठिक देखिँदा, अन्तर्निहित लग भ्युअरले कुनै SSH पहुँच बिना कच्चा तालिम लग दिन्छ, जुन विफलता तपाईंको डेटासेटको हो कि रनकै हो भनी हेर्न सामान्यतया पर्याप्त हुन्छ।
चेकपोइन्ट र पुनः सुरु गर्दै
चेकपोइन्टहरू प्रति रन भण्डारण गरिन्छ, साझा पूलमा होइन, त्यसैले रन पृष्ठमा सूचीबद्ध चेकपोइन्टहरू सधैं ठ्याक्कै त्यही रन र त्यसको कन्फिगरेसनका हुन्छन्। यो सुनिएभन्दा बढी महत्त्वपूर्ण छ: फरक सेटिङ भएका रनहरूबीच चेकपोइन्ट मिसाउनु चुपचाप बिग्रिएका पोलिसीहरूको क्लासिक स्रोत हो।
कुनै रन बीचमा रोकिए, तपाईं फेरि सुरु गर्नुको साटो यसको पछिल्लो चेकपोइन्टबाट पुनः सुरु गर्न सक्नुहुन्छ। मध्यवर्ती चेकपोइन्टहरू आफैंमा पनि उपयोगी हुन्छन्: लामो रन अन्त्यतिर ओभरफिट हुन थाल्दा, अन्तिम चेकपोइन्टभन्दा पहिलेको चेकपोइन्ट वास्तविक आर्ममा प्रायः राम्रो चल्छ।
तालिम पाएको पोलिसी आफ्नो आर्ममा चलाउँदै
पूरा भएको पोलिसी सिधै तपाईंको रोबोटमा फिर्ता डिप्लोय गर्न सकिन्छ। ककपिटमा, आफ्नो जोडिएको आर्मका लागि तालिम पाएको पोलिसी छान्नुहोस् र इन्फरेन्स सुरु गर्नुहोस्: अब पोलिसीले तपाईंले पहिले टेलिअपरेसनद्वारा उत्पादन गर्नुभएका जोइन्ट आदेशहरू उत्पादन गर्छ। आर्म डेटासेट रेकर्ड गरिएको उही रोबोट प्रकारको हुनुपर्छ, र दृश्य क्यामेरा राख्ने ठाउँसहित तालिम दृश्यहरूसँग मिल्दोजुल्दो हुनुपर्छ।
पहिलो इन्फरेन्स रनहरूलाई डेमो होइन, प्रयोगजस्तै व्यवहार गर्नुहोस्। इमर्जेन्सी स्टप पहुँचभित्रै राख्नुहोस्, तपाईंले देखाउनुभएकोसँग नजिकको सुरुवाती अवस्थाबाट सुरु गर्नुहोस्, र सारिएको क्यामेरा, फरक उज्यालोपन, वा डेटासेटले कहिल्यै नसमेटेको वस्तुजस्ता तपाईंले नोटिस नगर्ने कुराप्रति पोलिसी संवेदनशील हुनेछ भनी अपेक्षा गर्नुहोस्।
तपाईंलाई कति एपिसोड चाहिन्छ
प्लेटफर्ममा सबैभन्दा सामान्य तालिम गल्ती गलत हाइपरप्यारामिटर होइन, यो धेरै थोरै डेटामा तालिम दिएर पोलिसी प्रकार काम गर्दैन भनी निष्कर्ष निकाल्नु हो। एउटा टेबलटप कार्यका लागि सामान्य नियमको रूपमा: लगभग 50 एपिसोडले तपाईंलाई देखाइएकाजस्तै सुरुवाती अवस्थाबाट सफल हुने साँघुरो सामान्यीकरण भएको पोलिसी दिन्छ। लगभग 100 देखि 200 एपिसोडले, एपिसोडहरूबीच वस्तु राख्ने ठाउँ फरक-फरक बनाइएको सर्तमा, त्यो एउटा कार्यका लागि कार्यक्षेत्रभर प्रयोगयोग्य दृढता दिन्छ।
बढी सक्षम पोलिसी प्रकारहरूले यो कुरा खारेज गर्दैनन्। 20 एपिसोडमा GR00T फाइनट्युनले पनि खराब सामान्यीकरण गर्छ; डेटा भइसकेपछि ठूला मोडेलले तपाईंलाई दिने कुरा राम्रो सीमा हो। तपाईंको बजेट सीमित छ भने, ठूलो मोडेलमा खर्च गर्नुभन्दा पहिले बढी विविध एपिसोडमा खर्च गर्नुहोस्।
बारम्बार सोधिने प्रश्नहरू
तालिम रन कति समय लाग्छ?▾
यो पोलिसी प्रकार र डेटासेट आकारमा निर्भर हुन्छ, त्यसैले कुनै इमानदार एउटै सङ्ख्या छैन। ACT सामान्यतया चारमध्ये सबैभन्दा छिटो हुन्छ, GR00T फाइनट्युन सबैभन्दा ढिलो। रन पृष्ठमा फेज टाइमलाइन र loss चार्टले रन प्रगति भइरहेको छ कि छैन सुरुमै देखाउँछ।
के म जोडिएको डेटासेटमा तालिम दिन सक्छु?▾
हो। जोडिएका डेटासेटहरू सामान्य डेटासेट नै हुन्; मर्ज भ्यालिडेसनले पहिले नै fps, फिचर, र रोबोट प्रकार स्थिर छ भनी सुनिश्चित गरिसकेको हुन्छ। उही कार्यका रेकर्डिङ मर्ज गर्नु 100 देखि 200 एपिसोड दायरामा पुग्ने सबैभन्दा प्रभावकारी तरिकामध्ये एक हो।
मेरो GR00T रन डेटा लोडिङको बेला असफल हुन्छ। पहिले के जाँच्नुपर्छ?▾
डेटासेट ढाँचा भर्सन। GR00T फाइनट्युनिङलाई LeRobot v2.1 चाहिन्छ, र v3.0 डेटासेट ठ्याक्कै त्यहीं असफल हुन्छ। आफ्नो डेटासेटको meta/info.json मा भर्सन जाँच्नुहोस्।
के मैले तालिमअघि असफल एपिसोडहरू हटाउनुपर्छ?▾
सामान्यतया हो। Failure लेबल भएका एपिसोडहरूले पोलिसीलाई असफल व्यवहार सिकाउँछन्। Recovery एपिसोड फरक हुन्छन्: तिनले गल्ती कसरी सच्याउने भनी देखाउँछन् र प्रायः राख्न लायकका हुन्छन्।
तालिमको बेला मैले ब्राउजर खुला राख्नुपर्छ?▾
होइन। रनहरू सर्भर-साइडमा कार्यान्वित हुन्छन्। तपाईं फर्किंदा रन पृष्ठले हालको स्थिति, चार्ट, र लग देखाउँछ, र कसैले हेरिरहेको छ कि छैन जे भए पनि चेकपोइन्टहरू सेभ हुन्छन्।