பாலிசி பயிற்சி
AY-Robots நிர்வகிக்கப்பட்ட GPU-களில் மேனிபுலேஷன் பாலிசிகளை பயிற்றுவிக்கிறது, எனவே பயிற்சி ஹார்ட்வேரை சொந்தமாக வைத்திருக்காமல் நீங்கள் பதிவு செய்யப்பட்ட எபிசோட்களிலிருந்து உங்கள் ஆர்மில் இயங்கும் பாலிசிக்குச் செல்லலாம். இந்தப் பக்கம் ஆதரிக்கப்படும் பாலிசி வகைகள், பயிற்சி இயக்க பக்கம், செக்பாயிண்ட்கள், உங்கள் எபிசோட் எண்ணிக்கையிலிருந்து யதார்த்தமாக என்ன எதிர்பார்க்க வேண்டும் என்பதை உள்ளடக்குகிறது.
கடைசியாக புதுப்பிக்கப்பட்டது 2026-08-09
உங்கள் சொந்த GPU இல்லாமல் பயிற்சி
ஒரு மேனிபுலேஷன் பாலிசியை பயிற்றுவிப்பது ஒரு GPU பணிச்சுமை, நவீன விஷன்-லாங்குவேஜ்-ஆக்ஷன் மாடல்களுக்கு ஒரு பொதுவான வொர்க்ஸ்டேஷனிடம் இருப்பதை விட அதிக VRAM தேவை. AY-Robots இல் பயிற்சி தளம் நிர்வகிக்கும் கிளவுட் GPU-களில் இயங்குகிறது: நீங்கள் ஒரு டேட்டாசெட்டையும் பாலிசி வகையையும் தேர்ந்தெடுக்கிறீர்கள், இயக்கத்தைத் தொடங்குகிறீர்கள், உலாவியிலிருந்து அதன் முன்னேற்றத்தைப் பார்க்கிறீர்கள். CUDA அமைவு இல்லை, டிரைவர் பொருத்தம் இல்லை, பராமரிக்க வேண்டிய என்விரான்மென்ட் இல்லை.
உள்ளீடு எப்போதும் Dashboard > Datasets இலிருந்து ஒரு கிளவுட் டேட்டாசெட். டெலிஆபரேஷன் செஷன்கள் மூலம் நீங்கள் பதிவு செய்தது அல்லது LeRobot ஃபார்மேட்டில் அப்லோட் செய்தது எதுவும் இதற்குத் தகுதியானது, இணைந்த டேட்டாசெட்கள் உட்பட. பயிற்சிக்கு முன் க்யூரேட் செய்யுங்கள்: Failure லேபிள் கொண்ட எபிசோட்கள் பொதுவாக பயிற்சி தொகுப்பிற்கு வெளியே இருக்க வேண்டும், எபிசோட் ப்ரௌசரில் பத்து நிமிட மறுஆய்வு மோசமான டெமான்ஸ்ட்ரேஷன்களிலிருந்து கற்றுக்கொள்வதில் செலவாகும் மணிக்கணக்கான GPU நேரத்தை மிச்சப்படுத்துகிறது.
ஆதரிக்கப்படும் பாலிசிகள்
நான்கு பாலிசி குடும்பங்கள் ஆதரிக்கப்படுகின்றன. அவை அளவு, பயிற்சி செலவு, உங்கள் டேட்டாவிலிருந்து அவை எவ்வளவு உள்வாங்க முடியும் என்பதில் வேறுபடுகின்றன, எனவே சரியான தேர்வு எந்த பொதுவான தரவரிசையை விடவும் உங்கள் பணி மற்றும் டேட்டாசெட்டைப் பொறுத்தது.
| பாலிசி | வகை | சிறப்பியல்புகள் |
|---|---|---|
| ACT | ட்ரான்ஸ்ஃபார்மர், ஆக்ஷன் சங்கிங் | ஒற்றை படிகளுக்குப் பதிலாக எதிர்கால ஆக்ஷன்களின் குறுகிய துண்டுகளை கணிக்கிறது. கச்சிதமானது, ஒப்பீட்டளவில் விரைவாக பயிற்சி பெறுகிறது, ஒரு தெளிவாக வரையறுக்கப்பட்ட பணிக்கு ஒரு நல்ல முதல் தேர்வு. |
| Diffusion Policy | ஆக்ஷன் சீக்வென்ஸ்கள் மீது டிஃப்யூஷன் | டெமான்ஸ்ட்ரேட் செய்யப்பட்ட ஆக்ஷன்களின் முழு பரவலையும் மாதிரியாக்குகிறது, உங்கள் டெமான்ஸ்ட்ரேஷன்கள் பணியை ஒன்றுக்கு மேற்பட்ட செல்லுபடியான வழிகளில் தீர்க்கும்போது இது உதவுகிறது. ACT ஐ விட பயிற்சி பெறுவதற்கு கனமானது, இன்ஃபரன்சில் மெதுவானது. |
| SmolVLA | சிறிய விஷன்-லாங்குவேஜ்-ஆக்ஷன் மாடல் | மொழி-நிபந்தனைக்குட்பட்டது: உங்கள் எபிசோட்களின் பணி ஸ்ட்ரிங் உள்ளீட்டின் ஒரு பகுதியாகிறது. ஒரு பெரிய அஸ்திவார மாடல் இல்லாமல் மொழி நிபந்தனையை விரும்பினால் ஒரு நல்ல நடுநிலைமை. |
| GR00T ஃபைன்-ட்யூன் | அஸ்திவார மாடல் ஃபைன்-ட்யூன் | உங்கள் எபிசோட்களில் ஒரு பெரிய முன்பயிற்சி பெற்ற ரோபோடிக்ஸ் அஸ்திவார மாடலை ஃபைன்-ட்யூன் செய்கிறது. நான்கிலும் மிக உயர்ந்த உச்சவரம்பு, மிக அதிக பயிற்சி செலவுடன், கடுமையான டேட்டாசெட் ஃபார்மேட் தேவையுடன். |
GR00T ஃபைன்-ட்யூனிங் LeRobot ஃபார்மேட் பதிப்பு 2.1 இல் உள்ள டேட்டாசெட்களை மட்டுமே ஏற்கும். ஒரு v3.0 டேட்டாசெட் சமர்ப்பணத்தில் அல்ல, டேட்டா லோடிங்கின் போது தோல்வியடையும், எனவே இயக்கத்தைத் தொடங்குவதற்கு முன் ஃபார்மேட் பதிப்பை சரிபார்க்கவும். தளத்தில் பதிவு செய்யப்பட்ட டேட்டாசெட்கள் அப்படியே பயன்படுத்தப்படலாம்; வெளிப்புற அப்லோட்களுக்கு, முதலில் meta/info.json இல் பதிப்பை சரிபார்க்கவும்.
ஒரு இயக்கத்தைத் தொடங்குதல்
- 1டேட்டாசெட்டைத் தேர்ந்தெடுக்கவும்
Dashboard > Training ஐத் திறந்து பயிற்சி பெற வேண்டிய டேட்டாசெட்டைத் தேர்ந்தெடுக்கவும். எபிசோட் எண்ணிக்கை மற்றும் ரோபோ வகை காட்டப்படுகின்றன, எனவே நீங்கள் சரியானதைத் தேர்ந்தெடுத்தீர்கள் என்பதை உறுதிசெய்யலாம்.
- 2பாலிசியைத் தேர்ந்தெடுக்கவும்
ஆதரிக்கப்படும் பாலிசி வகைகளில் ஒன்றைத் தேர்ந்தெடுக்கவும். உங்களுக்கு உறுதியில்லை என்றால், ACT உடன் தொடங்குங்கள்: உங்கள் டேட்டாசெட் எதையாவது பயிற்றுவிக்கும் அளவுக்கு நல்லதா என்பதைக் கண்டறிய இதுவே மலிவான வழி.
- 3தொடங்குங்கள்
இயக்கத்தைத் தொடங்குங்கள். அதற்கு ஒரு job id மற்றும் அதன் சொந்த இயக்க பக்கம் கிடைக்கும், நீங்கள் உலாவியை மூடலாம்: பயிற்சி சர்வர்-பக்கத்தில் தொடரும், நீங்கள் திரும்பி வரும்போதெல்லாம் பக்கம் நேரடி நிலையைக் காட்டும்.
பயிற்சி இயக்க பக்கம்
ஒவ்வொரு இயக்கத்திற்கும் பயிற்சியின் போது நீங்கள் உண்மையில் கேட்கும் இரண்டு கேள்விகளுக்கு பதிலளிக்கும் ஒரு பிரத்யேக பக்கம் உள்ளது: அது கற்றுக்கொள்கிறதா, மெஷின் ஆரோக்கியமாக உள்ளதா. கற்றல் முன்னேற்றம் லாஸ், லேர்னிங் ரேட் ஷெட்யூல், கிரேடியன்ட் நார்ம் சார்ட்களாகக் காட்டப்படுகிறது. உடனடியாக தட்டையாகும் ஒரு லாஸ் அல்லது வெடிக்கும் ஒரு கிரேடியன்ட் நார்ம் இயக்கம் காத்திருக்க மதிப்பானதா இல்லையா என்பதை முன்கூட்டியே சொல்கிறது.
மெஷின் ஆரோக்கியம் அதனுடன் காட்டப்படுகிறது: GPU பயன்பாடு மற்றும் நினைவகம், பயிற்சி மெஷினின் ஹோஸ்ட் மெட்ரிக்குகள். ஒரு கட்ட காலவரிசை இயக்கம் தற்போது எங்கே இருக்கிறது என்பதைக் காட்டுகிறது, என்விரான்மென்ட் தயாரிப்பிலிருந்து டேட்டா லோடிங், உண்மையான பயிற்சி லூப், செக்பாயிண்ட் அப்லோட் வரை. ஏதோ தவறாக இருப்பதாகத் தோன்றினால், உள்ளமைந்த லாக் வியூவர் எந்த SSH அணுகலும் இல்லாமல் மூல பயிற்சி லாக்குகளைக் கொடுக்கிறது, இது தோல்வி உங்கள் டேட்டாசெட்டால் ஏற்பட்டதா அல்லது இயக்கத்தால் ஏற்பட்டதா என்று பார்க்க பொதுவாக போதுமானது.
செக்பாயிண்ட்கள் மற்றும் மீண்டும் தொடங்குதல்
செக்பாயிண்ட்கள் ஒரு பகிரப்பட்ட பூலில் அல்ல, ஒவ்வொரு இயக்கத்திற்கும் தனித்தனியாக சேமிக்கப்படுகின்றன, எனவே ஒரு இயக்க பக்கத்தில் பட்டியலிடப்பட்ட செக்பாயிண்ட்கள் எப்போதும் அந்த இயக்கத்திற்கும் அதன் கட்டமைப்பிற்கும் மட்டுமே சொந்தமானவை. இது தோன்றுவதை விட முக்கியமானது: வெவ்வேறு அமைப்புகள் கொண்ட இயக்கங்களுக்கிடையே செக்பாயிண்ட்களைக் கலப்பது அமைதியாக உடைந்த பாலிசிகளுக்கான ஒரு பொதுவான காரணம்.
ஒரு இயக்கம் இடையூறு பட்டால், மீண்டும் தொடங்குவதற்குப் பதிலாக அதன் சமீபத்திய செக்பாயிண்டிலிருந்து நீங்கள் மீண்டும் தொடங்கலாம். இடைநிலை செக்பாயிண்ட்களும் தனித்தனியாக பயனுள்ளவை: ஒரு நீண்ட இயக்கம் முடிவை நோக்கி ஓவர்ஃபிட் ஆகத் தொடங்கும்போது, ஒரு முந்தைய செக்பாயிண்ட் பெரும்பாலும் இறுதி ஒன்றை விட உண்மையான ஆர்மில் சிறப்பாக இயங்கும்.
பயிற்சி பெற்ற பாலிசியை உங்கள் ஆர்மில் இயக்குதல்
ஒரு முடிக்கப்பட்ட பாலிசியை நேரடியாக உங்கள் ரோபோவுக்கு மீண்டும் டிப்ளாய் செய்யலாம். காக்பிட்டில், உங்கள் இணைக்கப்பட்ட ஆர்முக்கான பயிற்சி பெற்ற பாலிசியைத் தேர்ந்தெடுத்து இன்ஃபரன்சைத் தொடங்குங்கள்: இப்போது அந்த பாலிசி முன்பு நீங்கள் டெலிஆபரேஷன் மூலம் உருவாக்கிய அதே ஜாயிண்ட் கட்டளைகளை உருவாக்குகிறது. ஆர்ம் டேட்டாசெட் பதிவு செய்யப்பட்ட அதே ரோபோ வகையாக இருக்க வேண்டும், காட்சி பயிற்சி காட்சிகளை ஒத்திருக்க வேண்டும், கேமரா அமைவு உட்பட.
முதல் இன்ஃபரன்ஸ் இயக்கங்களை டெமோக்களாக அல்ல, சோதனைகளாகக் கருதுங்கள். அவசர நிறுத்தத்தை எட்டும் தூரத்தில் வைத்திருங்கள், நீங்கள் டெமான்ஸ்ட்ரேட் செய்ததற்கு நெருக்கமான ஒரு தொடக்க நிலையிலிருந்து தொடங்குங்கள், நீங்கள் கவனிக்காத விஷயங்களுக்கு பாலிசி உணர்திறன் கொண்டதாக இருக்கும் என்று எதிர்பாருங்கள்: நகர்த்தப்பட்ட ஒரு கேமரா, வேறுபட்ட வெளிச்சம், அல்லது டேட்டாசெட்டில் ஒருபோதும் இல்லாத ஒரு பொருள்.
உங்களுக்கு எத்தனை எபிசோட்கள் தேவை
தளத்தில் மிகவும் பொதுவான பயிற்சி தவறு ஒரு தவறான ஹைப்பர்பாராமீட்டர் அல்ல, மிகக் குறைந்த டேட்டாவில் பயிற்சி பெற்று பாலிசி வகை வேலை செய்யவில்லை என்று முடிவு செய்வது. ஒரு தனி மேசைப் பணிக்கான ஒரு அனுமான விதியாக: சுமார் 50 எபிசோட்கள் நீங்கள் டெமான்ஸ்ட்ரேட் செய்த தொடக்க நிலைகளுக்கு நெருக்கமான நிலைகளிலிருந்து வெற்றி பெறும் ஒரு பாலிசியை உங்களுக்குக் கொடுக்கும், குறுகிய பொதுமைப்படுத்தலுடன். சுமார் 100 முதல் 200 எபிசோட்கள், எபிசோட்களுக்கிடையே பொருள் வைப்பை நீங்கள் மாற்றியிருந்தால், அந்த ஒரு பணிக்கு பணியிடம் முழுவதும் பயன்படுத்தக்கூடிய உறுதிப்பாட்டைக் கொடுக்கும்.
மிகவும் திறமையான பாலிசி வகைகள் இதை மாற்றாது. 20 எபிசோட்களில் ஒரு GR00T ஃபைன்-ட்யூன் இன்னும் மோசமாகவே பொதுமைப்படுத்தும்; டேட்டா இருந்தவுடன் பெரிய மாடல்கள் உங்களுக்குக் கொடுப்பது ஒரு சிறந்த உச்சவரம்பு. உங்கள் பட்ஜெட் வரையறுக்கப்பட்டிருந்தால், ஒரு பெரிய மாடலில் செலவழிப்பதற்கு முன் அதிக மாறுபட்ட எபிசோட்களில் செலவழியுங்கள்.
அடிக்கடி கேட்கப்படும் கேள்விகள்
ஒரு பயிற்சி இயக்கம் எவ்வளவு நேரம் எடுக்கும்?▾
இது பாலிசி வகை மற்றும் டேட்டாசெட் அளவைப் பொறுத்தது, எனவே ஒரு நேர்மையான ஒற்றை எண் இல்லை. ACT பொதுவாக நான்கிலும் வேகமானது, GR00T ஃபைன்-ட்யூன்கள் மிகவும் மெதுவானவை. இயக்க பக்கத்தில் உள்ள கட்ட காலவரிசை மற்றும் லாஸ் சார்ட்கள் ஒரு இயக்கம் முன்னேறுகிறதா என்பதை முன்கூட்டியே காட்டுகின்றன.
ஒரு இணைந்த டேட்டாசெட்டில் நான் பயிற்சி பெறலாமா?▾
ஆம். இணைந்த டேட்டாசெட்கள் சாதாரண டேட்டாசெட்களே; இணைத்தல் சரிபார்ப்பு ஏற்கனவே சீரான fps, ஃபீச்சர்கள், ரோபோ வகையை உறுதிசெய்துவிட்டது. அதே பணியின் பதிவுகளை இணைப்பது 100 முதல் 200 எபிசோட் வரம்பை எட்ட மிகவும் பயனுள்ள வழிகளில் ஒன்று.
என் GR00T இயக்கம் டேட்டா லோடிங்கின் போது தோல்வியடைகிறது. நான் முதலில் எதைச் சரிபார்க்க வேண்டும்?▾
டேட்டாசெட் ஃபார்மேட் பதிப்பு. GR00T ஃபைன்-ட்யூனிங்கிற்கு LeRobot v2.1 தேவை, ஒரு v3.0 டேட்டாசெட் சரியாக அங்கேயே தோல்வியடையும். உங்கள் டேட்டாசெட்டின் meta/info.json இல் பதிப்பைச் சரிபார்க்கவும்.
பயிற்சிக்கு முன் தோல்வியடைந்த எபிசோட்களை நான் அகற்ற வேண்டுமா?▾
பொதுவாக ஆம். Failure லேபிள் கொண்ட எபிசோட்கள் பாலிசிக்கு தோல்வியுறும் நடத்தையைக் கற்றுத்தருகின்றன. Recovery எபிசோட்கள் வேறுபட்டவை: அவை ஒரு தவறை எவ்வாறு சரிசெய்வது என்பதைக் காட்டுகின்றன, பொதுவாக வைத்திருக்க மதிப்புடையவை.
பயிற்சியின் போது நான் உலாவியைத் திறந்து வைத்திருக்க வேண்டுமா?▾
இல்லை. இயக்கங்கள் சர்வர்-பக்கத்தில் இயங்குகின்றன. நீங்கள் திரும்பி வரும்போதெல்லாம் இயக்க பக்கம் தற்போதைய நிலை, சார்ட்கள், லாக்குகளைக் காட்டுகிறது, யாராவது பார்க்கிறார்களா இல்லையா என்பதைப் பொருட்படுத்தாமல் செக்பாயிண்ட்கள் சேமிக்கப்படுகின்றன.
AY-Robots டெலிஆபரேஷன் பதிவுகளை LeRobot ஃபார்மேட்டில் எவ்வாறு சேமிக்கிறது: எபிசோட் அமைப்பு, டாஷ்போர்டு எபிசோட் ப்ரௌசர், அப்லோட்களை இணைத்தல், மார்க்கெட்பிளேஸ்.
AY-Robots இல் ஆதரிக்கப்படும் ஒவ்வொரு ரோபோ ஆர்மும் அதன் விவரக்குறிப்புகளுடன்: SO-100, Koch v1.1, Franka FR3, FP3 மற்றும் Panda, WidowX-250, ALOHA ViperX-300.