Полиси оқыту

AY-Robots манипуляция полисилерін басқарылатын GPU-ларда оқытады, сондықтан оқыту жабдығы болмай-ақ жазылған эпизодтардан қолыңызда жұмыс істейтін полисиге дейін жете аласыз. Бұл бет қолдау көрсетілетін полиси түрлерін, оқыту жұмысы бетін, чекпойнттарды және эпизод санынан шынайы түрде күтуге болатын нәтижелерді қамтиды.

Соңғы жаңарту 2026-08-09

Өз GPU-сыз оқыту

Манипуляция полисиін оқыту GPU жүктемесі, ал заманауи көру-тіл-әрекет модельдеріне әдеттегі жұмыс станциясында бар VRAM-нан көбірек қажет. AY-Robots жүйесінде оқыту платформа басқаратын бұлттық GPU-ларда жүреді: датасет пен полиси түрін таңдап, жұмысты бастап, оның барысын браузерден бақылайсыз. CUDA баптауы жоқ, драйверлерді сәйкестендіру жоқ, күтіп ұстау керек орта жоқ.

Кіріс әрдайым Dashboard > Datasets бетінен алынған бұлттық датасет. Қашықтан басқару сессиялары арқылы жазылған немесе LeRobot форматында жүктелген кез келген нәрсе, соның ішінде біріктірілген датасеттер де, жарамды. Оқытар алдында реттеңіз: Failure белгісі бар эпизодтар әдетте оқыту жиынтығынан тыс қалуы керек, эпизод браузерінде он минуттық қарау нашар демонстрациялардан үйренуге кететін сағаттаған GPU уақытын үнемдейді.

Қолдау көрсетілетін полисилер

Полисидің төрт тобына қолдау бар. Олар мөлшері, оқыту құны және деректеріңізден қаншалықты сіңіре алатыны бойынша ерекшеленеді, сондықтан дұрыс таңдау кез келген жалпы бағаланудан гөрі тапсырмаңыз бен датасетіңізге көбірек байланысты.

ПолисиТүріСипаттамалары
ACTТрансформер, әрекетті бөліктеуЖеке қадамдардың орнына болашақ әрекеттердің қысқа бөліктерін болжайды. Ықшам, салыстырмалы түрде тез оқытылады, бір жақсы анықталған тапсырма үшін жақсы алғашқы таңдау.
Diffusion PolicyӘрекет тізбектеріне арналған диффузияДемонстрацияланған әрекеттердің толық үлестірімін модельдейді, бұл демонстрацияларыңыз тапсырманы бір жарамды жолдан көбірек шешкенде пайдалы. ACT-тан ауыр оқытылады, шығару кезінде баяуырақ.
SmolVLAШағын көру-тіл-әрекет моделіТілге бейімделген: эпизодтарыңыздағы тапсырма жолы кірістің бөлігіне айналады. Үлкен негіз моделсіз тілге бейімделу керек болғанда жақсы орта нұсқа.
GR00T дәл баптауНегіз моделінің дәл баптауыЭпизодтарыңызда үлкен, алдын ала оқытылған робототехникалық негіз моделін дәл баптайды. Төрттің ішіндегі ең жоғары шегі, ең жоғары оқыту құны, әрі қатаң датасет форматы талабы бар.
GR00T үшін LeRobot v2.1 датасеттері қажет

GR00T дәл баптауы тек LeRobot форматының 2.1 нұсқасындағы датасеттерді қабылдайды. v3.0 датасеті жіберу кезінде емес, деректерді жүктеу кезінде сәтсіз болады, сондықтан жұмысты бастамас бұрын формат нұсқасын тексеріңіз. Платформада жазылған датасеттерді бар күйінде пайдалануға болады; сыртқы жүктеулер үшін алдымен meta/info.json ішіндегі нұсқаны растаңыз.

Жұмысты бастау

  1. 1
    Датасетті таңдау

    Dashboard > Training бетін ашып, оқытуға арналған датасетті таңдаңыз. Дұрыс таңдағаныңызды растау үшін эпизод саны мен робот түрі көрсетіледі.

  2. 2
    Полисиді таңдау

    Қолдау көрсетілетін полиси түрлерінің бірін таңдаңыз. Сенімді болмасаңыз, ACT-тан бастаңыз: датасетіңіз кез келген нәрсені оқытуға жеткілікті жақсы екенін білудің ең арзан жолы осы.

  3. 3
    Іске қосу

    Жұмысты бастаңыз. Оған тапсырма идентификаторы мен өз жұмыс беті беріледі, браузерді жаба аласыз: оқыту сервер жағында жалғаса береді, қайта оралғанда бет тікелей күйді көрсетеді.

Оқыту жұмысының беті

Әр жұмыстың оқыту кезінде нақты қоятын екі сұраққа жауап беретін арнайы беті бар: ол үйреніп жатыр ма, машина дұрыс жұмыс істеп тұр ма. Оқу барысы loss, оқыту жылдамдығы кестесі және градиент нормасының графиктері ретінде көрсетіледі. Бірден тегістелетін loss немесе жарылатын градиент нормасы жұмыстың күтуге тұрарлық емес екенін ерте айтады.

Машина денсаулығы соның қасында көрсетіледі: GPU пайдалану мен жады, сондай-ақ оқыту машинасының хост метрикалары. Кезең уақыт сызығы жұмыстың қазір қай жерде екенін көрсетеді, орта дайындаудан бастап деректерді жүктеу, оқыту циклінің өзі және чекпойнт жүктеп салуға дейін. Бір нәрсе дұрыс емес сияқты көрінгенде, кіріктірілген журнал көрсеткіші SSH қатынассыз шикі оқыту журналдарын береді, бұл әдетте ақаудың датасетіңізден бе, әлде жұмыстың өзінен бе екенін көру үшін жеткілікті.

Чекпойнттар және қайта бастау

Чекпойнттар ортақ пулда емес, әрбір жұмыс үшін бөлек сақталады, сондықтан жұмыс бетінде тізілген чекпойнттар әрдайым дәл сол жұмыс пен оның баптауына тиесілі. Бұл естілгеннен маңыздырақ: әр түрлі баптаулары бар жұмыстардың чекпойнттарын араластыру - үнсіз бұзылған полисилердің классикалық көзі.

Жұмыс үзілсе, қайтадан бастаудың орнына оның соңғы чекпойнтынан жалғастыруға болады. Аралық чекпойнттар да өз алдына пайдалы: ұзақ жұмыс соңына жақындағанда шамадан тыс бейімделе бастаса, соңғы чекпойнттан гөрі бұрынғысы нақты қолда жиі жақсырақ жұмыс істейді.

Оқытылған полисиді өз қолыңызда іске қосу

Аяқталған полисиді тікелей роботыңызға қайта орналастыруға болады. Кокпитте байланысқан қолыңыз үшін оқытылған полисиді таңдап, шығаруды бастаңыз: енді полиси бұрын қашықтан басқару арқылы жасаған буын командаларын жасайды. Қол датасет жазылған дәл сол робот түрінде болуы керек, ал сахна камера орналастыруын қоса, оқыту сахналарына ұқсас болуы керек.

Алғашқы шығару жұмыстарын демо емес, эксперимент ретінде қарастырыңыз. Төтенше тоқтатуды қол жетімді жерде ұстаңыз, демонстрацияланғанға жақын бастапқы күйден бастаңыз, полисидің жылжытылған камера, өзгеше жарық немесе датасетте ешқашан болмаған зат сияқты байқамайтын нәрселерге сезімтал болатынын күтіңіз.

Сізге қанша эпизод қажет

Платформадағы ең жиі кездесетін оқыту қатесі қате гиперпараметр емес, тым аз деректе оқытып, полиси түрі жұмыс істемейді деп қорытынды жасау. Бір үстел тапсырмасы үшін жалпы ереже ретінде: шамамен 50 эпизод демонстрацияланғанға жақын бастапқы күйлерден табысқа жететін тар жалпыламасы бар полиси береді. Шамамен 100-ден 200-ге дейінгі эпизод, эпизодтар арасында заттардың орналасуын өзгертсеңіз, сол бір тапсырма үшін жұмыс кеңістігі бойынша пайдалы тұрақтылық береді.

Қабілеттірек полиси түрлері мұны жоймайды. 20 эпизодтағы GR00T дәл баптауы әлі де нашар жалпылама болады; үлкен модельдер деректер болғанда жоғарырақ шегі әкеледі. Бюджетіңіз шектеулі болса, оны үлкен модельге жұмсамас бұрын алуан түрлі эпизодтарға жұмсаңыз.

Жиі қойылатын сұрақтар

Оқыту жұмысы қанша уақыт алады?

Бұл полиси түрі мен датасет өлшеміне байланысты, сондықтан бір нақты сан жоқ. ACT әдетте төрттің ішіндегі ең тезі, GR00T дәл баптауы ең баяуы. Жұмыс бетіндегі кезең уақыт сызығы мен loss графиктері жұмыс алға басып жатқанын ерте көрсетеді.

Біріктірілген датасетте оқыта аламын ба?

Иә. Біріктірілген датасеттер кәдімгі датасеттер; біріктіру валидациясы fps, мүмкіндіктер мен робот түрінің сәйкес екенін бұрыннан кепілдендірген. Бір тапсырманың жазбаларын біріктіру 100-200 эпизод ауқымына жетудің ең тиімді жолдарының бірі.

GR00T жұмысым деректерді жүктеу кезінде сәтсіз болады. Алдымен нені тексеру керек?

Датасет формат нұсқасын. GR00T дәл баптауы LeRobot v2.1 талап етеді, v3.0 датасеті дәл сол жерде сәтсіз болады. Датасетіңіздің meta/info.json ішіндегі нұсқасын тексеріңіз.

Оқытуға дейін сәтсіз эпизодтарды алып тастауым керек пе?

Әдетте, иә. Failure белгісі бар эпизодтар полисиге сәтсіз мінез-құлықты үйретеді. Recovery эпизодтары өзгеше: олар қатені түзеу жолын көрсетеді, көбіне сақтауға тұрарлық.

Оқыту кезінде браузерді ашық ұстауым керек пе?

Жоқ. Жұмыстар сервер жағында орындалады. Жұмыс беті қайта оралған кезде ағымдағы күйді, графиктерді және журналдарды көрсетеді, ал біреу бақылап отырса да, отырмаса да чекпойнттар сақталады.