
SO-100 манипуляторындағы адам бақылайтын бір DAgger раундының қадамдық сипаттамасы: саясатты іске қосып жазып алу, ол қате жасай бастаған сәтте басқаруды қолға алу, жүгіртуді түзету ретінде тіркеу, аралас деректер жиынын құрастыру және оқытуды бақылау нүктесінен жалғастыру. Жетекші манипуляторы жоқтарға арналған пернетақта мен слайдер арқылы басқаруды қолға алу жолын, сондай-ақ раундты құнсыз ететін төрт қатені қамтиды.
Сіздің саясатыңыз жұмыс істеп тұр. Ол текшеге қол созады, ұстағышты бір сантиметр ерте жабады да, оны ұстап алғандай жалғастыра береді. Ешқандай қате шықпайды, және оқыту шығынына қанша қарасаңыз да бұл түсіндірілмейді. Шешім бір демонстрацияларда тағы 20 000 градиент қадамын жасау емес. Шешім — қолыңызды манипуляторға дәл ол қате жасайтын жерде қайта қою, сол кезде не істегеніңізді жазып алу және келесі бақылау нүктесін ескі деректер мен сол түзету бойынша оқыту. Бұл — DAgger раунды, және міне ол SO-100 манипуляторында көру-тіл-әрекет (vision-language-action) саясатымен қалай жүзеге асады.
Теория басқа жерде берілген: деректер жиынын агрегациялау неге жұмыс істейді және адам бақылауы мұны қалай өзгертеді. Бұл — пайдалану нұсқаулығы, әрі ол оқытылған бақылау нүктесі, жұмыс істейтін камералар жиынтығы және қозғалатын манипулятор бар деп есептейді. Төмендегі алты қадам — осы платформаның DAgger бетінде жүзеге асырылған цикл, бірақ реттілік өз скрипттеріңізде де дәл сондай.
Бір раунд қысқаша
- •Оқытылған саясатты іске қосып, оны жазып алыңыз — жүгірту тапсырмасының өз мәтінімен, жалпы телебасқару белгісімен емес.
- •Мінез-құлық қате бола бастаған сәтте басқаруды қолға алыңыз: жетекші манипулятормен айна арқылы тапсыру, ол жоқ болса — пернетақта немесе слайдер арқылы бірден және қолмен.
- •Әр жүгіртуді іріктеңіз: оны түзету ретінде тіркеңіз, бағалау эпизоды ретінде сақтаңыз немесе алып тастаңыз.
- •Қоспаны қолмен құрастырыңыз — бастапқы демонстрацияларға түзетулер қосыла отырып, әр көзден эпизодтар таңдап алынады. Ешқашан тек түзетулермен ғана оқытпаңыз.
- •Соңғы бақылау нүктесінен оқытуды жалғастырыңыз және қай бақылау нүктесі қай қоспаны бергенін жазып қойыңыз.
- •Раундтың бір нәрсеге тұрарлық болғанын білдіретін көрсеткіш — оқыту шығыны емес, араласу жиілігі.
Неге екінші раунд жай ғана көбірек дерек емес
Мінез-құлықты клондау (behaviour cloning) адам барған күйлерде оқытады. Тестілеу кезінде саясат өзі туындатқан күйлерге барады, және кішкентай әрекет қателері ешбір демонстрация қамтымаған күйлерге дейін жинақталады. Росс, Гордон және Багнелл бұл сәтсіздікті AISTATS 2011 үшін формализациялап, стационарлық детерминистік саясатты оқытатын және өз редукциясы бойынша өзі тудыратын күй үлестірімінде жақсы нәтиже көрсетуге тиіс итеративті алгоритммен шешті: ағымдағы саясатты іске қосу, сарапшыға оның нақты барған күйлерін белгілету, оларды деректер жиынына қосу, қайта оқыту, қайталау. Келли және т.б. HG-DAgger арқылы бұл сұрауды практикалық етті: онда адам басқаруды ұстамай-ақ күйлерді белгілеудің орнына, қашан бақылауды қолға алатынын өзі шешеді; олар DAgger пен мінез-құлықты клондаудың екеуімен салыстырғанда да симуляцияланған және нақты автономды жүргізу тапсырмасында жақсырақ нәтиже хабарлайды. Адам бақылауы дәл осы циклді үстелдегі манипуляторда төзімді ететін нәрсе — қолыңызды тек бір нәрсе қате болып бара жатқанда ғана қозғайсыз.
Іс жүзінде теорияға қарағанда екі салдар маңыздырақ. Түзетулер — қарапайым демонстрациялар емес: олар Мандлекар және т.б. сипаттаған тар өткел аймақтарында шоғырланады, мұнда кішкентай ауытқу саясатты демонстрациялар ешқашан қамтымаған күйлерге түсіреді. Ал тек сол қиын бөліктерден тұратын деректер жиыны — нашар құрылымдалған деректер жиыны: Белхале, Куи және Садиг деректер жағынан күй әртүрлілігінің әрқашан пайдалы бола бермейтінін, ал деректер жиынының сапасын әрекет ауытқуы мен өту әртүрлілігінің бірге анықтайтынын дәлелдейді. Аралас деректер жиыны — бұл ымыра емес, бұл дәл мәселенің өзегі.
Бірінші раундтан бұрын осыларды тұрақтандырыңыз
DAgger раунды саясатты уақыт бойы өзімен салыстырады. Раундтар арасында деректер жиынынан басқа өзгертетін кез келген нәрсе бұл салыстыруды мағынасыз етеді.
- Камералардың орны мен бекітпелері, білезік камерасын қоса алғанда. Бір қысқышты босатсаңыз, саясатты емес, бақылау үлестірімін өзгерткен боласыз.
- Экспозиция мен ақ балансы, егер жазып алу жүйеңіз оларды бекітуге мүмкіндік берсе. Раундтар арасында ауытқитын авто-экспозиция — баяу әрі көрінбейтін домен ығысуы.
- Манипулятордың калибрлеуі мен сервоприводтардың нөлдік күйлері. Қайта калибрлеу керек болса, оған дейін жазылғанның бәрін бөлек деректер жиыны деп қараңыз.
- Тапсырма мәтіні. Мұндағы әрбір VLA осыған негізделеді; циклдің ортасында оны қайта тұжырымдау — бұл басқа тапсырма.
- Жарықтандыру, үстел беті, заттар жиынтығы. Жаңа зат — жаңа эксперимент, келесі раунд емес.
- Жазып алу кадр жиілігі. Екі түрлі іріктеу торы бойынша араласу жиіліктерін салыстыру тордың өзінен туындайтын айырмашылықтар береді.
Хсу және т.б. қолға бекітілген көріністі әдеттегі үшінші жақ көрінісімен салыстырды және сахнаны азырақ көрсетуге қарамастан, қолдағы (eye-in-hand) перспективаның оқыту тиімділігі мен таралымнан тыс жалпылауды тұрақты түрде жақсартатынын анықтады. Бес буынды манипуляторда әдетте түзетулеріңіз ұстағыштың уақытын түзейді, ал ұстағыш уақытын дәл білезік көрінісі жеткізеді.
Раунд, басынан аяғына дейін
- 1Инференсті іске қосып жазып алу
Жақсартқыңыз келетін бақылау нүктесіне қарсы жүгіртуді бастаңыз, содан кейін жазып алуды инференс түбіріне бастаңыз. Осылай жазылған кезде ол әдепкі телебасқару белгісінің орнына жүгіртудің өз тапсырма мәтінін мұрагерлейді — саясат дәл осыған оқытылған. Жазып алусыз сәтсіздікті көре аласыз, бірақ оған оқыта алмайсыз.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Қате бола бастағанда басқаруды қолға алу
«Басқаруды қолға алу» түймесін басып, енгізу режимін таңдаңыз: жетекші манипулятор, пернетақта немесе слайдерлер. Жүгіртуші тоқтап тұрады, сіз түзетесіз, содан кейін қайта тапсырасыз. Сіз басқарған кездегі кадрлар автоматты түрде араласу ретінде белгіленеді.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Эпизодтарды іріктеу
Әр эпизод бойынша шешім қабылдаңыз: түзету ретінде тіркеу, бағалау ретінде сақтау немесе алып тастау. Саясат көмексіз аяқтаған жүгірту — бағалау деректері.
- 4Түзету деректер жиынын синхрондау
Түзетулер әр саясат бойынша жергілікті деректер жиынында жиналады және автоматты синхрондау арқылы бұлттық сақтауға түседі. Сіз қоспағанды ешнәрсе араласпайды.
- 5Аралас деректер жиынын құрастыру
Бастапқы деректер жиынын түзетулермен біріктіріңіз, эпизодтарды әр көзден нақты таңдай отырып. Нәтиже осы сәттен бастап қарапайым деректер жиыны болады.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Бақылау нүктесінен оқытуды жалғастыру
Қоспаны негізгі модельден емес, алдыңғы бақылау нүктесінен оқытыңыз. Қай бақылау нүктесі және қай қоспа екенін жазып қойыңыз; бұл жұп болмаса, раунд қайталанбайды.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
2-қадам толығырақ: басқаруды қолға алудың екі жолы
Жетекші манипулятормен
«жетекші-орындаушы» режимінде басқаруды қолға алу — бір позада тұрмаған екі манипулятор арасындағы тапсыру. «Басқаруды қолға алу» түймесін басу жүгіртушіні тоқтатып, жетекшіні орындаушының ағымдағы позасына апарады, сондықтан айналдырушы момент ауысқанда ештеңе секірмейді. Егер бұл туралау қозғалысы уақыт бойынша аяқталмаса, жетекшіні қолмен туралайсыз және екеуі бес градус шамасында жақындағанда ғана босатасыз. Содан кейін әдеттегідей телебасқарасыз, ал әрекет бағаны сіз не бұйырғаныңызды жазады.
Бұл жол туралы адал болайық: туралау қозғалысы мен айналдырушы моментті тапсыру — циклдің нақты құрал-жабдықта ең аз тексерілген бөлігі. Оны маңызды раундта сенер алдында баяу, зияны жоқ позада сынап көріңіз. Жетекші манипулятор үш режимнің ішіндегі ең тегіс түзетулерді береді, сонымен қатар механикалық тұрғыда қате кетуі мүмкін нәрсесі де ең көп.
Жетекші манипуляторсыз: пернетақта мен слайдерлер
Мұны оқып отырғандардың көбінде бір ғана манипулятор бар. Соның өзі жеткілікті. «Басқаруды қолға алу» түймесін басқан сәтте пернетақта немесе слайдер енгізуін таңдаңыз, сонда басқаруды қолға алу бірден әрі қолмен жүреді — туралайтын екінші манипулятор жоқ, сондықтан туралау қадамы да жоқ. Орындаушы өз позасын ұстап тұрып, енгізуді күтеді.
| Енгізу режимі | Манипулятор қалай қозғалады | Сервер бекіткен әр шақыруға шек | Қашан құлыпталады |
|---|---|---|---|
| Жетекші манипулятор | Айна орындаушыны жетекшінің буын бұрыштарынан басқарады | Бұл режимде жылжыту (nudge) немесе орнату (set) шақырулары жоқ; айна орындаушының мақсаттарын үздіксіз жазады | Ешқашан құлыпталмайды, әрі енгізу режимі берілмесе әдепкі осы болады — бірақ оған екінші манипулятор керек; жетекші идентификаторынсыз басқаруды қолға алудан бас тартылады |
| Пернетақта | Әр перне басқан сайынғы салыстырмалы жылжыту, ол «басқаруды қолға алу — жылжыту» endpoint-іне жіберіледі | Қатаң шек: буынға 2 градус, ұстағышқа 4 градус | Егер басқаруды қолға алу жетекші режимінде басталған болса, 409 қатесімен қабылданбайды |
| Слайдерлер | Абсолютті мақсатты поза, ол «басқаруды қолға алу — орнату» endpoint-іне жіберіледі | Әр шақыруда мақсатқа қарай ең көбі 6 градус жылжу; интерфейс шамамен секундына он рет жіберуді жалғастыра береді | Егер басқаруды қолға алу жетекші режимінде басталған болса, 409 қатесімен қабылданбайды |
Шектеулер интерфейсте емес, сервер жағында бекітілген, себебі шина-сервоприводты манипуляторда қате терілген дельта — соқтығысу дегенді білдіреді. Пернетақта арқылы түзетулер сатылы әрі сәл дөрекірек шығады; слайдер түзетулері тегісірек, себебі интерфейс ағынды жіберіп тұрған кезде сервер мақсатқа қарай қадамдап жүреді. Қалай болғанда да, әрекет бағаны толық бұйырылған поза векторын алады, ал араласуды белгілеу жетекші жолымен бірдей, сондықтан пернетақта түзетулері форматта айырмашылықсыз сол деректер жиынына түседі.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Түймені қашан басу керек
Кеш емес, ертерек. Ұстағыш ештеңені ұстамай жабылғаннан кейін басталған түзету саясат кірмеуге тиіс сәтсіздіктен қалпына келуге үйретеді, ал қалпына келу деректері алдын алу деректерінен әлдеқайда аз құнды. Траектория қате екеніне сенген бірінші сәтте үзіп, қиын бөлікті түзетіп өтіп, саясат бұрын өңдеген күйге жеткен бетте қайта тапсырыңыз. ThriftyDAgger бұл шешімді жаңалық пен бағаланған тәуекел бойынша, белгіленген адам бюджеті аясында автоматтандырады, бірақ адам бақылап отырған жалғыз манипуляторда адам қақпасы сіз баптайтын кез келген нәрседен арзанырақ әрі жақсырақ калибрленген.
Ашық бастапқы кодты жинақпен және бірнеше скриптпен орындауға болады. Бағасы — есеп жүргізу, ал DAgger раундтары дәл сол есеп жүргізуден қирайды.
- Саясат оқытылған тапсырма жолымен өз инференс скриптіңізден кадрларды LeRobot деректер жиынына жазыңыз.
- Саясат циклін тоқтатыңыз, команда көзін ауыстырыңыз және өзіңіз басқарған әрбір кадрды араласу ретінде белгілеңіз. Белгісіз түзетулер қарапайым демонстрациялар сияқты көрінеді.
- Саясат бақылауды босатқаннан кейін бірінші енгізуіңізге дейінгі өтпелі кадрларға не болатынын саналы түрде шешіңіз.
- Түзетулерді әр саясат бойынша өз деректер жиынында сақтаңыз және қоспаны қайта құруға болатындай эпизод индекстерін қолмен қадағалаңыз.
- Дәл баптаудың кіру нүктесін алдыңғы бақылау нүктесіне бағыттаңыз және журналдан сол салмақтардың жүктелгенін тексеріңіз.
Дәл сол алты қадам түймелер түрінде бар. Автоматтандырылғаны — қолмен жасағанда оңай қателесетін нәрселер: кадр бойынша араласу белгісі, түзетулер мен бағалаулардың бөлінуі және қай бақылау нүктесі қай қоспаны бергенінің жазбасы. Құрастырылған деректер жиынына сіз таңдамаған ештеңе енбейді.
Ол сіздің орныңызға шешім қабылдамайды. Қай жүгіртудің түзету болып саналатыны, қоспаға қай эпизодтардың кіретіні және қашан тоқтау керектігі — өз пайымыңызға қалады. Өрістер оқыту бөлімінде, ал енгізу режимдері телебасқару бөлімінде құжатталған.
3-қадам толығырақ: іріктеу сапаны шешеді
Жүгіртуден кейін кейбір кадрлары араласу деп белгіленген жазба қолыңызда болады. Үш бағыт бар, әрі қате таңдалған бағыт келесі раундты байқаусызда улайды.
- Араласу шынайы түзету болғанда — саясат қате жаққа бара жатып, сіздің енгізуіңіз саясаттың өзі тудырған күйден дұрыс нәрсені көрсеткенде — түзету ретінде тіркеңіз.
- Таза автономды жүгіртулер мен сақтық үшін қолға алған жүгіртулерді бағалау ретінде сақтаңыз. Бағалау эпизодтары — келесі бақылау нүктесін өлшеу тәсіліңіз, оларға ешқашан оқытуға болмайды.
- Қатыссыз нәрседен — түскен камера кадры, тоқтап қалған сервопривод, аударып жіберген зат — бүлінген жүгіртулерді алып тастаңыз. Ретсіз түзету түзетусіз болғаннан да жаман.
Саясат бақылауды босатқаннан бастап сіздің бірінші енгізуіңізге дейін манипулятор қозғалмай тұрады, ал жазғыш сәл өзгеше суреттермен қатар бірдей позаларды жазуды жалғастырады. Мұнда бұл тапсыру кадрлары шикі жазбада қалады және түзету деректер жиынына енбейді. Циклді өзіңіз құрастырсаңыз, оларды әдейі кесіп тастаңыз: осыларда оқытылған саясат әрекет ету керек жерде кідіруге үйренеді.
5-қадам толығырақ: қоспаны құрастыру
Құрастыру бастапқы деректер жиыны мен түзету деректер жиынын алып, кез келгеніндей оқытылатын жаңа, қарапайым LeRobot деректер жиынын шығарады. Маңызды қасиеті — эпизодтарды таңдау әр көз бойынша нақты жасалады, ешнәрсе автоматты түрде араласпайды. Бұл саясат бір күні бөтен әрекет жасағанша және оны неге оқытылғанын қайта құруға тура келгенше болмашы болып көрінеді.
Ашық қалған сұрақ — қатынас, әрі оны әр жерге көшіруге болатын саны жоқ. Әдебиеттің келісетіні — түзетулер өз кадр үлесінен көбірек салмақ алуы керек. Мандлекар және т.б. өз араласу жүйесі жинаған деректерде итеративті түрде қайта оқытады, сонда саясат тар өткелдерден өтуді үйренеді, әрі осылай оқытылған агенттер интервенциялық емес демонстраторлардан алынған тең мөлшердегі үлгілерге оқытылған агенттерден асып түсетінін хабарлайды. Sirius одан әрі жүреді әрі оқыту үлгілерін жуықталған адам сеніміне қарай қайта салмақтайды, салыстырылған әдістермен салыстырғанда саясаттың табыс жылдамдығында симуляцияда 8 пайыз, ал нақты құрал-жабдықта 27 пайыз өсім хабарлайды, әрі жинақталу жылдамдығы екі есе жоғары. Мұндағы оқыту кіру нүктелерінің ешқайсысы үлгіге салмақ беру тетігін ұсынбайды, сондықтан дөрекі баламасы — бастапқы демонстрацияларды сирету арқылы әр түзету эпизодын толық сақтау, әрі не істегеніңізді жазып қою.

6-қадам толығырақ: бақылау нүктесінен жалғастыру нақты нені білдіреді
Қоспаны негізгі модельден оқыту жұмыс істейді, бірақ алдыңғы раундты тастап, толық жүгіртуге тұрарлық болады. Алдыңғы бақылау нүктесінен жалғастыру жылдамырақ әрі әдетте жақсырақ. Ол сондай-ақ сөз тіркесі болжағаннан гөрі шектеулірек.
Тек салмақтардан тұратын бақылау нүктесі параметрлерді ғана қамтиды, басқа ештеңе жоқ. Оны жүктеу келесі жүгіртуге негізгі модельден жақсырақ бастапқы нүкте береді, бірақ оптимизатор моменттері, оқыту жылдамдығының кестедегі орны және деректер реті нөлден басталады. Жалғасқан жүгіртудің басында шығын секірісін күтіңіз, оны сәтсіздік деп оқымаңыз, әрі раундты жалғастыру деп атамаңыз. Бұл — жылы бастау (warm start).
| Саясат | Өлшемі | GPU деңгейі | Әрекет қадамына инференс | Деректер жиынының форматы | Байқап көруге тұрарлық эпизодтар саны |
|---|---|---|---|---|---|
| GR00T N1.7 | шамамен 3 млрд, дәл баптау кезінде шамамен 40 млн оқытылған | A100 80 ГБ немесе H100 80 ГБ | шамамен 152 мс | LeRobot v2.0 немесе v2.1 | 50 |
| GR00T N1.5 | шамамен 3 млрд | A100 80 ГБ немесе H100 80 ГБ | шамамен 165 мс | LeRobot v2.0 немесе v2.1 | 50 |
| Pi0.5 | PaliGemma негізінде шамамен 3 млрд | A100 80 ГБ немесе H100 80 ГБ | шамамен 485 мс | LeRobot v3.0 | 50 |
| SmolVLA | шамамен 450 млн | RTX 4090 немесе кез келген 24 ГБ карта | шамамен 245 мс | LeRobot v3.0 | 30 |
| ACT | шамамен 80 млн, нөлден оқытылған | RTX 4090 немесе кез келген 24 ГБ карта | шамамен 20 мс | LeRobot v3.0 | 50 |
Кідіріс демонстрация кезінде емес, DAgger циклінде басқаша жинақталады: әрекет қадамына шамамен 485 мс кеткенде манипулятор қателескендіктен емес, кідіргендіктен басқаруды қолға аласыз, ал кідіріс түзетулері пайдалы оқыту деректері емес. Түпкілікті табыс жылдамдығынан гөрі деректер бойынша итерациялап жатсаңыз, жылдам модельде итерациялаңыз. Шюкор және т.б. SmolVLA-ны бір GPU-де оқытуға және тұтынушылық GPU немесе CPU-ларда орналастыруға арналған деп сипаттайды, оның әрекет болжамын орындаудан бөлетін асинхронды инференс жинағы жоғары басқару жиілігіне мүмкіндік береді — дәл осы қасиет басқаруды қолға алу циклін жылдам жауап беретін етеді.
Деректер жиыны форматтары да бір-бірімен ауыстырылмайды. GR00T LeRobot v2.0 немесе v2.1 форматын алады, ал Isaac-GR00T репозиторийі өз кірісін қосымша модалдылық сипаттама файлы бар LeRobot v2 форматының бір түрі деп сипаттайды; мұндағы жаңарақ оқытушылар v3.0-ды күтеді. Қате нұсқада құрастырылған қоспа нашар саясат шығарудың орнына жүктеу кезінде сәтсіз аяқталады — жақсырақ сәтсіздік түрі, дегенмен жоғалған кезек орны. Деректер жиыны құжаттамасы әр оқытушының қай форматты алатынын тізімдейді.
Есеп жүргізу дайын болған цикл
Жетекші манипулятормен, пернетақтамен немесе слайдерлермен басқаруды қолға алу; кадр бойынша араласуды белгілеу; жүгіртулерді түзету немесе бағалау ретінде тіркеу; әр көзден нақты эпизод таңдауымен аралас деректер жиынын құрастыру; әрі негізгі модельдің орнына бақылау нүктесінен оқытуды жалғастыру. Өз шешіміңіз болып қалатыны — қай жүгіртудің түзету болып саналатыны, қоспаға не кіретіні және араласу жиілігі қашан төмендеуін тоқтатқаны.
DAgger циклінің қалай құрылғанын көруРаундты бекерге кетірудің төрт жолы
1. Тек түзетулермен оқыту
Ең жиі кездесетін сәтсіздік әрі ең тартымды қысқа жол. Тек түзетулерден тұратын деректер жиыны дерлік толығымен тапсырманың қиын ортасы болады, жақындау мен шегіну жоқ; саясат қиын бөлікте жақсарады, бірақ оған қалай жеткенін ұмытады. Агрегация — әдістің іске асыру детальі емес, ол — механизмнің өзі: ескі деректер қалған мінез-құлықты орнында ұстап тұрады, ал түзетулер оның бір бөлігін ғана жылжытады.
2. Раундтар арасында камераны жылжыту
Раундтар арасында екі сантиметрге жылжыған камера бастапқыдан да нашар саясат тудырады, ал диагностикаға бір күн кетеді. Мұндағы әрбір VLA суреттерге негізделеді; тек буын күйі заттың қайда екенін ажырата алмайды. Бірінші раундтан бұрын құрылымды суретке түсіріп алыңыз және әр кейінгі раундтан бұрын сол суретті тексеріңіз.
3. Тапсыру артефактілерін оқытуға жіберіп алу
Жоғарыда айтылды, тізімде тұрғанының себебі — ол көрінбейді. Белгісі — алдыңғы раундтың операторы дәл қолға алған жерде саясат секунд үлесіне тоқтап қалады. Бұл кідіріс сияқты көрінеді; шын мәнінде бұл — еліктеу.
4. Жылы бастауды жалғастыру деп атау
Оптимизатор күйі сақталды деп сенсеңіз, бастапқы шығын секірісі қате болып көрінеді де, бүлінген деректерді іздей бастайсыз. Оптимизатордың нөлден басталғанын білсеңіз, секіріс күтілетін нәрсе болады да, одан кейін не болатынына қарайсыз. Сандар бірдей, қорытынды қарама-қарсы.
Раундты өлшеу
Адам бақылайтын циклдің көрсеткіші — араласу жиілігі: сіз басқарған кезде жазылған кадрлар санын жүгірту кадрларының жалпы санына бөлгенде шығатын сан. Ол басқаруды қолға алу мәртебесінде көрсетіледі, әрі раунд қойған сұраққа жауап беретін жалғыз сан осы. Оқыту шығыны саясат жақсарса да, жақсармаса да төмендейді; табыс жылдамдығы бинарлы әрі үстел манипуляторы шығаратын үлгі көлемінде шулы. Араласу жиілігі үздіксіз, саясаттың өзі тудырған күйлерде өлшенеді, әрі саясатқа сіз аз қажет болған сайын төмендейді.
Оны тек бірдей жағдайда жазылған жүгіртулер арасында ғана салыстырыңыз. Толық дәлел, әрі екі раундтан көбіне төзетін бағалау жиынын қалай құру керектігі DAgger циклін өлшеу туралы мақалада берілген. Бірінші раунд шын мәнінде орындалу мүмкіндігін тексеру: сіз құрал-жабдығыңызда басқаруды қолға алудың жұмыс істейтінін, түзетулердің өз белгілерімен түсетінін және жалғасқан жүгіртудің сіз атаған бақылау нүктесін жүктегенін тексеріп жатырсыз. Екінші және үшінші раундтар — жиіліктің қозғала бастауға тиіс жері. Егер төртінші раундқа дейін қозғалмаса, мәселе DAgger-ден бұрын жатыр.
| Әр раунд бойынша жазып қойыңыз | Кейін неге маңызды |
|---|---|
| Қай бақылау нүктесі басқарылды | Онсыз жақсаруды белгілі бір қоспаға телуге болмайды |
| Басқаруды қолға алуда пайдаланылған енгізу режимі | Пернетақта түзетулері жетекші түзетулерінен дөрекірек, әрі бұл деректерде көрінеді |
| Жүгіртулер саны және әрқайсысының қалай іріктелгені | Раундта мәні болатындай жеткілікті түзету болды ма |
| Әр жүгіртудегі және орташа араласу жиілігі | Циклдің ілгерілеу көрсеткіші |
| Әр көз бойынша нақты эпизод таңдауы | Раундты қайталаудың немесе болдырмаудың жалғыз жолы |
| Жылы бастау ма, әлде таза оқыту ма | Бір аптадан кейін қарайтын шығын қисығын түсіндіреді |
Әлі бақылау нүктеңіз болмаса
Оны жасамай циклдің кіру нүктесі жоқ. Алғашқы деректер жиынын жазыңыз, алғашқы саясатты оқытыңыз, оны іске қосыңыз — жазып алу, оқыту және саясатты іске қосу осы жолды қамтиды. Жазып алу клиенті жүктеп алу бетінде, GPU деңгейлері мен сағаттық баға баға белгілеу бетінде, ал пайдалануға жарамды эпизод қалай көрінетіні SO-100 деректер жинау нұсқаулығында берілген. Түзетулерден бұрын демонстрацияларды дұрыс жасаңыз: DAgger — жөндеу тетігі, әрі ол бұрыннан дерлік дұрыс болған нәрседе әлдеқайда жақсы жұмыс істейді.
Жетекші манипуляторсыз DAgger циклін жүргізе аламын ба?▾
Иә. «Басқаруды қолға алу» түймесін басқанда пернетақта немесе слайдер енгізуін таңдаңыз: басқаруды қолға алу бірден әрі қолмен жүреді, туралайтын екінші манипулятор керек емес. Пернетақта салыстырмалы жылжытуларды жібереді, оларды сервер буынға 2 градус, ұстағышқа 4 градус етіп қатаң шектейді; слайдерлер абсолютті мақсат жібереді, ал сервер әр шақыруда оған қарай ең көбі 6 градус жылжиды, интерфейс болса ағынды жіберуді жалғастыра береді. Әрекет бағаны мен араласуды белгілеу жетекші режиміндегімен бірдей, сондықтан түзетулер деректер жиынында ажыратылмайды.
Бір раундқа қанша түзету керек?▾
Барлық жағдайға жарайтын негізделген сан жоқ, әрі кадр саны эпизод санынан маңыздырақ. Жұмыс істейтін ереже — түзетулер қоспада жоғалып кетпеуі керек: 200 бастапқы эпизод пен үш түзету эпизодымен ештеңе өзгермейді. Бір құтқарудың үш қайталанғанынан гөрі, сәтсіз мінез-құлықты бірнеше бастапқы конфигурациядан қамтитын түзетулерге ұмтылыңыз.
Неге тек түзетулермен оқыту сонша жаман идея?▾
Себебі түзетулер дерлік толығымен тапсырманың қиын ортасынан тұрады. Жақындау, туралау және шегіну жоқ, сондықтан саясат түзеткен бөлікте жақсарған сайын бұрын жақсы істей алатынынан айырылады. Ескі деректерді сақтап, оған қосу — қосымша мүмкіндік емес, механизмнің өзі.
Бақылау нүктесінен жалғастыру алдыңғы оқыту жүгіртуін жаңартады ма?▾
Жоқ. Тек салмақтардан тұратын бақылау нүктесі параметрлерді ғана қалпына келтіреді, басқа ештеңе емес: оптимизатор моменттері, оқыту жылдамдығы кестесінің орны және деректер реті қайтадан нөлден басталады. Бұл — жылы бастау, әрі бастапқы шығын секірісі белгі емес, күтілетін нәрсе. Екеуінің қайсысын нақты жасағаныңызды жазып қойыңыз, сонда бір аптадан кейін қисықты дұрыс оқисыз.
Араласу жиілігі төмендемесе ше?▾
Раунд қосуды тоқтатыңыз. Тұрақты жиілік түзетулердің сіз ойлағанды үйретпей жатқанын білдіреді. Әдеттегі себептер алдыңғы кезеңде жатыр: камера жылжыған, түзетулер алдын алу деректері болу үшін тым кеш басталады, тапсыру кадрлары оқыту жиынында қалып қойған, немесе тапсырма саясат алатын бақылаулардан анықталмайды.
Мұның бәрі шешілген мәселе емес, әрі бір батырма басу арқылы бітетін ештеңе жоқ. Интерактивті еліктеу арқылы оқыту — дәл осы себепті белсенді зерттеу саласы: қашан араласу керек, адамның не істегеніне қалай салмақ беру керек, ескі деректің қаншасын сақтау керек деген сұрақтардың тұрақты жауабы жоқ; Целемин және т.б. шолуы әлі ашық тұрғанды көрсетеді. Циклдің бар нәрсесі — оны бірнеше жүз еуроға тұратын құрал-жабдықта мұқият жүргізгенде өлшенетін жинақталу. Құрылымды тұрақтандырыңыз, ертерек араласыңыз, адал іріктеңіз, әдейі қоспалаңыз, әр жолы араласу жиілігін жазып отырыңыз.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started