
Стъпка по стъпка описание на един човешко управляван DAgger цикъл на SO-100 ръка: запуск на политиката и запис, преемственост при нарушение, подаване като корекция, съставяне на смесен набор от данни и продължаване на обучението от контролна точка. Включва пътя за преемственост чрез клавиатура и пълзачи за хора без лидерска ръка, и четирите грешки, които правят цикъла безполезен.
Вашата политика работи. Достига кубика, затвори захвата един сантиметър твърде рано и продължава така, сякаш го е хванала. Нищо не се случва с грешка, и никакво количество гледане на загубата при обучението не го обяснява. Решението е не още 20 000 градиентни стъпки върху същите демонстрации. То е да поставите ръката си обратно на ръката точно където се допуска грешка, записа това, което направихте вместо това, и тренирате следващата контролна точка по старите данни плюс тази корекция. Това е DAgger цикъл, и ето как се стартира един на SO-100 с политика за зрително-езиково-действие.
Теорията е другаде: защо агрегирането на набор от данни работи и какво човешкото управление променя за него. Това е ръководството за управление, и приема обучена контролна точка, работещ набор от камери и ръка, която се движи. Шесте стъпки по-долу са цикълът както е внедрен на DAgger страницата на тази платформа, но последователността е същата от ваши собствени скриптове.
Един цикъл накратко
- •Запустете обученото политика и запишете го, с текста на задачата на цикъла вместо генеричен етикет за телеуправление.
- •Преемствено в момента, когато поведението се обърне: огледално предаване на ръка с лидерска ръка, непосредствено и ръчно чрез клавиатура или пълзачи без една.
- •Тригериране всеки цикъл: подайте като корекция, запазете като оценяващ епизод или го отхвърлете.
- •Съставете смеса на ръка - оригинални демонстрации плюс корекции, епизоди избрани по източник. Никога не тренирайте само по корекции.
- •Продължете обучението от последната контролна точка и отбележете кояЛ контролна точка е произвела кояЛ смес.
- •Числото, което казва дали цикълът е бил полезен, е интервенционният процент, не загубата при обучението.
Защо вторият цикъл е не просто още данни
Имитационното обучение тренира върху държавите, които човек е посетил. В време на тест политиката посещава държави, които причинява, и малки грешки в действията се натрупват в държави, които никаква демонстрация не е покривала. Рос, Гордън и Багнел формализираха този отказ за AISTATS 2011 и го отговориха с итеративен алгоритъм, който тренира стационарна детерминирана политика и под техния намек, трябва да се представи добре под разпределението на държавата, което создава: запустете текущата политика, попросете експерта да етикетира държавите, които той действително е достигнал, добавете тези към набора от данни, преименирайте, повторете. Келли et al. направи заявката практична с HG-DAgger, където човекът решава кога да поеме контрола вместо етикетирането на държави без да держи контролите; те докладват подобрено представяне над DAgger и имитационното обучение на симулирана и реална автономна задача за управление. Човешкото управление е това, което прави цикъла толерируем на маса ръка - движите ръцете си само когато нещо се обърне.
Две последици материал повече на практика, отколкото теорията прави. Корекциите не са обикновени демонстрации: те се концентрират в болната точка, която Мандлекар et al. описват, където малко отклонение хвърля политиката в държави, които демонстрациите никога не са покривали. И набор от данни, направен само от тези трудни части, е лошо оформен набор от данни - Белхале, Куи и Садиг твърдят от страна на данните, че разнообразието на държава е не всегда полезно, и че разнообразието на действието и преходното разнообразие заедно решават качеството на набора от данни. Смесеният набор от данни не е компромис, то е целта.
Замразете тези преди цикъл един
DAgger цикъл сравнява политиката срещу себе си във времето. Всичко, което промените между циклите, което не е набор от данни, прави това сравнение безсмислено.
- Позиции на камера и монтажи, включително камера на китката. Отпуснете един скобичка и сте променили наблюдаваното разпределение, не политиката.
- Експозиция и баланс на белия, ако вашият стек за улавяне ви позволява да ги фиксирате. Автоматична експозиция, които дрейфват между циклите е бавен, невидим домейн смяна.
- Калибриране на ръката и позиции на серво нула. Ако трябва да преизчислите, третирайте всичко, записано преди него, като отделен набор от данни.
- Текста на задачата. Всяка VLA тук условна за нея; преработката ѝ средната на цикъл е различна задача.
- Осветление, повърхност на маса, набор от предмет. Нов обект е нов експеримент, не следващият цикъл.
- Честотата на кадъра при запис. Сравняването на интервенционни процреди в две вземане решение рачета произвежда разлики, които идват от рачетата.
Хсу et al. сравниха централна дланна възглед спрямо обичайния трети-лична възглед и намериха перспективата на очите в ръка последователно подобрена ефективност на обучението и обобщение извън разпределението, въпреки виждане по-малко на сцената. На пет-съединителна ръка, синхронизацията на захвата е обичайно това, което коригиранията ви изправят, и синхронизацията на захвата е это, което китката вид носи.
Цикълът, край до край
- 1Стартиране на умозаключение и запис
Стартирайте цикъл против контролната точка, която искате да подобрите, след това стартирайте записа на коренната папка на умозаключението. Записани по този начин наследява собствения текст на задачата на цикъла, което е това, на което политиката е обучена, вместо етикета по подразбиране за телеуправление. Без записа можете да гледате неудачата, но не да тренирате върху нея.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Преемствено при нарушение
Натиснете Преемствено и изберете режима на вход: лидерска ръка, клавиатура или пълзачи. Бегачът паузира, вие коригирате, вие връщате. Кадрите, записани докато управлявате, са маркирани като интервенции автоматично.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Тригериране на епизодите
Решете за епизод: подайте като корекция, запазете като оценяващ, или отхвърлете. Цикъл, който политиката е завършила без помощ е данни за оценка.
- 4Синхронизиране на коригиращия набор от данни
Корекциите събират в местен набор от данни по политика и отиват на облако хранилище чрез автоматична синхронизация. Нищо не е смесено в което вие не сте поставили.
- 5Съставяне на смесения набор от данни
Комбинирайте оригиналния набор от данни с коригиращия набор, избирайки епизоди явно по източник. Резултатът е обикновен набор от данни от тази точка нататък.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Продължаване на обучението от контролната точка
Обучавайте смеса от предишната контролна точка вместо базовия модел. Отбележете кояЛ контролна точка и кояЛ смес; без това двойка цикълът е не възпроизводим.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Стъпка 2 в детаил: двата начина за преемствено
С лидерска ръка
В лидер-последовател режим преемствеността е предаване между две ръце, които не са в същата позиция. Натиснете Преемствено паузира бегачa и управлява лидера на позицията на последователя, така че нищо не се скача при преминаване на момент. Ако това намиране на съглас тайм-аут, вие съравете лидера на ръка и отпускате само когато двата са в четири-пет градуса. От там телеуправлявате нормално и колоната действие записва това, което сте командвали.
Бъдете честни за този път: намирането на съглас управление и момент предаване е най-малко тестван част на цикъла на реален хардуер. Тестирайте предаването на бавна, безвредна позиция преди вие да разчитате на него в цикъл, който ви интересува. Лидерска ръка произвежда най-гладките корекции на трите начина, и също има най-много, което може да се обърне механично.
Без лидерска ръка: клавиатура и пълзачи
Повечето хора, които четат това, притежават една ръка. Това е достатъчно. Изберете клавиатура или пълзащо входен режим в момента, когато натиснете Преемствено, и преемствеността е незабавна и ръчна - няма втора ръка за намиране на съглас, така че няма стъпка за намиране на съглас. Последователят държи своята позиция и чака вход.
| Режим на вход | Как ръката се движи | Ограничение за вызов, наложено от сървър | Заключена, когато |
|---|---|---|---|
| Лидерска ръка | Огледалото управлява последователя от ъглите на съединението на лидера | Никакъв подтик или задани повиквания в този режим; огледалото пише цели на последователя непрекъснато | Никога заключена, и по подразбиране, ако не е даден режим на вход - но то трябва втора ръка; без лидер идентификатор преемствеността е отказана |
| Клавиатура | Относителен подтик за натискане на клавиш, изпратен на крайна точка на преемствено подтик | Трудо закрепване при 2 градуса за съединение, 4 градуса за захват | Отказано с 409 ако преемствеността е стартирана в режим на лидер |
| Пълзачи | Абсолютна целева позиция, изпратена на крайна точка на преемствено задаване | Най-много 6 градуса пътуване към целта на вызов; интерфейсът держи изпращане на около десет пъти в секунда | Отказано с 409 ако преемствеността е стартирана в режим на лидер |
Закрепванията се налагат сървър-страна, не в интерфейса, тъй като печатна дельта на ръка сервер-автобус е удар. Клавиатурни корекции излизат стъпково и малко груб; пълзачни корекции са по-гладки, тъй като сървър се движи към целта докато интерфейсът держи потока. По всеки начин колоната действие получава пълния командван вектор позиция и маркирането на интервенция е идентично към лидер пътя, така че клавиатурни корекции кацат в същия набор от данни без формат разлика.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Кога да натиснете бутона
Рано вместо късно. Корекция, която стартира после захватът е затворен на нищо учи възстановяване от неудачата политиката не трябва да е влязла, и данни за възстановяване са далеч по-малко стойност отколкото данни за избягване. Прекъсвам в първия момент вие сте уверени траектория е неправилна, коригирайте през трудна част, върнете както само държава е един политиката управляват преди. ThriftyDAgger автоматизира то решение чрез наваляне на интервенции на новост и приблизителен риск при фиксирана човешка бюджет, но на единична ръка с човек, който, вече глеждащ, човешката врата е по-евтин и лучше калибриран отколкото всичко вие ще тюнирам.
Възможно с отворения стек източник и няколко скриптове. Това го цена е съответствие, и съответствие е където DAgger циклите умират.
- Пишете кадрове от вашата собствена скрипт умозаключение в LeRobot набор от данни, със низ на задачата политиката е обучена на.
- Паузирайте политиката цикъл, превключете командния източник, и маркирайте всеки кадър вие управлявате като интервенция. Без маркирането, корекциите изглеждат като обикновени демонстрации.
- Решете умишлено което случва на преходни кадрове между политиката освобождаване на контрола и вашия първи вход.
- Запазете корекции в своя собствен набор от данни за политика, и проследете индекси епизод на ръка така че смес може да бъде възстроена.
- Насочете въвод-точка фин-тюнинг към предишната контролна точка, и проверете в дневник че то зареди тези тежести.
Същите шест стъпки съществуват като бутони. То което е автоматизирано е което е лесно да се получи неправилно на ръка: флаг интервенция за кадър, разделяне между корекции и оценяване, и запис в кое контролна точка произведе кояЛ смес. Нищо влиза съставен набор от данни че вие не сте избрали.
То не решава за вас. КояЛ цикъл се брои като корекция, кои епизоди влизат смес, и кога интервенционен процент е спрял да пада остават решения. Полета са документирани под обучение, режимите на вход под телеуправление.
Стъпка 3 в детаил: тригериране решава качеството
След цикъл имате запис със някои кадрове маркирани като интервенции. Три места съществуват, и неправилният един тихо отравя следния цикъл.
- Подайте като корекция кога интервенция е била истинска поправка: политиката беше главоёния някъде неправилно и вашия вход показа права какво от държава политиката себе произведе.
- Запазете като оценяване за чист автономен циклове и за циклове вие поехте управление от предпазливост. Оценяване епизоди са как вие мерите следния контролна точка, и те трябва никога да бъдат обучени на.
- Отхвърлете циклите разрушени от нещо несвързано - кадър заключ камера, засяло серво, предмет вие събориха. Мъчна корекция е по-лоша отколкото никакви корекции.
Между политиката освобождаване на контрола и вашия първи вход, ръката держи неподвижна докато запис пазар писане - цикъл на идентични позиции сдружени със малко различни образи. Тук тези предаване кадрове остават в сурова запис и извън коригиращия набор от данни. Ако вие градите цикъл себе, нарежете тях умишлено: политиката обучена на тях учи да пауза където то трябва действува.
Стъпка 5 в детаил: съставяне на смес
Композиция приема оригиналния набор от данни плюс коригиращия набор от данни и произвежда нов, обикновен LeRobot набор от данни това обучава както всеки другия. Важна свойство е че избор епизод е явен по източник - нищо е не смесено в автоматично. То звучи малко докато първия път политиката поведение странно и вие трябва възстроиц това то е обучена на.
Отворения въпрос е съотношение, и никой има число това преноси. То което литературата прави се съгласи е че корекции трябва брой за повече отколкото им рамка дял. Мандлекар et al. преквалифициране повтарящи се на данни техен интервенция система събира, така че политиката учи да направи маршрут болна точка, и докладват че агенти обучени та начин превъзходят агенти обучени на еквивалентни брой примерки от не-интервенционални демонстратори. Сирий идва по-далеч и пере-тежави обучение примерки чрез приблизителна човешка доверие, докладване 8 процент печалба в симулация и 27 процент на реален хардуер в политиката успех степен срещу методи то сравнява със, при два пъти събеседнай скорост. Никой на обучаване въвод-точки тук изпуснем примерка-тежест бутон, така че груба замяна е да запази всеки корекция епизод докато подвземане оригинално демонстрации - и да напиша надолу какво вие направиха.

Стъпка 6 в детаил: това продължаване от контролна точка наистина означава
Обучаване смес от базовия модел работи но хвърля своя предишния цикъл и разходи пълния цикъл. Продължаване от предишния контролна точка е по-бързо и обичайно по-добро. То е също по-ограничено отколкото фраза предложи.
Тежест-само контролна точка съдържа параметри и нищо другое. Зареждането го дава следния цикъл най-добро полагане точка отколкото базов модел, но оптимизатор моменти, график темп учение позиция и ред данни всички стартирам от нула. Очаквам загуба скок при начало на продължилия цикъл, не го прочета като отказ, и не обадете цикъл възстановяване. То е топло старт.
| Политика | Размер | Ниво GPU | Умозаключение по стъпка действие | Формат набор от данни | Епизоди преди то е стойност опит |
|---|---|---|---|---|---|
| GR00T N1.7 | относно 3 B, приблизително 40 M обучен по време фин-тюнинг | A100 80 GB или H100 80 GB | относно 152 ms | LeRobot v2.0 или v2.1 | 50 |
| GR00T N1.5 | относно 3 B | A100 80 GB или H100 80 GB | относно 165 ms | LeRobot v2.0 или v2.1 | 50 |
| Pi0.5 | относно 3 B на PaliGemma хребет | A100 80 GB или H100 80 GB | относно 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | относно 450 M | RTX 4090 или всеки 24 GB карта | относно 245 ms | LeRobot v3.0 | 30 |
| ACT | относно 80 M, обучен от начало | RTX 4090 или всеки 24 GB карта | относно 20 ms | LeRobot v3.0 | 50 |
Латентност съединения вътре DAgger цикъл на начин то не поради демонстрация: при приблизително 485 ms на действие стъпка вие преемствено тъй като ръката коле, не тъй като то е неправилно, и коле корекции не са полезни обучение данни. Ако вие повтарящи се на данни скорост вместо преследване последния успех степен, повтарящи се на бързо модел. Шукор et al. описват SmolVLA като дизайн да обучи на един GPU и развой на потребител GPU или CPU, със асинхронна умозаключение стека че разкопчава прогноза действие от изпълнение да позволи по-височина управление степен - свойство че запазва преемствено цикъл отзивчив.
Набор от данни формати не са заменяеми. GR00T приема LeRobot v2.0 или v2.1, и Isaac-GR00T хранилище описва входния като вкус на LeRobot v2 формат със добавен модалност описание файл; на нов треньор тук очаква v3.0. Смес съставена на неправилна версия се проваля при зареждане време скорост производству лош политиката - по-добро отказ начин, все още изхвърлено опашка слот. документация набор от данни списъци който формат всеки треньор взема.
Цикълът, със съответствие вече направено
Преемствено със лидерска ръка, клавиатура или пълзачи; флаг интервенция за кадър; подаване циклове като корекции или оценяване; съставяне смесен набор от данни със явен избор епизод по източник; и продължаване обучението от контролна точка вместо базов модел. То което остава вашия решение е кояЛ цикъл се брой като корекция, какво влиза смес, и кога интервенционен процент е спрял да пада.
Виж как DAgger цикъл е свързанЧетири начина да изхвърлете цикъл
1. Обучаване на само корекции
Най-често отказ и най-мамене пътя. Само-корекция набор от данни е почти целия трудна средната на задача, със подход и отстъпление липсва; политиката получава по-добро при трудна част и забрават как да стигне там. Агрегиране е не деталь осъществяване на метода, то е механизма: стария данни е какво държи остатък поведение на място докато корекции придвижи един част то.
2. Преместване камера между циклите
Камера че величина две сантиметра между циклите произвежда политиката по-лоша отколкото един вие стартира със, и диагноза че разходи ден. Всяка VLA тук условна на образи; съединение държава не разкрива където предмет е. Фотография установката преди първи цикъл и проверка че фотография преди всяка по-късна една.
3. Позволяване предаване артефакти вътре обучение
Покрито над, и на списък тъй като то е невидимо. Симптомът е политиката че стои за фракция на секунда точно където предишния цикъл оператор е поел управление. То изглежда като коле; то е имитация.
4. Обаждане топло старт възстановяване
Ако вие вярвам оптимизатор държава са преносимост, началния загуба скок прочета като бъг и вие отправи преследване за корумп данни. Ако вие знаете оптимизатор е стартира свежо, скок е очаквано и вие вижте какво дойде след то. Същия числа, противоположен выводи.
Мерене цикъл
Метрика за човешко управляван цикъл е интервенционен процент: кадрове записани докато вие бяха в управление, разделен по всеки кадрове на цикъл. То е в преемствено статус, и то е единственото число че отговори въпрос цикълът попита. Обучаване загуба пада независимо или не политиката подобрена; успех степен е двоична и шумна при размер проб стола ръка произвежда. Интервенционен процент е непрекъсната, мерена на държави политиката себе причини, и то пада както политиката нужда вие по-малко.
Сравнете то само през циклове записани под идентични условия. Пълната аргумент, и как да градя оценяване задайте че остави повече отколкото две циклове, е в статия върху мерене DAgger цикъл. Цикъл един е реалистично тест за възможност: вие сте проверяване че преемствено работи на вашия хардуер, че корекции приземна със своя флаг, и че продължилия цикъл зареди контролна точка вие кръстена. Циклове две и три са където степен трябва стартира движене. Ако то има не движене до цикъл четири, проблема е изходящ на DAgger.
| Пишете надолу по цикъл | Защо то материал по-късно |
|---|---|
| Контролна точка че е управляван | Без то вие не може атрибут подобрение към смес |
| Режим вход използван за преемствено | Клавиатурни корекции грубо отколкото лидер корекции, и то показва в данни |
| Брой циклове и как всеки е триагиран | Независимо или цикъл е имал достатък корекции към материал |
| Интервенционен процент по цикъл, и средното | Напредък метрика на цикъл |
| Точно епизод избор по източник | Единственото начин към възстроиц или отмяна цикъл |
| Топло старт или свежо обучаване | Обяснява загуба крива вие ще вижте в седмица |
Ако вие направо не имате контролна точка
Цикълът има не въвод-точка без един. Запис първи набор от данни, обучи първи политиката, цикъл то - запис, обучение и управление политиката покрит че пътя. Запис клиент е на страница надолу, GPU нива и почасово степени на страница цена, и какво полезна епизод изглежда в SO-100 събира данни ръководство. Получи демонстрации право преди корекции: DAgger е поправка механизма, и то работи далеч по-добро на нещо че е почти право вече.
Може ли аз цикъл DAgger цикъл без лидерска ръка?▾
Да. Изберете клавиатура или пълзащо входен режим кога вие натиснете Преемствено: преемствеността е незабавна и ръчна, със не втора ръка към съравяне. Клавиатура изпраща относителни подтици че сървър захващане трудо при 2 градуса по съединение и 4 за захват; пълзачи изпращат абсолютна цел и сървър придвижи най-много 6 градуса към то по вызов, докато интерфейсът держи потока. Действие колона и интервенция маркиране са същия както в лидер режим, така че корекции са неразличима в набор от данни.
Колко много корекции прави един цикъл нужда?▾
Няма защитаван универсално число, и кадър брой материал повече отколкото епизод брой. Работна правило е че корекции трябва не са загубени в смес: със 200 оригиналния епизоди и три корекция епизоди, нищо ще придвижи. Прицел за корекции че покрит отказ поведение от няколко начин конфигурации вместо три повторения на същия спасяване.
Защо е обучаване на само корекции такъв лош идея?▾
Тъй като корекции са почти целия трудна средната на задача. Подход, съравяне и отстъпление са липсва, така че политиката губи какво то вече направи добро докато подобря при част вие закрепване. Запазване стара данни и добавяне към то е механизма себе, не незадължителна екстра.
Прави продължаване от контролна точка възстановяване предишния обучаване цикъл?▾
Не. Тежест-само контролна точка възстановява параметри и нищо другое: оптимизатор моменти, график темп учение позиция и ред данни стартирам свежо. То е топло старт, и начално загуба скок е очаквано скорше отколкото симптомът. Пишете надолу който на двата вие действително направиха, така че вие прочета крива правилно седмица по-късно.
Какво ако интервенционен процент не пада?▾
Спрете добавяне циклове. Плоска степен означава корекции не учат какво вие мислите. Обичайни причини са изходящ: камера придвижи, корекции стартирам твърде късно да бъдат избягване данни, предаване кадрове е в обучаване задайте, или задача е неопределен от наблюдения политиката действително получава.
Никой на това е решена проблема и никой на то е един клик. Интерактивно имитационно обучение е активна изследване област точно тъй като своя въпроси - кога към интервенция, как към тежест какво човешкото направи, колко много стара данни към запази - има не уредени отговори; изследване чрез Целемин et al. карта какво все още е отворен. Какво цикълът прави имат е мерена събеседнай кога то е цикъл внимателно, на хардуер че разходи няколко сто евро. Замразете установката, интервенция рано, триагиране честно, смес умишлено, и запис интервенционен процент всеки път.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started