
Обикновеният DAgger иска човек да обозначи състояния докато роботът все още вози. На реално хардуер това е небезопасно и произвежда лоши етикети. Вариантите с портал заменят слепото обозначаване с портал, който някой трябва да държи: човекът в HG-DAgger, класификатор за безопасност в SafeDAgger, несъгласие на ансамбъла в EnsembleDAgger, смета за новост и риск в ThriftyDAgger. Тази статия ги сравнява по това кой е собственик на портала, кой сигнал го отваря и какво всеки струва — и защо формата с човешко управление е тази, която оцелява контакт с реален arm.
Клонирана политика отказва там, където тренировъчните й данни спираха. Поправката е да продължим събирането на данни под собственото разпределение на състояния на политиката вместо на демонстратора, което е това, което DAgger прави и което въведението към събиране на набор от данни обхваща от първи принципи. Оставя открит неудобния дял на оригиналния алгоритъм: докато обучаващото устройство вози, експертът е предполаган да каже какво щеше да е направил, за всяко състояние, без да е под контрол.
В симулатор с скриптиран експерт това е безплатно. На маса с реален arm това не е нито безплатно, нито безопасно. Авторите на HG-DAgger изявяват възражението точно: такива схеми за вземане на проби "изискват експертът да предоставя етикети на действия без да е напълно под контрол на системата", което "може да намали безопасността и, когато се използват хора като експерти, вероятно ще намали качеството на събраните етикети поради възприет задух на актуатора" (Kelly et al., 2019). Два отказа се скриват в това изречение: политиката продължава да вози в състояния никой не иска, и етикетите купени с този риск са по-лоши от тези, които човек производи докато държи управлението. Всеки вариант по-долу отговаря на един и същ въпрос — поставете портал на контрол и оставете някой да реши кога се отваря. Те се различават в това кой е този някой.
Кратката версия
- •Вариантите с портал заменят слепото обозначаване с превключвател между контрол на политиката и контрол на експерта. Това, което ги разделя, е кой е собственик на превключвателя.
- •HG-DAgger дава превключвателя на човека и събира само данни записани докато човекът е имал непрекъснат контрол.
- •SafeDAgger му дава на двоичен класификатор, предвиждащ отклонение от референтна политика; EnsembleDAgger изисква нискавариация на ансамбъла и малко разстояние до експертното действие едновременно.
- •LazyDAgger добавя хистерезис, така че контролът не се люлее; ThriftyDAgger портал на новост или преценена риск под явен бюджет на интервенция.
- •Робот-управляваните сигнали имат нужда на нещо, което фино-настроен VLA на arm от любителски клас обикновено липсва: референтна политика, евтин ансамбъл или калибрирана епистемична несигурност.
- •Портала е половината на метода. Какво се случва със сегментите на интервенция след това — смешване, претегляне, събиране — решава дали кръгът е подобрил нещо.
Човешко-управляван и робот-управляван: разделението, което значи
Интерактивното обучение чрез имитация има своя собствена преглед; Celemin и колеги го каталогизират по тип обратна връзка, интерфейс, модел на обучение, потребителски опит, приложение и тест. Разделението, което решава вашето инженерство, е по-просто от някой от тези оси и новото работи го назовава директно: метод е човешко-управляван кога надзорникът реши кога да интервенира, и робот-управляван кога агентът реши кога да поискա помощ (Cai et al., 2025). Всичко останало е машинерия, служеща един от тези два выбора. Търговията е видима от началото: човешки портал струва непрекъснато внимание, и робот портал обещава да върне това внимание — но само ако сигналът, който портала портала, е надежден, и изграждането на този сигнал е собствена изследователска проблема.
SafeDAgger: класификатор, който предвижда собственото си отклонение
SafeDAgger на Zhang и Cho (2016) е най-ранния от тези портали. Заявяване на референтна политика е скъпата част, така че втора, малка мрежа — политиката на безопасност — предвижда дали стойност е вообще стойност. Тя "връща двоичен етикет, указващ дали първичната политика вероятно ще се отклони от референтна политика без да я запрашва". Етикетът се определя спрямо квадратно отклонение L2 между действията на двете политики с праг tau, и класификаторът е монтиран с двоична кръстосана ентропия. По време на изпълнение той решава по състояние дали обучаващото се устройство продължава да вози или референцията поема управлението. Резюмето съобщава по-малко референтни заявки в симулатор за пилотаж на кола плюс ускорение на конвергенцията, което авторите приписват на автоматизиран ефект на учебния план, без да дават цифра за никой.
Уловката е в определението, не в резултатите. Обучението на класификатора изисква действието на референтната политика във всяко състояние, използвано за приспособяване, което предполага, че референцията е друга програма. Ако вашата референция е човек с leader arm, този набор от етикети не е евтин и методът губи свойството, за което е проектиран.
EnsembleDAgger: съмнение и несъответствие, и двете
Menda, Driggs-Campbell и Kochenderfer (2019) третират портала като вероятностен въпрос. EnsembleDAgger "приблизира процес на Гаус, използвайки ансамбъл от невронни мрежи" и чете вариацията на ансамбъла като заместител на доверието: висока вариация означава регион, за разлика от тренировъчните данни, което — предполагайки експертът избягва състояния на отказ — корелира с близост до отказ. Правилото е съединение. Обучаващото устройство може да действа само когато разстоянието L2 между неговото средно действие и експертното действие остава под един праг (несъответствие) и вариацията на предвиденото му действие остава под второ (съмнение). Ако някой отказва, експертът преми управлението. Целта е да се максимизира делът на действиях на обучаващото се устройство, като се ограничава вероятността от отказ; доклада съобщава подобрена безопасност и обучение срещу други варианти на DAgger на обърнат махалник и MuJoCo HalfCheetah.
Това мълчаливо дисквалифицира пълното правило за надзор без ръце. Разстоянието между действието на обучаващото се устройство и експертното изисква действието на експерта в това състояние, в този момент. С скриптиран експерт, в ред. С човек, човекът трябва да произвежда действия непрекъснато — точно товара вариантите с портал са предназначени да отстранят. Членът на съмнение е без ръце; съединението не е.
LazyDAgger: спрете превключвателя от чатерване
Hoque и колеги (2021) атакуваха цена, която по-ранните документи не измериха: самия превключвател. Всяка интервенция "прекъсва друга работа, която човекът прави, причинява задържане с всяко превключване контекст между надзорник и автономен контрол, и изисква време за изпълнение". Портал, който се отваря и затваря десет пъти в минута, е по-лошо от един, отварящ се веднъж за десет секунди, при еднаква автономна дял. LazyDAgger разширява SafeDAgger с асиметрични прагове — по-трудно да влезеш в контрол на надзорник от това да останеш в него — така че системата не трепети на границата. В симулация това "може да намали превключванията на контекст средно с 60% над SafeDAgger на 3 непрекъснати задачи при задържане на модерна производителност на политиката"; в манипулация на фабрика с ABB YuMi то "намалява превключванията на контекст с 60% докато постига 60% по-висок процент на успех от SafeDAgger по време на изпълнение".
ThriftyDAgger: новост или риск, под бюджет
ThriftyDAgger (Hoque et al., CoRL 2021) започва от бюджета на надзорника, а не от политиката. Той "използва научена политика на превключване, за да поиска интервенции само в състояния, които са достатъчно (1) нови, където роботната политика няма референтно поведение за имитация, или (2) рискови, където робота има низко доверие в завършване на задача", с нова метрика за преценка на този риск. Бюджетът е вход, не резултат: вие заявявате колко човешко време ще прекарате. Приложен по време на изпълнение методът "постига 100% процент на успех както в симулация, така и в физически задачи", и потребителско проучване с десет участници, управляващи флот от три робота, наред с концентрационна задача, съобщава, че това "увеличава човешката и роботната производителност с 58% и 80% съответно в сравнение със следния най-добър алгоритъм, като същевременно намалява товара на надзорника". Установката на флот е естественият дом за това работи; Fleet-DAgger по-късно формализира интерактивното обучение на флот с множество робота и надзорници, предлагайки "Възвращаемост на човешкото усилие" като количество за оптимизиране.
HG-DAgger: човекът държи портала
Kelly et al. (2019) отиди на друга страна. Няма политика на превключване. Обучаващото устройство е разгръщане "докато експертът наблюдава, че новакът е влизал в небезопасен регион на пространството на състояние", в което време експертът преми управлението и насочва системата назад. Правилото за събиране е строгия дял: "Етикети на експертни действия се събират и добавят към набора от данни само във време на тези възстановителни траектории, докато експертът има непрекъснат контрол на системата." Нищо не е обозначено докато човекът е наблюдател.
Това не спира при превключвателя. HG-DAgger също така "научава праг на безопасност за метрика на риск, основана на несигурност на модела, която може да се използва за прогноза на производителност на напълно обучения новак в различни региони на пространството на състояние": то записва колко неуверен е бил обучаващото се устройство в моментите, когато човекът е интервенирал, и осреднява последния квартал от тези записи, където обучаващото се устройство най-много прилича на своята окончателна форма. Това не е портал, който робота управляет, но диагностика, която ви казва, където завършената политика се очаква да задържи. Оценката обхваща симулирана и реална световна задача на пилотаж и съобщава подобрена производителност над както DAgger, така и поведение клониране.
Една свързана линия променя какво се счита за етикет. Spencer и колеги' Expert Intervention Learning твърди, че "всякаква количество експертна обратна връзка, seja чрез интервенция или не-интервенция, предоставя информация за качество на текущото състояние, оптималност на действието, или и двете", формализирана като ограничение на функцията на стойност на обучаващото се устройство и разрешена с обучение на интернет без съжаление. Под това четене, разтвори, където човекът наблюдава и не е направил нищо, са слаба положителна доказателство, а не празно. EIL научава избягване на сблъсък от около една минута експертна управления.

Варианти един до един
| Метод | Кой отваря портала | Сигнал | Необходима наличност | Съобщено |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Никой — обучаващото устройство всякога вози | Нито един; експертът обозначава всяко посетено състояние | Експерт, способен да обозначи в-политика състояния докато не е под контрол | Намаляване без съжаление с гаранции под разпределението на състояние на обучаващото се устройство |
| HG-DAgger (Kelly et al., 2019) | Човешкия надзорник | Преценката на надзорника, че състоянието е небезопасно | Някой наблюдава, и чист handover на контрол | Бие DAgger и поведение клониране на симулирана и реална задача на пилотаж; също научава праг на риск |
| SafeDAgger (Zhang & Cho, 2016) | Робота | Двоичен класификатор за отклонение L2 от референцията над tau | Заявяема референтна политика за етикети на класификатора | По-малко референтни заявки в симулатор на пилотаж, по-бърза конвергенция (без дадена цифра) |
| EnsembleDAgger (Menda et al., 2019) | Робота | Вариация на ансамбъла и разстояние до експертното действие, и двете под праг | Ансамбъл от мрежи плюс действието на експерта при всяка стъпка | Подобрена безопасност и обучение на махалник и HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Робота, с хистерезис | Сигнал на SafeDAgger с отделни прагове на влизане и изход | Какво SafeDAgger е нужен, плюс втори праг за настройка | ~60% по-малко превключвания на контекст на 3 задачи; 60% по-висок успех на YuMi фабрика |
| ThriftyDAgger (Hoque et al., 2021) | Робота, под бюджет | Новост, или преценена риск от не завършване на задача | Научен риск оценител и заявен бюджет на интервенция | 100% успех по време на изпълнение; потребителско проучване (N=10): 58% и 80% печалби над следващия най-добър |
| EIL (Spencer et al., 2020) | Човекът — не-интервенцията също пътува | Интервенция и нейния липса като ограничения на функцията на стойност | Обучение на интернет без съжаление над ограничение на стойност | Избягване на сблъсък от около една минута експертна управление |
Какво всеки портал купува и какво разходува
Прочитайте надолу колона "необходима наличност" и модел отпада: всеки робот-управляван сигнал там е заместител, който трябва да бъде изработен, и всеки заместител има собствения си сметка.
- Сигналите за несъответствие (SafeDAgger, LazyDAgger, половина на правилото на EnsembleDAgger) имат нужда на референтна политика. Или имате скриптиран експерт, в случай на което интересната проблема е вече разрешена, или човек продължава да произвежда действия на фона, така че разстояние може да бъде изчислено.
- Сигналите на съмнение имат нужда на калибрирана епистемична несигурност. Ансамбъл от малки контролни мрежи приблизира то; ансамбъл от модел на виждане-език-действие от три милиард параметри е проблем на памет и задържане първо.
- Сигналите за новост и риск имат нужда на научен оценител на завършване на задача, монтиран на достатъчно успешно и отказал разгръщане. На задача, които вие все още се опитват да направите да работи, че данните не съществува в кръг един.
- Човешкия портал е нужен внимание и нищо иначе — единственият сигнал наличност на ден един, на всяка архитектура на политиката, с не допълнителен модел за обучение.
- Никой робот портал не отстранява човека от стаята. Те намаляват колко често човекът трябва да действа, не дали трябва да бъде налице.
Има по-тихо разлика в това какво портала производи. Робот портал палив мид-траектория ръка човек движещ arm на произволна поза. Човешкия портал позволява операторът изберете момента — след достъп, преди хват, не наполовина през люлка. Възстановителните сегменти от двете не са еднакво чист, и тези сегменти са целия продукт на кръга.
Защо формата с човешко управление печели на реален хардуер
Това е инженерен аргумент, не резултат на тест — няма документ, който намерихме, който работи всички пет портали на същия манипулатор със същия клас политика. То стои на четири точки.
Първо, надзорника е там така или иначе. Никой не оставя SO-100 arm работещ без присмотър до обекти, които то може да обърне. Веднъж някой наблюдава, пределната цена на даването им бутон за преми управление е близо нула; изграждане на калибрирана риск оценител е проект.
Второ, несигурност, която наистина можете да измерите на модерна политика често е погрешния количество. Дифузия или головка с поток-съответствие произвежда вариация напрекъс пробирани действия парчета, и че вариация отразява многомодалност главата е била обучена да представлява, не епистемична невежество относно состояние. EnsembleDAgger's съмнение член използване ансамбъл точно за улов последния. Двете изглеждат еднакво число и не са; на разбиване на действие и потока съответствие записи покриват как тези главите излъчват действия на първо място.
Трето, откази, които значение в манипулация, често са семантични, а не статистически необичайни. Политика затварящ захвата две сантиметра рано, или отмяла с доверие за грешни един от две еднакви кубчета, не е в висока-вариация състояние — то е уверено и неправилно. Няма вариация праг уловката, че; човек наблюдава улови то веднага.
Четвърто, качество етикет — оригиналния HG-DAgger точка, и един често прескочени. Етикети събрани докато човек е имал непрекъснат контрол бие етикети разказани на движещ система. Ако целта е коректни данни стойност събиране, товара на доказателство лежи с автоматизиран портал.
Картината превърта кога един надзорник е отговорен за много робота — режима ThriftyDAgger's потребителско проучване и Fleet-DAgger's формализиране целевата. С флот, човешко внимание е редкия ресурс и несъвършена разпределение бие нито един. С един arm на един работен плот вие не сте в че режима.
Човешко-управлявания цикъл, вече монтиран нагоре
Преми управление по време на работещ сеанс на вход, на-кадър интервенция знамена на коректни сегменти, кюриране всеки бягане в коррекции или оценка, композиране смешан набор от данни от правилата вие избирате, и продължаване обучение от съществуващ checkpoint са вграден, а не скриптиран ръка. Преми управление работи със лидер arm, или със клавиатура и слайдери ако вие нямате един.
Вижте как DAgger цикъл работиПортала е половина на метода; обработка на данни е другия половина
Портала решава кои кадри човек вози, не какво да направи със тях, и че вторият решение е където кръгове най-често трошокат. Първото правило е един D в DAgger стои за: събирам, не заменя. Фино-настройка checkpoint чисто на няколко сто коррекция кадри дава вам модел, който е видял почти нищо, но възстановления и е забравил номинални траектория.
Второто правило е че интервенция кадри не са обикновени кадри. Mandlekar et al. построен дистанционно-телеопериране система за 6-DoF манипулация позволяване оператори наблюдава политики и преми управление при отказ, тогава обучения повторено със алгоритъм че "поощрява политиката научите как пресечка пръстени чрез интервенции"; агенти обучени на че данни превъзходил агенти обучени на равен брой обикновен демонстрация проби. Sirius натиска идеята в развитие, "пре-тегл обучение проби със приблизител човешко доверие и оптимизиране политики със претеглени поведенски клониране". И двете имат нужда на на-кадър маркер на какво е човек-вози, който е защо на интервенция флаг материя повече от то изглежда.
Третото правило е че автоматичен смесване е капан. Сложен набор от данни чиито правилата вие не могат да изброя е един вие не можете отладка кога следващ кръг получава по-зле. На тази платформа на съставляват стъпка е ясно за че причина — оригинален набор от данни плюс коррекции, селекция на епизод на правилата, и резултатът е обикновен LeRobot набор от данни че синхрон и обучения както всеки други; на документ на набор от данни покрива на правилата страна.
| Стъпка в а кръг | Какво то производи | Най-обикновена начин то е всички неправилно |
|---|---|---|
| Бягане вход със запис на | А бягане под политиката на собствено състояние разпределение | Записан като обикновено телеопериране, губещ че политика е била вози |
| Преми управление при отказ | Коррекция сегменти със на-кадър интервенция флаг | Коррекция козметичен трепе, обучение стил, а не възстановление |
| Curate всяка епизод | Коррекции, оценка, или отхвърля | Пазене всички; а ощо преми управление разходи повече от епизод е за бил стойност |
| Sync на коррекции | А версионирани набор от данни поред оригинален | Коррекции че никога оставляк на локален машина |
| Съставя смешаното набор от данни | Оригинален плюс коррекции, ясно селекция | Мълчаливо автоматичен-смесване, така че по-късно регресия не може да бъде проследени да правилата |
| Продължи от а checkpoint | А checkpoint инициализирани от предходния един | Очаква оптимизатор резюме; те тежести инициализирам модела, те не възстановление оптимизатор състояние |
Настройка а портала човек наистина може да задържа
"на човека решава" не е а спецификация. Два оператори със различни прагове производство несравнимо кръгове, и ослабване праг производство а тренд вие не може да прочетете. Напишете на спусъци надолу преди първото бягане.
- Назови на условия че отваря портала — подход отключено по повече от а фиксирани маржа, хванане затварящ на нищо, а съединение дрейф към маржа, а спирач на повече от а второ или два — и задържа на списък непроменен за на кръг.
- Назови какво не отварям то. Превишаване че политика възстановления от на собствена е обучение сигнал; преми управление там бризгане възстановление то вече знае.
- Преми управление рано достатъчно за а чист handover, раздават обратно веднъж че състояние е възстановим.
- Записа защо вие преми управление, на епизод. Три кръгове по-късно то е на единственият запис от дали на същия отказ връща.
- Задържа камери, задача текст и оператор постоянен напрекъс кръгове. Промяна един и числата спирам бъде сравнимо.
Механично на handover има два варианти. През а лидер arm, на лидер трябва да достъп на привърженик на текущо поза преди крушаване трансфери, или на arm скокове; това подравняване преместване е на най-малко-тестирани част на цепа на реален хардуер. Без а лидер arm на преми управление е ръчно от първото keypress: на привърженик е държани и на оператор nudges то съединение по съединение от на клавиатура или прави слайдери, със сървър-страна щипки задържане всеки вход малка — а двойка градуса на keypress, а пъстък на слайдер ъпдейт, защото а голяма стъпка в а държана поза е как вие прохвърлят а servo. На стъпка-до-стъпка версия със клавишни привързвания е в пътьводител на а DAgger кръг на ан SO-100; фон на и двете телеопериране режими е в на телеопериране docs и на лидер-привърженик запис.

Четене дали портала направи всичко
На метрика на а човешко-управляван кръг е на интервенция тариф: интервенция кадри разделени по кадри на бягане. То има един работа — ако то не попада напрекъс кръгове, на кръг купи нищо, и на следващия един трябва промяна нещо иначе, отколкото на количество на данни.
То е а пристрастен метрика и вие трябва да знаят как. То мери на оператор на праг толкова много както на политика на компетенция, което е защо на спусъци списък остава фиксирани; ан оператор кой отпуска над а сеанс производство а падащо крива със нищо зад то. То също пренебрегва тежест — десет кадри да спри сблъсък и десет да nudge а хванане изглед еднакво. Двойка то със а фиксирани оценка комплект никой коррекция данни е някога били извличане от. на статия на измеряне а DAgger цикъл работи чрез на оценка дизайн, включително как да задържа оценка епизоди, от на обучение микс.
- Работи на ден един, на всяка политика архитектури, със не допълнително модел за калибрирам
- Улови уверено-и-неправилно откази никой вариация праг открива
- Производство коррекции записан докато на оператор имаше пълна контрол, при а момент те избра
- Приноси а на-кадър маркер че интервенция-претеглени методи както IWR и Sirius потребител
- Разходи непрекъснато надзор; то не мащаб към един човек и много робота
- Зависи на оператор постоянство — а дрейф праг развята на интервенция тариф
- Производство не риск модел на собствено; HG-DAgger's научени праг и ThriftyDAgger's оценител са допълнително машинерия
- Отчети кадри, не последствия
- Не може спасение а политика чиято отказ е нагоре-поток на контрол, както а преведени камера или а mislabelled задача низ
Отворени въпроси стойност пазене в преглед
На тестове са слаби. Spencer и колеги разгледа тези използван да тестват имитация обучение подходи и намерени им "реализуемо и просто и поради това недостатъчно за улов на по-трудно режими на грешка нарастване видени в реален-свят решение правене проблеми" — и, спрямо околния литература, намерени обикновен поведенски клониране направи добре на тях. Че е причина да бъде скептични на всяка класиране на DAgger варианти лежа на тези задачи, включително някои числа в таблица отгоре.
Робот портали на голяма политики не са разрешени или. На AIM работа заменя несигурност със заместител Q-функция подражават на човешката интервенция правило и съобщава а 40% подобрение в преми управление разход и обучение ефективност над ThriftyDAgger — в непрекъснат и отделен контрол, не на виждане-език-действие модел вози а манипулатор. Дали някой от тези портали прехвърля към а фино-настроен VLA е отворена. На преглед прави связана точка: на поле на терминология и структура не са обединени напрекъс на литература, които прави методи трудно да сравня. На вашата собствена arm, вашата логи са на доказателство вие имате.
Е HG-DAgger наистина DAgger ако човека само етикети по време на интервенции?▾
То задържа че част че материя — данни събрани под състояние разпределение на обучаващото се устройство индуцира, събрани със какво дошло преди — и отвратя че част че не оцелява контакт със хардуер. Kelly et al. представи то като варианта; на 2011 не-съжаление гаранция не носи край непроменен.
Мога ли използвам а робот портала на а фино-настроен VLA политика на ан SO-100?▾
Не прав. SafeDAgger на класификатор трябва а заявяема референция политика вие не имате. EnsembleDAgger трябва ансамбъл, който за а мулти-милиард-параметър модел означава няколко копия в памет плюс те вход разход. ThriftyDAgger трябва риск оценител монтирани на успехи и откази че не съществува преди вашата първо кръгове.
Колко дълго трябва един един преми управление бъде?▾
Дълго достатъчно за достъп а състояние политиката може да продължи от, и не по-долго: разширен преми управления превръща бягане в демонстрация сеанс и наводнения коррекция комплект със номинални поведение. LazyDAgger's намиране разрязва други начин че — много много кратка превключване са те собствену разход.
Трябва ли ми обучи само на коректни сегменти?▾
Не — че е най-обикновена начин да трошокат а кръг. А модел фино-настроен само на възстановления е видял почти нищо, но възстановления. Микс коррекции в на оригинален набор от данни със правилата избрани ясно; да отида по-далеч, погледни на интервенция-претеглени подходи както IWR или Sirius, които нагоре-тежест човек-вози кадри, а не изолира тях.
Какво ако на интервенция тариф не падат след а кръг?▾
Вземете то в лице стойност: кръг не помогни. Преди добавяне коррекции, провери на евтин обяснения — направи оператор на праг дрейф, беше коррекции козметичен, направи съставляват набор от данни наистина съдържани тях, е обучение инициализирана от на предполагаемо checkpoint. А кръг че мълчаливо започна от база модел изглед точно както а кръг че откази научи.
Е не-интервенция носи информация?▾
При Expert Intervention Learning, да: разтвори където надзорник наблюдава и не действаше са чета като слаба доказателство че състояние и действие беше приемливо, формализирана като ограничение на функцията на стойност. Най-практичен тръбопроводи, включително този един, маркер само какво човека вози.
За един един arm на а работен плот на избор е направена: задържа портала себе си, напишете надолу какво отварям то, и прекарвам на усилие на данни обработка зад то, а не на автоматизиране на превключвател. На платформа страна е описан на на DAgger цикъл страна, обучение варианти на политика семейство под обучение и цена. За фон, начало със имитация обучение и имитация обучение на на SO-100; за първо бягане, бягане вашата първо политика е на по-кратко пътя.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started