
Behavior cloning монтира политика врз дистрибуцијата на состојби на експертот и потоа се распределува самостојно. Разликата помеѓу овие две дистрибуции е зошто политика која изгледа добра при валидација исчезнува од маса на чекор 300. Ова е теориската поглавја од нашата DAgger серија: од каде доаѓа членот со квадратна грешка, што се менува при dataset aggregation, што го претпоставува доказот без жалење, и кој дел од сметката човечкиот експерт мораше да плати.
Постои одредено отказивање коешто секој кој обучува политика за манипулација посетува порано или подоцна. Политиката допира до коцка, се приближува за два сантиметра, хезитира, се поместува странично, потоа прави нешто без врска со задачата. Валидациониот загуб беше добар. Отворена повратна репрезентација против одложени епизоди беше добра. И сепак раката завршува во поза која нигде не се појавува во обучувачките податоци, и од таму нема ништо паметно што да каже.
Тое отказивање има име и утврдена теорија зад неа. Ова е првиот од четири написи на DAgger, и се однесува на аргументот самиот: зошто поместување на политика врз сопствените траекторијалите на демонстраторот создава грешка која може да расте со квадратот на должината на епизодата, што промени dataset aggregation, и што обещанието без жалење не ветува. Циклусот на вистинскиот хардвер е опфатен во извршување на DAgger циклус на SO-100, варијантата со човечка врата во HG-DAgger и интервенции со човечка врата, и прашањето за мерење во мерење на DAgger циклус.
Краткото издание
- •Behavior cloning обучува врз дистрибуцијата на состојбите на експертот и се евалуира врз сопствената. Несовпадувањето се наслоју над епизодата.
- •Ross и Bagnell покажаа дека дополнителниот трошок може да расте како T квадрат пати грешката по чекор; DAgger написот го повторува тоа врзување и забележува дека е тесно.
- •DAgger означува состојби коишто политиката самата ја посетува, и преквалификува врз секој собран датотека досега, не само новото.
- •Гаранцијата е намалување на no-regret онлајн учење: агрегирање и преквалификување е Следи-го-Лидерот.
- •Тоа держи релативно на најдобриот загуб достижен во класа политики, не релативно на нула - и експертот сепак мораше да означува состојби коишто никогаш не би произведено.
Претпоставката коју behavior cloning шумно прави
Датотеката за демонстрирање е куп парови набљудување-акција. Behavior cloning монтира функција на тој куп со обично надзорно учење и запира таму. Тоа е најстарата идеја во полето. Pomerleau's ALVINN, во 1988, беше тринаслојна мрежа за враќање што земаше слики од камера и лазер опсег찾器 и произведува насока коју возилото требало да патува; беше обучена врз симулирани слики на пат и следеше вистински патни услови под некои услови на ткаење. Рецептот не се изменил многу; мрежите имаат.
Што се прескокува е контрола каде дошле парови. Секој од нив лежи врз траекторија коју произведе демонстраторот. Политиката коју ја распределуваш производи сопствена. Во моментот кога отстапува, таа се запрашува за состојби коишто не беа во дистрибуцијата на обука, и нејзиниот одговор ја движи понатаму. Ross, Gordon и Bagnell го отворивает DAgger написот токму со ова: секвенцијално предвидување нарушува i.i.d. претпоставката под статистичко учење, затоа што предвидувањата на самиот берач одредуваат ги влезовите коишто го видува следен.
Најјасниот приказ во тој напис не е робот воопште. Клонирањето на скоро-оптимална планериште за Super Mario Bros. создаде политика која неодамна вставаше против препрека наместо да скоче. Причината е целиот аргумент во една реченица: експертот секогаш скачаше од удобна растојание, па датотеката не содржеше состојба во која Mario беше притиснат против препрека, и затоа не имаше ознака за што да прави откако беше.
Замени Mario за SO-100 рака и структурата е идентична. Вашите демонстрации покажуваат чист приход и чист захват, не затворач две сантиметри кратко - па политиката нема идеја што да прави од таму, и што е не погрешно ја движи понатаму. Covariate shift е својство на постапка за собирање на податоци, не на архитектурата на мрежата.
Откаде доаѓа квадратниот член
Написот 2010 AISTATS од Ross и Bagnell, Efficient Reductions for Imitation Learning, прави сложеното прецизно. Нека T е хоризонт на задачата, нека трошокот на задачата е врзан во единица интервал, и нека epsilon е заменешкиот загуб измерен под експертов дистрибуција на состојбите - бројот што вашиот валидационен сет го извештува. Потоа дополнителниот трошок од извршување на таа политика за T чекори, релативно на експертот, е врзан од T квадрат пати epsilon. Ross, Gordon и Bagnell го повторува ова како Теорема 2.1 во DAgger написот и го додава предложението коешто има значење: врзувањето е тесно. Проблемите постојат каде политика со epsilon загуб врз дистрибуција на експертот вакаливно повлекува дополнителен трошок растејќи се квадратно во T.
Тесното не значи типично. Квадратниот член е најлош случај преку класа на проблеми, не предвидување за твојата задача за подигање и поставување. Што го утврдува е дека повеќе демонстрирање од експертот не може да ја отстрани проблемот: само го заострува процена на epsilon врз дистрибуција на која политиката нема да биде тестирана.
Излезниот пат е во истиот напис, повторен како Теорема 2.2. Ако политика ја постигне загубата epsilon под сопствена дистрибуција на состојбите, и една погрешна акција чини најмногу u во трошок-до-го во експертот, дополнителниот трошок е врзан од u пати T пати epsilon - линеарно во хоризонт. Константата u е занимливата количина: најмногу 1 за 0-1 неслога со експертот, и O(1) кога експертот може да се врати во неколку чекори. Во најлош случај тоа е O(T), и линеарното врзување потоа не е подобро од квадратното.
| Поставување | Врзување на дополнителниот трошок врз експертот | Што рели врата на |
|---|---|---|
| Behavior cloning (Ross & Bagnell 2010, повторено како Thm. 2.1 во Ross et al. 2011) | T квадрат пати epsilon | epsilon измерено врз дистрибуција на експертот на состојби; трошок во [0,1]; врзување е тесно |
| Која било политика со epsilon загуб под сопствената дистрибуција (Thm. 2.2) | u пати T пати epsilon | u врза ги трошоците-до-го казна на една погрешна акција; најмногу 1 за 0-1 загуб, O(T) најлош случај |
| Напредна обука (Ross & Bagnell 2010) | u пати T пати epsilon | една политика по временска мара; треба T политики и познат, конечен T |
| SMILe (Ross & Bagnell 2010) | близу-линеарно во T и epsilon врз некои класи на проблеми | alpha во O(1/T квадрат), N во O(T квадрат логирање T); дава стохастичка мешавина |
| DAgger (Thm. 3.2, Ross et al. 2011) | u пати T пати epsilon_N, плус O(1) | N на редослед на uT; силно конвексна врзана загуба; no-regret берач; epsilon_N е најдобриот загуб во хинdsight |

Двата обида коишто дошле пред DAgger
Напредна обука е чесна но непрактична одговор. Обучи одделна политика за секоја временска мара, по редослед, секоја врз дистрибуција на состојби која индуцирана од политиките веќе фиксирани за порани чекори, па секоја политика вида точно дистрибуција коју ќе го дочека. Уловот е во описот: T политики, обучени последователно, без рана запирање. За манипулација епизода во 30 кадри во секунда, T е во стотини.
SMILe, од истиот напис, и SEARN, од работата на Daume, Langford и Marcu врз структурирана предвидување, ја земаат другата рута: една стационарна политика, но стохастичка. Секоја итерација обучува компонента и ја додава на мешавина, поместувајќи ја веројатносната маса далеку од експертот. Резултатот е мешавина во која некои компоненти се полоши од други - врз физичка рака, контролер што може да земе лоша компонента за време на движење. Тоа е утврдената мотивација за сакање стационарна детерминистичка политика наместо.
DAgger: една идеја, една кутија
Dataset Aggregation го чува детерминистичката политика и го движи исправката во собирање на податоци. Секој круг: распологи на моментната политика, забележи состојби коишто ја посетува, прашај експертот што би била правилна акција во секоја, додај парови во датотеката коју веќе имаш, преквалификувај врз синдикатот. Името е алгоритмот - агрегираш, никогаш не отстрануваш.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setТри деталји имаат повеќе тежина отколку што изгледаат. Етикетите се за состојби посетени од страна на мешаната политика, но акциите доаѓаат од експертот - политиката ги обезбедува прашањата, експертот одговорите. Преквалификувањето е врз целиот агрегат, што прави секој круг Follow-The-Leader чекор: во круг n избираш најдобра политика во хинdsight преку секоја траекторија досега. Тоа е оквир на кој доказот се зависи. И алгоритмот завршува со враќање најдобра политика во секвенца како избрана врз валидационен сет, затоа што теоремите гарантираат дека некоја политика во секвенца е добра, не дека последната е.
Бета распоред, и зошто не е клучка за подесување
Мешаната политика е beta_i пати експертот плус еден минус beta_i пати берачот. Поентата е практична: первачките научени политики се обучени врз многу мали податоци, прават многу грешки, и иначе би потрошиле распологување во состојби коишто станало неважно откако политиката се подобрува.
Теоријата налагува точно една услова: трчачката просечна на betasите мораше да одеја на нула. Анализата работи со beta_i врзана од (1 - алфа) до моќта i-1, за константа алфа независна од T.
| Распоред | Што прави | Што написот извештува |
|---|---|---|
| beta_1 = 1 | Первиот круг е чиста демонстрирање од експертот; начална политика не е потребна | Препорачаната почетна точка во секоја варијанта |
| beta_i = 1 ако i = 1, инаку 0 | Експертот само во првиот круг; без слободен параметар | Беспараметарската верзија на написот, која вели често перформа најдобро во практика; 2980 врз Super Mario Bros. после 20 итерации |
| beta_i = p^(i-1) со p = 0.5 | Експертна веројатност се распаѓа геометриски | 3030 врз исто мерило, малку напред од беспараметарската верзија |
| beta_i = p^(i-1) со p = 0.9 | Експертот останува во циклусот далеку подолг | Назначено поспоро конвергирање; сепак се подобрува кога 20 итерации завршија |
Разликата помеѓу 2980 и 3030 врз скала трчаща до грубо 4300 е мала, но объаснението на написот за неа е најкорисната практична забелешка во делот. Со беспараметарскиот распоред, Mario вставаше во исто место порано и генерираше маса скоро-дуплично податоци од таа една локација; дозволување експертот да ја вози удела на време Нее двајцата обиде неговегодината и проширена разноликост на состојби. Распоредот е помалку за коефициентот за мешање отколку за ответност збирањето на твои податоци произведува нови состојби или исто отказивање.
Стохастичка по-временска мешавина значи смена на контролната власт во контролна мара, 30 пати во секунда врз типичен SO-100 постав. Ниедна телеоперирана интерфејс го прави тоа безбедно или смислено. Врз вистински хардвер бета распоред дава пат на човечка одлука за кога да биде во контрола: различит алгоритам со различито анализа.
Гаранцијата: намалување на no-regret онлајн учење
Ево потег кој го прави написот што е. Третирај секој DAgger круг како еден пример во онлајн учење проблем, каде загубата во круг i е заменешката загуба под дистрибуција на состојби на политиката користена во круг i. Берачот се обврзува на политика пред видување таа загуба, и секвенца е нестационарна затоа што зависи од политиките произведени досега.
Алгоритмот е no-regret ако неговата просечна загуба преку N круги се приближува на оние од најдобра единечна политика во хинdsight. Follow-The-Leader врз силно конвексни загуби е таков алгоритам, со просечно жалење се намалува врз редослед од 1/N - и преквалификување врз целиот агрегат е точно Follow-The-Leader. Која било друга no-regret берач би служила: анализата е намалување, не својство од еден оптимизатор.
Една лема ги мостува јазот помеѓу мешаната политика што ги собра податоци и научената политика што би била распределена: Лема 4.1 врза ја L1 растојаност меѓу нивни дистрибуции на состојби од 2 T beta_i. Ова е зошто betasите мораат да се распаѓаат - додека експертот сепак има апреци контролна власт, состојбите што собираш не се состојбите коишто твојата политика ќе произведе. Комбинирај лема со врзување на жалење и главниот резултат следува: после грубо T итерации, некоја политика во секвенца има заменешката загуба под сопствената дистрибуција во O(1/T) од epsilon_N. Напојувај тоа во линеарното врзување и сте соба во Теорема 3.2.
Емпириската страна е скромна врз моментни стандарди. Во Super Tux Kart надзорната основа не се подобри неговиот просечен падаше по лап кога повеќе податоци дошле, DAgger достигна политика која никогаш не падна од писта после петнаесет итерации, и SMILe после дваесет сепак падна грубо двојно по лап. Врз рачно пишување мерило, знакова точност трча 82 процент без структура, 83.6 процент надзорно, 85.5 процент со DAgger. Ниедно од овие не е манипулацииски резултат.
Што доказот не ветува
Утврдувањата на теорема се условни, и условите се товари-носачи.
- Врзување линеарно наместо квадратно во T, под наведените предпоставки.
- Стационарна детерминистичка политика наместо стохастичка мешавина.
- Вистинско намалување: која била no-regret онлајн берач вклучува во.
- Конкретна број итерација - грубо T круги пред жалење член престанува да има значење.
- Гаранција за барем една политика во секвенца, оттаму затворана валидациона пас.
- Тоа е релативно на epsilon_N, најдобриот загуб во класа во хинdsight, не на нула. Ако твојата класа не може да го претстави експертот, таа е празна во практика.
- Таа треба a no-regret метод или силно конвексна заменешка загуба - посилна од класификациони редукција што го гради врата, како го забележуваат авторите.
- Константата u може да биде O(T) во најлош случај, и линеарното врзување потоа се сломува назад во квадратно.
- Таа врза итерации, не експертни етикети. Врз робот, етикети се буџет.
- Таа претпоставува експертот може да биде прашан во секоја посетена состојба и одговара правилно таму. Таа претпоставка е целиот трошок.
Еден понатамошен резултат често е наведен како опреченција и не е еден. Rajaraman, Yang, Jiao и Ramachandran учат на minimax границите на imitation learning во епизодични MDPs со конечна состојба простор S и хоризонт H, и докажуваат подоптимална долна врзување врз редослед од |S| H квадрат врз N што држи дури и кога берачот може активно да го прашаше експертот во посетени состојби. Таа е најлош-случај стапка преку класа на MDPs во фиксен епизоден буџет, и што ја исклучува е идејата дека интеракција ја подобрува minimax стапката; DAgger теорема е различно утврдување, врзување распределена политика релативно на што нејзина сопствена политика класа може да достигне.
Swamy, Choudhury, Bagnell и Wu подоцна класификувале овие алгоритми по кои моменти на експертско однесување коишто се поклопуваат, и воведоа поим на момент опоравливост што диференцира колку добро секое семејство смалува сложена грешка. Проверки од Osa и од Celemin го покриваат алгоритмичкиот пејзаж и хуманата-повратна интерфејси.
Сметката: означување на состојби експертот никогаш не произведе
Сè горево претпоставува експертот што може да биде прашан навсекаде. Во симулација со планериште што е скоро слободна - експериментите Mario користеја скоро-оптимална планериште со целосен пристап до стање на игра. Со човек врз робот е доминантен трошок, и особен: човекот мораше да произведе правилна акција во конфигурација твоја сопствена компетентност никогаш не би создала.
Kelly, Sidrane, Driggs-Campbell и Kochenderfer ја постават противречката директно во HG-DAgger написот. Ванилична DAgger бара експертот да обезбеди акционо обелешја додека не е целосно во контрола на системот. Ова го намалува безбедностат, и со човечки експерти веројатно ќе ја деградира квалитетот на собраните обелешја, коишто ги приписуваат на перцепирана актуатор заостаток. Обелешјето коешто добиваш назад не е обелешјето алгоритмот го претпостави.
Laskey и колеги ја нападаат проблемот од другата страна со DART, и нивната рамка е директна: on-policy техники се досадни за човечки наспротивставувачи, додај компјутерски товар, и може да посетат опасни состојби за време на обука. Нивна алтернатива вбризгува калибрирана бука во сопствените демонстрирања на супервизор, па опоравување ја добива демонстрирана без робот икогаш запредела недоверена политика. Врз MuJoCo Humanoid ја извештуваат DART намалување супервизор кумулативна награда од 5 процент за време на обука, додека DAgger извршува политики со 80 процент помалку кумулативна награда од супервизор; врз захватување во неред со Toyota HSR, просечно 62 процент зголемување врз поведенско клонирање.
Zhang и Cho's SafeDAgger ги третираат прашања до референца политика како скапа ресурс: одделна безбедност политика предвидува, без прашување, дали примарна политика е за отстапување од референца надвор од прак, и само тие состојби се кренат врата. Сите три реактивни во исто факт - DAgger анализа наплати ништо за експертни обелешја, и реалност наплати голем износ.
Обелешје од-дистрибуција состојби е менталното потешко од демонстрирање на задачата. Нормална демонстрирање значи извршување моторен план коишто веќе имаш. Корекција на политика коју е ставила затворач некаде би никогаш не значи конструирање опоравување на место, под временски притисок, со робот сепак движи. Очекување помалку корисни минути по сесија отколку во простојна запис сесија, и гледајте твој сопствен корекција квалитет распад преку курс на еден.

Што ова значи за SO-100 врз твојата маса
Преведи хоризонт во твои единици. Дваесет-втор епизода во 30 кадри во секунда е 600 одлука чекори, и T во секое врзување горево е таа број. На T = 600, разликата помеѓу термин мер со T и еден мер со T квадрат е разликата помеѓу политика што се опоравува од лош приход и еден што не.
Ово е дел од зошто акција chunking помага: кога политика емитува кратка секвенца акција по чекор за оспособување, бројот на одлука точката падаат, и исто напаѓање допринес. Zhao, Kumar, Levine и Finn го имену сложена грешка како мотивација за Action Chunking со Transformers, и извештај 80 до 90 процент успех врз шест потешка вистинска-свет задачи, врз ниско-трошок bimanual хардвер, од десет минути вредност од демонстрирања. Chunking не отстрану covariate shift - состојбите сепак се сопствена политика - но скратување ефективен хоризонт. Видете акција chunking и SO-100 imitation learning водич.
Втора превод е напредок метрика. Не можеш мерка epsilon под сопствена политика дистрибуција директно - таа треба вистински експертни акции за секоја посетена состојба, работ ти си пробувач избегни производ. Што човечка-врата циклус те дава наместо е интервенција стапка: удел од кадри во трчање за време на човек беше преземе. Таа е прокси, и се движи за разлика без врска на политика - пациентен оператор интервенирање помалку. Користено конзистентно, таа е еден број коешто казува или круг вредна од попладнина.
Трета превод е податоци-квалитет предупредување анализа не го покрива. Mandlekar и колеги учеа шест офлајн учење алгоритми врз пет симулирана и три вистински-свет мулти-сцена манипулација задачи, и извештај чувствителност на алгоритмични дизајн избори, пореден врз квалитет од демонстрирања, и варијабилност причина од запирање критериј. Belkhale, Cui и Sadigh спорадуваат датотека квалитет требало биде формализирана преку акција дивергенција и преход разноликост, и забелешке таа состојба разноликост не е секогаш подобра. DAgger круг додава состојби никој не избра намерно: некои се опоравување податоци требача требаш, некои се робот flailing додека ти fumble за преземе контрола.
Механички круг е шест чекори: трчање оспособување со запис врата, преземе кога политика мисбеhaves, ревидира трчање и датотека секоја епизода, sync коригирања, составување мешан датотека од оригинали плус коригирања со епизода селекција направена експлицитно по извор, и продолжува обука од предноемонен checkpoint наместо база модел. На ay-robots тие чекори постојат како копче, коишто отстрану водовод но не судење. Две опасности: продолжување од checkpoint инициализирање тежина и не е оптимизатор резиме, и лидер-рака поврзување движење е сепак светло тестирана врз хардвер. Видете обука и датотеки.
DAgger циклус, веќе жичана врата
Преземе за време на живо оспособување трчање, по-кадар интервенција обелешје, датотека епизоди како коригирања или евалуации, составување мешан датотека со експлицитна епизода селекција по извор, и продолжување обука од постоечка checkpoint сите се вградена. Ти сепак одлучиш кога преземе и што задржи - таа дел не автомати.
Видете како DAgger циклус работиСемејство дрво, во еден табела
| Метод | Кој избира состојби | Што експертот обезбедува | Главен трошок |
|---|---|---|---|
| Behavior cloning | Експертот | Чиста демонстрирања | Нема опоравување податоци; грешка може сложена квадратно во T |
| Напредна обука | Берачот, по временска мара | Обелешја по индуцирана дистрибуција | T одделни политики; неупотреблива за долг хоризонт |
| SMILe / SEARN | Стохастичка мешавина експертот и берачот | Обелешја по мешавина дистрибуција | Компоненти од мешавина разликуват во квалитет |
| DAgger | Мешана политика, бета пада на нула | Правилна акција за секоја посетена состојба | Обелешје состојби експертот никогаш не произведе, додека не е контрола |
| DART | Експертот, нарушена со вбризгана бука | Демонстрирања под калибрирана бука | Бука мораше биде калибрирана на берачот грешка |
| HG-DAgger | Берачот, додека човек преземе | Коригирања само човечка-врата сегменти | Зависи на човечко судење за кога интервенирање |
| SafeDAgger | Берачот, филтрирана безбедност врата | Обелешја само кога врата прашаше | Врата се мораше биде обучена и доверена |
Често постављени прашања
Ќе го видам вакаливно квадратна грешка раст врз мој робот?▾
Не како чист крива. Врзување е најлош случај: тесно во таа некои проблем достига тоа, не твој. Што видиш е последица - политика што резултат добро врз одложена кадри, неуспеа врз вистинска задачата, и не подобри кога запис повеќе исто. Ако повеќе чиста податоци престану помагање, таа е covariate shift, не податоци-волумен проблем.
Правам ли биде имплементирам бета мешавина да го повика тоа DAgger?▾
Беспараметарската верзија - експертот во круг еден, чиста берачот позади - е легитимна специјална случај и често перформа најдобро во оригинално експериментите. Што не можеш уроди је агрегација: преквалификување само врз новите коригирања ломи Follow-The-Leader интерпретација, коешто е каде no-regret аргумент доаѓа од. Обука врз коригирања алт е многу полаба постапка.
Зошто враќ најдобра политика врз валидациона сет наместо последна?▾
Затоа што теоремите гаранција добра политика постои негде во секвенца, не дека тоа е финал итерирање - врзување е на минимум преку секвенца. Отпратување кој излезе од последната рунда отстрану наведена услова од резултат, и последна рунда не е веријатно најдобра.
Колку кругови требало план за?▾
Теоријата сака итерации врз редослед од T, коишто за 600-чекор епизода не е број секој трча врз хардвер. Оригиналните експериментите трча дваесет итерации врз секое мерило. Во практика ти трчам кругови додека интервенција стапка престану падаат, далеку под броју анализа претпоставува - вистински јаз помеѓу теорија и практика.
Што ако мој политика класа едноставно не може да го претстави експертот?▾
Потоа DAgger не те спасува, и врзување казива така - тоа е изразена релативно на epsilon_N, најдобриот загуб во класа во hindsight. Ако таа е голема затоја архитектура грешка, недостасување набљудување или камера што не може видете сцена, агрегација те дава политика таа е оптимална во класа што не може направи задачата. Трчам отворена-циклус пренос врз одложена епизоди пред соберете коригирања.
Каде да одеш од овде
Ако не си обучи политика сепак, таа теорија е предвремено: запис датотека првиот, почнувајќи од обука твои прв политика и desktop клиент. Ако си тежа друго сто чисти демонстрирања против почнување коригирања: чиста демонстрирања не исправи дистрибуција проблем. За механика, продолжи со човечка-врата варијанта и потоа SO-100 пролетање.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started