
Behavior cloning вмъква политика на разпределението на състояния на експерта и след това се разгръща на своя собствено. Пролуката между тези два разпределения е причината политика, която изглежда добре при валидация, слиза от масата на стъпка 300. Това е теоретичният раздел на нашата DAgger серия: откъде идва квадратичният член на грешката, какво променя dataset aggregation, какви предположения прави доказателството за no-regret и каква част от сметката все още трябва да плати експертът.
Има конкретна грешка, която всеки, който обучава манипулационна политика, среща по-рано или по-късно. Политиката достига куба, приближава се до два сантиметра, колебае се, отклонява се встрани и след това прави нещо несвързано със задачата. Loss при валидация е бил добър. Open-loop replay срещу задържани епизоди е бил добър. И все пак ръката завършва в поза, която не се появява никъде в обучаващите данни, и оттам няма нищо разумно да каже.
Тази грешка има име и установена теория зад нея. Това е първата от четири статии относно DAgger, и тя покрива аргумента: защо вмъкване на политика на собствените траектории на демонстратора произвежда грешка, която може да расте с квадрата на дължината на епизода, какво променя dataset aggregation и какво не обещава доказателството за no-regret. Цикълът на истински хардуер е покрит в пускане на DAgger цикъл на SO-100, човешко-управляваният вариант в HG-DAgger и човешко-управлявани интервенции, и въпросът за измерването в измерване на DAgger цикъл.
Кратката версия
- •Behavior cloning обучава се на разпределението на състояния на експерта и се оценява на собствено на политиката. Несъответствието се натрупва през епизода.
- •Ross и Bagnell показаха допълнителното разходи могат да растат като T квадрат по грешка на стъпка; DAgger хартията преповтаря тази граница и отбелязва, че е плътна.
- •DAgger етикетира состояния, които сама политиката посещава, и преобучава на всеки събран датасет досега, не само на най-новия.
- •Гарантията е намаляване на no-regret online learning: агрегиране и преобучаване е Follow-The-Leader.
- •Тя важи спрямо най-добра постижима загуба в класа на политиката, не спрямо нула - и експертът все още трябва да етикетира состояния, които никога не би произвел.
Предположението behavior cloning мълчаливо прави
Демонстрационен набор данни е купчина двойки наблюдение-действие. Behavior cloning вмъква функция към тази купчина с обикновено надзорно обучение и спира там. Това е най-старата идея в областта. Померло ALVINN, през 1988 г., беше трислойна мрежа с обратно разпространение, която взимаше изображения от камера и лазерен скенер на разстояние и произвеждаше посока, в която превозното средство трябва да пътува; беше обучена на симулирани пътни изображения и следваше истински пътища при някои полски условия. Рецептата не се е променила много; мрежите има.
Това, което се пропуска, е проверка откъде идват тези двойки. Всеки един от тях лежи на траектория, която демонстраторът произведе. Политиката, която разгръщаш, произвежда своя собствена. В момента, когато се отклони, тя отговаря на въпроси относно състояния, които не са в разпределението на обучение, и нейният отговор я отдалечава още. Ross, Gordon и Bagnell отварят DAgger хартията с точно това: последователното предсказване нарушава i.i.d. предположението под статистическото обучение, тъй като собствените предсказания на обучаващия определят входовете, които вижда по-нататък.
Най-ясната илюстрация в тази хартия не е робот изобщо. Клониране на близо-оптимален планер за Super Mario Bros. произведе политика, която многократно се зацакляше срещу препятствие вместо да го преследи. Причината е целия аргумент в едно изречение: експертът винаги скачаше от удобно разстояние, затова датасетът не съдържаше никакво състояние, в което Mario е натиснат до препятствие, и затова нямаше етикет какво да направи след като се окажеш там.
Замени Mario със SO-100 ръка и структурата е идентична. Демонстрациите ти показват чист подход и чист хват, не захвата затворена два сантиметра накъсо - така че политиката няма идея какво да направи оттам, и както и да го отгатва, го отдалечава. Covariate shift е свойство на процедурата за събиране на данни, не на архитектурата на мрежата.
Откъде идва квадратичният член
Хартията от 2010 г. на AISTATS от Ross и Bagnell, Efficient Reductions for Imitation Learning, прави натрупването точно. Нека T е хоризонт на задачата, нека разход на задача е ограничен в единичния интервал, и нека epsilon е сурогатна загуба, измерена под разпределението на състояния на експерта - числото, което съобщава набор от валидация. Тогава допълнителен разход на пускане на тази политика за T стъпки, спрямо експерта, е ограничен от T квадрат по epsilon. Ross, Gordon и Bagnell преповтарят това като Theorem 2.1 в DAgger хартията и добавят изречението, което има значение: граница е плътна. Проблеми съществуват, при които политика с epsilon загуба на разпределението на експерта наистина понася допълнителен разход, растящ квадратично в T.
Плътната граница не означава типична. Квадратичният член е най-лошия случай над клас проблеми, не прогноза за вашата pick-and-place задача. Какво установява е, че повече експертна демонстрация не може да премахне проблема: само остря оценката на epsilon на разпределение, което политиката не ще бъде тестирана.
Маршрутът на бягство е в същата хартия, преформулиран като Theorem 2.2. Ако политика постига загуба epsilon под своя собствено разпределение на състояния, и едно неправилно действие струва най-много u в разход-до-цел под експерта, допълнителният разход е ограничен от u по T по epsilon - линейно на хоризонта. Константата u е интересното количество: най-много 1 за 0-1 неъгласие с експерта, и O(1) винаги, когато експертът може да възстанови в рамките на няколко стъпки. В най-лошия случай то е O(T), и линейната граница тогава не е по-добра от квадратичната.
| Установяване | Ограничение на допълнителния разход спрямо експерта | На какво се основава |
|---|---|---|
| Behavior cloning (Ross & Bagnell 2010, преформулиран като Thm. 2.1 в Ross et al. 2011) | T квадрат по epsilon | epsilon измерена на разпределението на състояния на експерта; разход в [0,1]; граница е плътна |
| Всяка политика с epsilon загуба под своя собствено разпределение (Thm. 2.2) | u по T по epsilon | u ограничава наказанието разход-до-цел на едно неправилно действие; най-много 1 за 0-1 загуба, O(T) най-лош случай |
| Forward training (Ross & Bagnell 2010) | u по T по epsilon | една политика на timestep; нужди T политики и известен, крайни T |
| SMILe (Ross & Bagnell 2010) | почти линейно в T и epsilon на някои класове проблеми | alpha в O(1/T квадрат), N в O(T квадрат log T); произвежда стохастична смес |
| DAgger (Thm. 3.2, Ross et al. 2011) | u по T по epsilon_N, плюс O(1) | N на ред на uT; силно изпъкнала ограничена загуба; no-regret обучител; epsilon_N е най-добра загуба в анализ |

Двете опита, които дойдоха преди DAgger
Forward training е честна но непрактична отговор. Обучи отделна политика за всеки timestep, по ред, всяка на разпределението на состояния, индуцирано от политиките вече фиксирани за по-ранни стъпки, така че всяка политика вижда точно разпределението, което ще срещне. Уловката е в описанието: T политики, обучени последователно, без ранна спирка. За манипулация епизод на 30 кадъра в секунда, T е в стотици.
SMILe, от същата хартия, и SEARN, от работата на Daume, Langford и Marcu по структурирано предсказване, вземат другия маршрут: една стационарна политика, но стохастична. Всяка итерация обучава компонент и го добавя към смес, преместване вероятност маса далеч от експерта. Резултатът е смес, в която някои компоненти са по-лошо от други - на физическа ръка, контролер, който може да вземе лоша компонента в средата на движение. Това е декларираната мотивация за желание на стационарна детерминирана политика вместо.
DAgger: една идея, един box
Dataset Aggregation пази детерминирана политика и премества поправката в събиране на данни. Всеки кръг: разгърни сегашната политика, запиши состояния, които посещава, попроси експерта какво би bilo правилното действие в всяко, добави тези двойки към датасета, който вече имаш, преобучи на един. Името е алгоритъма - агрегираш, никога не отхвърляш.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setТри детайла носят повече тегло, отколкото изглеждат. Етикетите са за состояния, посетени от смесена политика, но действията идват от експерта - политиката дава въпросите, експертът отговорите. Преобучаването е на цялата съвкупност, което прави всеки кръг Follow-The-Leader стъпка: на кръг n избираш най-добра политика в анализ над всяка траектория досега. Тази рамка е това на което доказателството се основава. И алгоритъма завършва, връщайки най-добра политика в последователност, както избрана на набор за валидация, тъй като теоремите гарантират, че някои политика в последователност е добра, не че последния е.
Beta schedule и защо не е tunning knob
Смесена политика е beta_i по експерт плюс един минус beta_i по обучител. Точката е практична: първите няколко научени политики са обучени на много малко данни, правят много грешки, и иначе биха прекарали разгръщане в состояния, които станат неуместни след като политиката се подобри.
Теорията налага точно един условие: текущ средна на betasи трябва да отиде до нула. Анализ работи с beta_i ограничена от (1 - alpha) до мощност i-1, за константа alpha независима от T.
| Резултат | Какво го прави | Какво хартията съобщава |
|---|---|---|
| beta_1 = 1 | Първи кръг е чиста експертна демонстрация; начална политика не е необходима | Препоръчаната начална точка във всеки вариант |
| beta_i = 1 ако i = 1, иначе 0 | Експерт само в кръг първи; няма свободен параметър | Параметър-свободна версия на хартията, което тя казва често се представя най-добре на практика; 2980 на Super Mario Bros. след 20 итерации |
| beta_i = p^(i-1) с p = 0.5 | Експертна вероятност намалява геометрично | 3030 на същия бенчмарк, леко напред на параметър-свободна версия |
| beta_i = p^(i-1) с p = 0.9 | Експертът остава в цикъла далеч по-дълго | Значително по-бавна конвергенция; всё още подобряване, когато 20 итерации свършиха |
Пролуката между 2980 и 3030 на скала, която работи към приблизително 4300, е малка, но обяснението на хартията за нея е най-полезната практична забележка в раздела. С параметър-свободна разписание, Mario се зацакля в същото място рано и произведе маса близо-дублирани данни от този един локатор; позволяване на експерт да управлява дял от времето и открива го и разширява разнообразието на состояния. Разписанието е по-малко за съотношението на смешване отколкото дали събиране на данни продължава да произвежда нови состояния или същия отказ.
Стохастична смес на timestep означава превключване на контролен орган на контролен процент, 30 пъти в секунда на типично SO-100 установяване. Никой teleoperation интерфейс правя, че безопасно или смислено. На истински хардуер beta разписание отстъпи на човешко решение за когато да преземете: различен алгоритъм с различен анализ.
Гарантията: намаляване на no-regret online learning
Ево ходът, който прави хартията какво е. Третирай всеки DAgger кръг като един пример в online learning проблем, където загуба на кръг i е сурогатна загуба под разпределението на состояния на политика използвана при кръг i. Обучител се поставя на политика преди видене на загуба, и последователност не е стационарна, защото зависи на политиките произведени досега.
Алгоритъм е no-regret ако него среден загуба над N кръгове приближава на най-добра единична политика в анализ. Follow-The-Leader на силно изпъкнали загуби е такъв алгоритъм, със средна раскаяние свиване на ред на 1/N - и преобучаване на пълна съвкупност е точно Follow-The-Leader. Всеки друг no-regret обучител би служил също: анализ е намаляване, не свойство на един оптимизатор.
Един лема мосты пролуката между смесена политика, която събра данни и научена политика, която ще бъде развернута: Lemma 4.1 ограничава L1 разстояние между техни разпределения на состояния от 2 T beta_i. Това е защо betasи трябва да намалеят - докато експертът все още държи преценяща контролна орган, состояния събирате не са състояния политиката ще произведе. Комбинирай лема с regret ограничение и главен резултат следва: след приблизително T итерации, някои политика в последователност има сурогатна загуба под своя собствено разпределение в O(1/T) на epsilon_N. Хранене, че в линейно ограничение и достигаш Theorem 3.2.
Емпиричната страна е скромна по текущи стандарти. В Super Tux Kart надзорния baseline не подобри неговия средна падане по кръг, тъй като повече данни пристига, DAgger достигнала политика, която никога падна разваляне на пътека след петнадесет итерации, и SMILe след двадесет все още падна приблизително два пъти на кръг. На ръкописната бенчмарк, точност символ работа 82 процента без структура, 83.6 процента надзорни, 85.5 процента със DAgger. Нито един от тези е резултат манипулация.
Какво доказателството не обещава
Теоремата államatok са условни, и условията са товар-носене.
- Ограничение линейно по-скоро отколкото квадратично в T, под посочените предположения.
- Стационарна детерминирана политика по-скоро отколкото стохастична смес.
- Истинско намаляване: всеки no-regret online обучител се вмъква.
- Конкретно брой итерация - приблизително T кръгове преди raскаяние термин спира да имат значение.
- Гарантия за поне един политика в последователност, затова закриване валидация преминаване.
- Това е спрямо epsilon_N, най-добра загуба в класе в анализ, не спрямо нула. Ако класе не може да представи експерта, го е празна на практика.
- Нужди no-regret метод или силно изпъкнала сурогатна загуба - по-силен отколкото класификация намаления това се строи на, както авторите отбелязват.
- Константата u може да е O(T) най-лош случай, и линейно ограничение тогава срутва назад на квадратично.
- Ограничава итерации, не експертни етикети. На робот, етикети са бюджета.
- Предполага експертът може да бъде пита на всяко посещено состояние и отговаря правилно там. Това предположение е целия разход.
Един допълнителен резултат често цитиран като опровержение и не е един. Rajaraman, Yang, Jiao и Ramachandran учат minimax ограничение на imitation learning в епизодно MDPs с крайни state space S и хоризонт H, и доказват suboptimality долна граница на ред на |S| H квадрат над N, което държи дори когато обучител може активно запита експерта при посетени состояния. Това е най-лошия случай процент над клас на MDPs в крайния епизод бюджет, и какво го изключи е идея, че взаимодействие подобря minimax процент; DAgger теорема е различно твърдение, ограничаване развърнати политика спрямо какво собствено политика класа може достичне.
Swamy, Choudhury, Bagnell и Wu по-късно класифицира тези алгоритми по кои моменти на експертно поведение те съответстват, и се въвеждам понятие на moment recoverability че разграничава как добре всяка семейство смекчава натрупване на грешка. Обобщенията от Osa и от Celemin покриват алгоритмично ландшафта и човешко-обратни взаимодействия.
Сметката: етикетиране на состояния експертът никога производителност
Всичко по-горе предполага експерт, който може да бъде пита навсякъде. В симулация със планер, което е почти безплатно - Mario експерименти използвана близо-оптимален планер с пълен достъп до игра състояние. С човек на робот това е преобладаващия разход, и странен един: човек трябва да произведе правилно действие в конфигурация собствено компетенция никога би бил произвел.
Kelly, Sidrane, Driggs-Campbell и Kochenderfer направи възражение директно в HG-DAgger хартията. Ванила DAgger поискай експертът да достави действие етикети докато не пълен контрол на система. Това намалява безопасност, и със човешки експерти вероятно е да деградира качество събран етикети, което те дават до възприето actuator забавяне. Етикет получаш назад е не етикет алгоритъм предполага.
Laskey и колеги атакуват проблем от другия страна със DART, и техния рамка е тъп: on-policy техники са досаден за човешки надзорници, добави изчислителен товар, и може посетят опасни състояния докато обучение. Техния алтернатив вкарва калибриран шум в надзорник собствено демонстрации, така че възстановяване попълнена без робот когато пътува недоверено политика. На MuJoCo Humanoid те съобщавам DART намаляване надзорник совкупност награда от 5 процента докато обучение, докато DAgger изпълнява политики със 80 процента по-малко совкупност награда отколкото надзорник; на хватане в смут със Toyota HSR, средно 62 процента увеличение над behavior cloning.
Zhang и Cho SafeDAgger третира запита за референсна политика като редкия ресурс: отделен безопасност политика предсказва, без запит, дали главния политика ще отклони от референс над праг, и само тези състояния са предадени. Всички три реакция също факт - DAgger анализ зарежда нищо за експертни етикети, и реалност зарежда много.
Етикетиране off-distribution состояния е умствено по-трудно отколкото демонстрация на задача. Нормален демонстрация означава изпълнение на мотор план имаш вече. Корекция политика поставя захвата някъде никога не би означава конструирането на възстановяване на място, под време натиск, с робот още движение. Очаква по-малко използваеми минути на сесия отколкото в обикновена запис сесия, и гледай собствено корекция качество разложение над курс на един.

Какво това значи за SO-100 на вашия писал
Преводи хоризонт в вашия собствено единици. Двадесет-втори епизод на 30 кадъра във втория е 600 решение стъпки, и T в всеки ограничение по-горе е че число. На T = 600, разлика между термин скала със T и един скала със T квадрат е разлика между политика че възстановяване от лоша подход и един че няма.
Това е частично защо действие семена помага: когато политика произвежда кръ последователност на действия на inference стъпка, число на решение точки капки, и така връзка число от шансове на compound. Zhao, Kumar, Levine и Finn назовете натрупване на грешка като мотивация за Action Chunking със Transformers, и съобщавам 80 до 90 процента успех на шест трудни истински-свят задачи, на нисък разход бимануална хардуер, от десет минути стойност на демонстрации. Семена няма премахване covariate shift - състояния са все още политиката собствено - но съкъсто ефективен хоризонт. Вижте действие семена и SO-100 imitation learning водач.
Втория превод е прогреса метрика. Не можеш мерка epsilon под политиката собствено разпределение директно - че нужди земя-истина експертни действия за всеки посетени състояние, че нещо опитваш да избегна произвеждане. Какво човешко-управлявана цикъл дава вместо е интервенционен процент: дял на кадъра в бяжащ по време на които човек беше взел над. Това е прокси, и го движи за причини несвързано със политика - пациент оператор интервенира по-малко. Използва последователно, това е един число че казва дали кръг беше стойност на обяд.
Трети превод е качество-данни предупреждение анализ няма покритие. Mandlekar и колеги учен шест оффлайн обучение алгоритми на пет симулирани и три истински-свят мулти-етап манипулация задачи, и съобщавам чувствителност на алгоритмично дизайн избори, зависимост на качество на демонстрации, и вариабилност причинено от спиране критерий. Belkhale, Cui и Sadigh твърдят че датасет качество трябва да е формализирани чрез действие дивергенция и преход разнообразие, и отбелязват че състояние разнообразие не е винаги полезно. DAgger кръг добави състояния никой избра умишлено: някои са възстановяване данни нужди, някои са робот трепа докато те грабват за takeover управление.
Механично кръг е шест стъпки: работа умозаключение със запис на, вземанието пончик политика неправилно повада, преглед на бяжащ и файл всеки епизод, sync на коррекции, съставляват смесена датасет от оригинали плюс корекции със епизод избор направи явно за источник, и продължи обучение от предходен контролна точка по-скоро отколкото база модел. На ay-robots че стъпки съществуват като бутони, които премахва тръбопровода но не на преценката. Две предупреждения: продължи от контролна точка инициализира тегла и не е оптимизатор възобновяване, и лидер-ръка подравняване преместване е все още светлина тестиран на хардуер. Виж обучение и датасети.
DAgger цикъл, вече свързан
Takeover по време на живо умозаключение работа, по-кадър интервенция маркира, подаване на епизоди като корекции или оценки, съставляват смесена датасет със явен епизод избор по източник, и продължи обучение от съществуващи контролна точка са всички вградени. Че все още решаваш когато да вземанието и какво задържи - че част не automateи.
Виж как DAgger цикъл работиСемейство дърво, в един таблица
| Метод | Кой избира състояния | Какво експертът доставяния | Главна разход |
|---|---|---|---|
| Behavior cloning | Експертът | Чисти демонстрации | Няма възстановяване данни; грешка може compound квадратично в T |
| Forward training | Обучител, по timestep | Етикети във вдъхновени разпределение | T отделни политики; неизползуема за дълги хоризонти |
| SMILe / SEARN | Стохастична смес на експерт и обучител | Етикети във вдъхновени разпределение | Компоненти на смес се различават в качество |
| DAgger | Смесена политика, beta намаляване към нула | Правилно действие за всеки посетени състояние | Етикетиране състояния експертът никога производителност, докато не в контрол |
| DART | Експертът, смутен от вкарван шум | Демонстрации под калибриран шум | Шум трябва да е калибриран на обучител грешка |
| HG-DAgger | Обучител, докато човек взема над | Корекции само в човешко-управлявана сегменти | Зависи на човешко преценка относно кога да се интервенира |
| SafeDAgger | Обучител, филтриран от безопасност врата | Етикети само когато врата просива | Врата себе трябва да е обучена и доверена |
Често зададени въпроси
Ще наистина наблюдавам квадратично растеж на грешка на мой робот?▾
Не като чиста крива. Ограничение е най-лош случай: плътни в че някои проблем достичне го, не че твой ще. Какво виждаш е последствие - политика че точки добре на задържани кадъра, отказва на истински задача, и няма подобрявам когато запис повече на същия. Ако повече чиста данни спирка помощ, че е covariate shift, не данни-обем проблем.
Трябва ли имплементирам beta смесь на нареча го DAgger?▾
Параметър-безплатна версия - експерт в кръг един, чист обучител след - е легитимен специален случай и често преглед лучше в оригинален експерименти. Какво не можеш капка е агрегация: преобучаване само на най-новата коррекции разбива Follow-The-Leader интерпретация, който е откъде no-regret аргумент идва от. Обучение на корекции сам е много по-слаб процедура.
Защо връщам най-добра политика на валидация комплект по-скоро отколкото последния един?▾
Защото теоремите гарантира добра политика съществува някъде в последователност, не че е крайния iterate - ограничение е на минимум над последователност. Доставка както излезе на крайния кръг отхвърля посочено условие на резултат, и крайния кръг не е надежно най-добра.
Колко кръга трябва ли план за?▾
Теория иска итерации на ред на T, който за 600-стъпка епизод е не число всеки работа на хардуер. Оригинален експерименти бяжа двадесет итерации на всеки бенчмарк. На практика бяжаш кръгове докато интервенционен процент спира разваляне, далеч под брой анализ предполага - реално разлика между теория и практика.
Какво ако политика класа просто не може представи експертът?▾
Тогава DAgger няма спасяване те, и ограничение казва така - го е изразена спрямо epsilon_N, най-добра загуба в класе в анализ. Ако че е голям защото неправилно архитектура, липсваща наблюдение или камера че няма виждане сцена, агрегация дава те политика че е оптимално в рамките клас че не може да направи задача. Бяжа open-loop възпроизвеждане срещу задържани епизоди преди събереш корекции.
Където отиди от тук
Ако не си обучена политика все още, че теория е преждевременна: запиши датасет първо, стартирам от обучение на първо политика и лапто клиент. Ако взвешиш други сто чисти демонстрации срещу стартирам корекции: чисти демонстрации няма поправи разпределение проблем. За механика, продължи със човешко-управлявана вариант и тогава SO-100 разходка чрез.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started