Оператор кој надгледува робот крак преку интерфејс за телеоперација, раце на контролите и подготвен да преземе
DAggerИнтерактивно учење со имитацијаHG-DAggerПолитики на роботSO-100

HG-DAgger и гатираните варијанти: Кој одлучува кога да преземе контрола над политика на робот

AY-Robots ResearchAugust 27, 202615 min read

Обичниот DAgger бара од човекот да означува состојби додека роботот сè уште вози. На вистинскиот хардвер тоа е небезбедно и произведува лоши oznaki. Гатираните варијанти ја замењуваат слепото означување со врата некој мора да ја держи: човекот во HG-DAgger, безбедносен класификатор во SafeDAgger, неслогата на ансамблот во EnsembleDAgger, буџетирана процена на новост и ризик во ThriftyDAgger. Овој член ги спореди по тоа кој ја поседува вратата, кој сигнал ја отвора, и што чини секоја - и зошто човечката гатирана форма е онаа која преживува контакт со вистински крак.

Клонирана политика не успева каде што нејзините трошошни податоци завршија. Решението е да продолжи собирање на податоци под сопствената дистрибуција на состојби на политиката наместо демонстраторот, што прави DAgger и што вводот за агрегирање на датасети покрива од основни принципи. Остава отворена незгодната дел од оригиналниот алгоритам: додека учачот вози, експертот требаше да каже што би направил, за секоја состојба, без да биде под контрола.

Во симулатор со скрипиран експерт тоа е бесплатно. На маса со вистински крак на неа не е ни бесплатно ни безбедно. Авторите на HG-DAgger го наведуваат протестот прецизно: такви шеми за примерок "бараат од експертот да пружи eticheti за акции без да биде целосно под контрола на системот", што "може да ја намали безбедноста и, кога се користат луѓе како експерти, веројатно ќе ја деградира квалитетот на собраните oznaki поради перцепирана акуаторска застаја" (Kelly et al., 2019). Два неуспеха се скриваат во таа реченица: политиката продолжува да вози во состојби што никој не сака, а oznaki купени со тој ризик се полошо од оние што човекот произведува додека ги држи контролите. Секоја варијанта подолу одговара на исто прашање - поставете врата на контрола и дозволете некому да одлучи кога ќе се отвори. Се разликуваат во тоа кој е тој некој.

Краткат верзија

  • Гатираните варијанти ја замењуваат слепото означување со прелучување помеѓу контрола на политика и контрола на експерт. Што ги одделува е кој ја поседува прелучувачот.
  • HG-DAgger го дава прелучувачот на човекот и агрегира само податоци записани додека човекот имаше непрекината контрола.
  • SafeDAgger го дава на бинарен класификатор кој предвидува отстапување од референцна политика; EnsembleDAgger бара низаш варијанса и мала растојание до акцијата на експертот во исто време.
  • LazyDAgger додава хистереза за да контролата не се тресетува; ThriftyDAgger ја гати на новост или проценета ризик под експлицитен буџет на интервенција.
  • Роботските гати сигнали имаат потреба од нешто што фина-тјунирана VLA на хоби-класа крак обично недостига: референцна политика, евтина ансамбл или калибрирана епистемичка неизвесност.
  • Врата е половина од методот. Што се случува со сегментите на интервенција подоцна - мешање, пондерирање, агрегирање - одлучува дали рундата подобри нешто.

Човечна-гатирана и робот-гатирана: подела што ја броди

Интерактивното учење со имитација има сопствено анкетирање; Celemin и колеги ја каталогизираат по тип на повратна информација, интерфејс, модел на учење, искуство на корисник, применување и референтна точка. Разликата што ја одлучува твоја инженерија е поедноставна од која било од тие оски, и скорешниот труд директно ја именува: метод е човечна-гатирана кога надзорникот одлучува кога да интервенира, и робот-гатирана кога агентот одлучува кога да бара за помош (Cai et al., 2025). Сè останато е машинерија која служи на една од двете избори. Трговијата е видлива од почеток: човечна врата чини континуирна внимание, и робот врата ветува да ја врати таа внимание - но само ако сигналот што ја гати е веродостојна, и градењето на тој сигнал е сопствена истражувачка проблема.

SafeDAgger: класификатор што предвидува сопствено отстапување

SafeDAgger на Zhang и Cho (2016) е најранаше од овие врати. Пребарување на референцната политика е скапа дел, така мала, втора мрежа - безбедносна политика - предвидува дали пребарување е воопште вредна. Таа "враћа бинарен етичет кој укажува дали примарната политика веројатно ќе отстапи од референцната политика без пребарување". Етичетот е дефиниран наспроти квадратна L2 отстапување помеѓу акциите на двете политики со праг tau, и класификаторот е фитнат со бинарна кросентропија. Во време на извршување одлучува по состојба дали учачот продолжува да вози или референцната преземува контрола. Апстрактот пријавува помалку референцни пребарувања во симулатор за тркачење аво плус упозорување на брзина на конвергенција авторите го припишуваат на автоматизирано учебниче ефект, без да даде број за било кое.

Совет е во дефиницијата, не резултатите. Обучување на класификаторот бара акција на референцната политика на секоја состојба користена за фит, што претпоставува референцната е друга програма. Ако твоја референца е човек со водач крак, таа eticheti сет не е евтина и методот го губи својството што беше дизајнирано за.

EnsembleDAgger: сомнение и несогласие, обајцата

Menda, Driggs-Campbell и Kochenderfer (2019) ја третираат вратата како веројатносно прашање. EnsembleDAgger "приближува гаусиран процес користејќи ансамбл на невронски мрежи" и чита варијансата на ансамблот како прокси на доверба: висока варијанса значи регион различен од трошошните податоци, што - претпоставувајќи експертот избегнува состојби на неуспех - се слагаат со близина до неуспех. Правилото е конјункција. Учачот може да делува само кога L2 растојанието помеѓу неговата средна акција и акцијата на експертот останува под еден праг (несогласие) и варијансата на неговата предвидена акција останува под втор (сомнение). Ако било кој не успее, експертот преземува контрола. Целта е максимизирање на делот од акциите на учачот додека се ограничува веројатноста на неуспех; трудот пријавува подобрена безбедност и учење наспроти други DAgger варијанти на превртена нишка и MuJoCo HalfCheetah.

Терминот на несогласие бара акција на експертот

Ова тивко ја дисквалификува целата правила за надзор без раце. Растојанието помеѓу акцијата на учачот и акцијата на експертот бара акција на експертот во таа состојба, во тој момент. Со скрипиран експерт, во ред. Со човек, човекот мора да произведува акции континуирно - точно товарот гатираните варијанти требаше да ја отстранат. Терминот на сомнение е без раце; конјункцијата не е.

LazyDAgger: стопиј преклучувачот од чвркање

Hoque и колеги (2021) ја нападнаа цена што порано трудовите не мереа: преклучувачот себе. Секоја интервенција "прекинува друга работа што човекот го прави, предизвикува застаја со секој контекст преклучување помеѓу надзорник и автономна контрола, и бара време да се извршува". Врата што се отвора и затвора десет пати во минута е полошо од една отворена десет секунди, при идентични автономна делување. LazyDAgger го проширува SafeDAgger со асиметрични прагови - потешко да влезе надзорна контрола отколку да остане во неа - така системот не се осцилира на граница. Во симулација "може да намали контекст преклучување за просек 60% над SafeDAgger на 3 континуирна контролни задачи додека ја задржува состојба-на-артот перформанса на политика"; во манипулација на ткаевина со ABB YuMi "намалува контекст преклучување за 60% додека постигнува 60% повисока стапка на успех од SafeDAgger во време на извршување".

ThriftyDAgger: новост или ризик, под буџет

ThriftyDAgger (Hoque et al., CoRL 2021) почнува од буџетот на надзорникот наместо политиката. Таа "користи научена преклучна политика за да бара интервенции само во состојби што се доволно (1) нови, каде политика на робот нема референцно однесување да имитира, или (2) ризични, каде робот има ниска доверба во завршување на задача", со нова метрика за процена на тој ризик. Буџетот е влез, не исход: ти изјавуваш колку човечко време ќе потрошиш. Применет во време на извршување методот "постигнува 100% стапка на успех на симулацијата и физичките задачи", и студија на корисник со десет учесници контролирајќи тројка на робот на страната на концентрациона задача пријавува дека "ги зголемува перформансата на човек и робот за 58% и 80% соодветно наспроти следната најдобра алгоритам додека ја намалува товарот на надзорник". Поставката на флота е природна куќа за овој труд; Fleet-DAgger подоцна го формализираше интерактивното учење на флота со повеќе роботи и надзорници, предлагајќи Return on Human Effort како количина да се оптимизира.

HG-DAgger: човекот ја држи вратата

Kelly et al. (2019) одат другиот пат. Нема преклучна политика. Учачот е рула "се додека експертот не забележи дека новак влезе во небезбедна регија на простор на состојба", во кој момент експертот преземува контрола и ја водит системот назад. Правилото на агрегирање е строга дел: "Eticheti на акции експерт се собираат и додаваат на датасетот само во текот на овие опоравување траекторија, во текот на кои човечкиот експерт има непрекината контрола на системот." Ништо не е означено додека човекот е гледач.

Таа не стопира на преклучување. HG-DAgger исто така "учи безбедносен праг за модел-неизвесност-базиран ризик метрика што може да биде користена да предвиди перформанса на целосно обучена новак во различни региони на простор на состојба": таа логирува колку несигуран беше учачот во моментите кога човекот интервенираше и просеци се последна четвртина на тие записи, каде учачот најмногу наликува на неговата конечна форма. Тоа не е врата роботот управува но дијагностички кажувајќи ти каде конечната политика се очекува да держи. Евалуацијата покрива симулирана и вистинска задача на вожење и пријавува подобрена перформанса над DAgger и behavior cloning.

Една поврзана линија ја менува што броји како eticheti. Spencer и колеги Expert Intervention Learning држи дека "било кое количество експерт повратна информација, било со интервенција или не-интервенција, пружа информација за квалитет на тековната состојба, оптималност на акцијата, или обајцата", формализирана како ограничување на функцијата на вредност на учачот и решена со не-покајување на линијско учење. Под таа читање, тесно каде човекот набљудуваше и ничего не направи се слаба позитивна доказ наместо празна. EIL учи избегнување столк од околу една минута на експерт контрола.

Роботски крак работен простор со камери позиционирани за собирање на податоци во текот на надгледана политика рула
Човечна-гатирана рунда е обична сесија на заклучување со регистратор приложена. Оквирите што оператор вози се ознувачени; остатокот остана како што беше.

Варијантите една до друга

МетодКој ја отвара вратаСигналПотребни достапниПријавено
DAgger (Ross et al., 2011)Никој - учачот секогаш возиНикој; експертот означува секоја посетена состојбаЕксперт способен да означува состојби надвор од политика додека не биде под контролаГарантира без-покајување со гарантии под дистрибуција на состојба на учачот
HG-DAgger (Kelly et al., 2019)Човечкиот надзорникСуд на надзорникот дека состојба е небезбеднаНекој набљудување, и чист превзем на контролаНадминува DAgger и behavior cloning на симулирана и вистинска задача на вожење; исто така учи ризик праг
SafeDAgger (Zhang & Cho, 2016)РобототБинарен класификатор за L2 отстапување од референца над tauПребарувачка референцна политика за eticheti на класификаторотПомалку референцни пребарувања во симулатор на тркање, брза конвергенција (бројка не дадена)
EnsembleDAgger (Menda et al., 2019)РобототВаријанса на ансамбл и растојание до акција на експерт, обајцата под прагАнсамбл на мрежи плус акција на експерт во секој чекорПодобрена безбедност и учење на нишка и HalfCheetah
LazyDAgger (Hoque et al., 2021)Роботот, со хистерезаСигнал на SafeDAgger со одделни ставки и излез праговиШто SafeDAgger бара, плус втор праг да го тјунира~60% помалку контекст преклучувања на 3 задачи; 60% повисок успех на YuMi плат
ThriftyDAgger (Hoque et al., 2021)Роботот, под буџетНовост, или проценета ризик на не завршување на задачаНаучена проценувач на ризик и изјавена буџет на интервенција100% успех во време на извршување; студија на корисник (N=10): 58% и 80% добива над следна најдобра
EIL (Spencer et al., 2020)Човекот - не-интервенција броди исто такаИнтервенција и нејзина отсутност као ограничување на функцијата на вредностЛинијско учење без-покајување над вредност ограничувањеИзбегнување столк од около една минута на експерт контрола

Што секоја врата куп, и што ја наплачува

Прочитај надолу колоната "потребни" и шема пада надвор: секој робот-гатиран сигнал таму е прокси што мора да се направи, и секој прокси има сопствена рачун.

  • Сигнали на несогласие (SafeDAgger, LazyDAgger, половина од EnsembleDAgger правилото) имаат потреба од референцна политика. Или имаш скрипирана експерт, во кој случај занимлива проблема е веќе решена, или човекот продолжува да произведува акции во позадина за растојание да биде компјутирано.
  • Сигнали на сомнение имаат потреба од калибрирана епистемичка неизвесност. Ансамбл на мали контролни мрежи ја приближува; ансамбл на тривилијард-параметар видување-јазик-акција модел е меморија и застаја проблем прв.
  • Сигнали на новост и ризик имаат потреба од научена проценувач на завршување на задача, фитната на доволна успешна и неуспешна рула. На задача ти сè уште ја добиваш за работа, таа податоци не постои во рунда една.
  • Човечната врата бара внимание и ништого повеќе - единствениот сигнал достапен во ден една, на која било архитектура на политика, без екстра модел да се обучува.
  • Никој робот врата не отстранува човекот од просторијата. Тие намаловаат колку често човекот мора да дела, не дали мораа да присутствуваат.

Има тишинаша разлика во што врата произведува. Робот врата палење средина траекторија предава лице движечки крак во произволна поза. Човечна врата дозволува оператор да избере момент - по достигнување, пред хвата, не половина преку нишање. Сегментите на опоравување од двете не се еднакво чист, и тие сегменти се целата производ на рунда.

Зошто човечна-гатирана форма победува на вистински хардвер

Ово е инженерски аргумент, не резултат од референтна точка - нема труд што го нашле водимо сите пет врати на ист манипулатор со иста класа на политика. Таа почива на четири точки.

Прво, надзорникот е таму кој било. Никој не остава SO-100 крак трчајќи без внимание до објекти што може да падне над. Откако некој набљудува, маржинална цена на дава им преклучувачот за превзем е блиско нула; градење на калибриран проценувач на ризик е проект.

Второ, неизвесност што можеш вистински мерка на модерна политика е често погрешна количина. Дифузија или текување-совпаѓање глава произведува варијанса преку примерок акцијата парченца, и таа варијанса одразува мултимодалност главата беше обучена да претставува, не епистемичка невидување за состојба. EnsembleDAgger сомнење термин користи ансамбл прецизно за да се хвати второто. Двата гледаат како иста број и не се; акција парченце и текување совпаѓање влезови покрива како тие главе емисија акциби во прв место.

Трето, неуспеси што ја вортат манипулација се често семантички наместо статистички необични. Политика затворај пискач два сантиметра рано, или достигнување со доверба за погрешна една од две идентични кубови, не е во висока-варијанса состојба - таа е самоверен и погрешна. Никој варијанса праг ловен тоа; лице набљудување ловен тоа веднаш.

Четврто, квалитет на eticheti - оригиналната HG-DAgger точка, и една најчесто прескакана. Eticheti собрани додека човекот имаше непрекинена контрола удари eticheti марирана над движечки систем. Ако целта е коректива податоци вредна агрегирање, товар на доказ леж со автоматизирана врата.

Каде робот врати плаќаат

Слика прерамнувачи кога еден надзорник одговора за многу роботи - режимот ThriftyDAgger студија на корисник и Fleet-DAgger формализирање цел. Со флота, човечка внимание е речиси ресурс и непрецизна алокација удари ништого. Со еден крак на еден стол ти не си во таа режим.

Човечна-гатирана петелја, веќе жица нагоре

Превзем во време на трчачка сесија на заклучување, по-фране интервенција знамиња на коригирани сегменти, куриран секоја рунда во исправки или евалуација, компонирана мешана датасет од извори ти бираш, и продолжување обука од постоечки контролна точка се вградени наместо скрипирано со раце. Превземаај функцијата со водач крак, или со клучеви и лизгачи ако не имаш една.

Видете која начин DAgger петелја трчи

Врата е половина од методот; обработка на податоци е другата половина

Врата одлучува кој оквири човекот вози, не што да се направи со нив, и таа втора одлука е каде рунди се најчесто растрошени. Прво правило е една D во DAgger стои за: агрегирање, не замена. Фина-тјунирање на контролна точка чисто на неколку стотина коректива оквири ти дава модел што видел скоро ништего но опоравувања и заборавено номиналска траекторија.

Второ правило е таа интервенција оквири не се обични оквири. Mandlekar et al. изградени дистанциска-телеоперација систем за 6-DoF манипулација дозволување оператор надзор политики и превземе на неуспех, а потоа обучени итеративно со алгоритам што "охорабрува политика да научи како да трудери застаја преку интервенциби"; агенти обучени на та податоци надминнаа агенти обучени на еднаков број обични преинише примероци. Sirius гура идеја во развој, "пре-пондирање обука примероци со приближена човечка доверба и оптимизирање политики со пондирано однесување копирање". Обајцата имаат потреба од по-фране знамина што беше човечна-вожена, што е зошто интервенција знамина вежда повеќе отколку гледа.

Трето правило е таа автоматска мешање е замка. Составена датасет чии извори ти не можеш наброј е една ти не можеш дебагира кога следната рунда добива полошо. На овај платформа композ чекор е експлицитна за таа причина - оригинална датасет плус исправки, избор на епизода по извор, и резултат е обична LeRobot датасет што синглува и обука како која било друга; документација на датасет покрива страна формат.

Чекор во рундаШто таа произведуваНајчест начин таа оди погрешно
Трчај заклучување со запис наРунда под сопствена дистрибуција на состојба на политикаЗаписана како обична телеоперација, теренот дека политика беше вози
Превземе на неуспехСегменти на исправка со по-фране знамина на интервенцијаИсправување козметички колебање, наведување стил наместо опоравување
Куриран секоја епизодаИсправки, евалуација, или отпадиЧување сè; ботнаја превземе цена повеќе отколку епизода беше вредна
Синглувајќи исправкиВерзионирана датасет до страната на оригиналноИсправки што никогаш напуштаат локална машина
Композ мешана датасетОригинало плус исправки, експлицитна изборТишинаша авто-мешање, така позна регресија не може да биде трасирана до извор
Продолжување од контролна точкаКонтролна точка почетна од претходна еднаОчекување оптимизатор резоме; тежини почетни модел, тие не враќа оптимизатор состојба

Поставување врата човекот вистински може да ја држи

"Човекот одлучува" не е спецификација. Двајца оператори со различни прагови произведуваат несспоредни рунди, и дрифтирачек праг произведува тренд ти не можеш читај. Напиши активаторите надолу пред прво рунда.

  1. Име условите што го отваржат врата - приближување се габа повеќе од фиксна маржина, пискач затворање на ништего, зглоб дрифтирање кон граница, застаја од повеќе од секунда или две - и держи листа неизменета за рунда.
  2. Име што не го отвор таа. Пребаруја политика се опоравува од сама по себе е обука сигнал; превземањено таму брише опоравување таа веќе позна.
  3. Превземе рано доволна за чист превземање, врати назад чим состојба е опоравувачка.
  4. Логирај зошто ти превзе, по епизода. Три рунди подоцна таа е единствена запис дали исти неуспех враќа.
  5. Чувај камери, текст на задача и оператор константна преку рунди. Промена една и бројки стопиј бидеј несспоредни.

Механички превземањето има два варијанти. Со водач крак, водач мора да достигне следба сегашна поза пред вртење трансфери, или крак скокови; ова порамнување движење е најмалку-тестирано дел на веќе на вистински хардвер. Без водач крак превземањето е маниран од прво клуческ: следба е држана и оператор го исправи го зглоб по зглоб од клуческа или влачи лизгачи, со серверскате школи чување секој влез мала - пар степен по клуческ, полна по лизгач ажурирање, бидејќи голема чекор во держана поза е како ти лушт серво. Чекор-по-чекор верзија со клуческ врезите е во прошетката на DAgger рунда на SO-100; позадина на обајцата режими телеоперација е во телеоперација документација и водач-следба влез.

Спореди на поддржани архитектури на политика со нивна обука и заклучување карактеристики
Врата е архитектура-агностична. Која политика ти коригира ја менува обука цена на рунда, не како превземањето функцијава.

Читање дали врата направи нешто

Метрика на човечна-гатирана рунда е интервенција стапка: интервенција оквири поделена со оквири на рунда. Таа има една работа - ако таа не пада преку рунди, рунда купена ништего, и следна една требаше да промени нешто другиот отколку износ на податоци.

Таа е приватна метрика и ти требаше да знаеш како. Таа мери оператор праг како многу како политика компетенца, кој е зошто активатор листа остана фиксна; оператор што релакс преку сесија произведува падање крива со ништего иза неа. Таа исто така игнорира строгост - десет оквири да стопи столк и десет исправи хват гледаат идентична. Пара таа со фиксна евалуација сет не коректива податоци когаш обучена од. Членот на мерење DAgger петелја ја работи преку евалуација дизајн, вклучување како чувај евалуација епизоди надвор од обука мешање.

Човечна врата, често
Што таа ти дава
  • Функцијава во ден една, на која било архитектура на политика, со не екстра модел да се калибрира
  • Ловен самоверен-и-погрешна неуспеси ниеден варијанса праг открива
  • Произведува исправки записана додека оператор имаше целосна контрола, во момент тие избраа
  • Дава по-фране знамина дека интервенција-пондирана методи како IWR и Sirius конзумира
Што таа не
  • Цена континуирна надзор; таа не размери до една личност и многу роботи
  • Зависи од оператор конзистенца - дрифтирачек праг корупт интервенција стапка
  • Произведува не ризик модел сама по себе; HG-DAgger научена праг и ThriftyDAgger проценувач се екстра машинерија
  • Број оквири, не последици
  • Не может спасаај политика чиј неуспех е против на тек на контрола, како исправена камера или неточна етичетирана задача низа

Отворена прашања вредна чување во воглед

Референтни точки се слаба. Spencer и колеги испитани использе тестира имитација учење пристапи и нашле тие "реализабилна и едноставна и така неизбежна за хвата потешка режими на грешка компоунди видена во вистински-свет одлука правање проблеми" - и, наспроти окружување литература, нашле обична однесување копирање направена добро на нив. Таа е причина би скептична за секоја рангирање на DAgger варијанти почивајќи на тие задачи, вклучување некои бројки во табела над.

Робот врати на голема политика не се решена исто така. AIM труд замена неизвесност со прокси Q-функција имитирање човечна интервенција правило и пријавува 40% подобрување во превземање цена и учење ефикасност над ThriftyDAgger - во континуирна и дискретна контрола, не на видување-јазик-акција модел вози манипулатор. Дали било кои од овие врати трансфер до фина-тјунирана VLA е отворена. Анкета прави поврзана точка: поле терминологија и структура не се унифицирана преку литература, која прави методи потешко за спореди. На твој сопствена крак, твои логи се доказ ти имаш.

Е HG-DAgger вистински DAgger ако човекот само этичет за време на интервенциби?

Таа держи дел што броди - податоци собрана под дистрибуција на состојба учачот предизвикува, агрегирана со што дошла пред - и паѓа дел што не преживува контакт со хардвер. Kelly et al. претставувача таа како варијанта; 2011 не-покајување гарантирање не носам преку неизменета.

Може ли ја користам робот врата на фина-тјунирана VLA политика на SO-100?

Не направо. SafeDAgger класификатор бара пребарувачка референцна политика ти немаш. EnsembleDAgger бара ансамбл, кое за мултивилијард-параметар модел значи неколку копии во меморија плус нивна заклучување цена. ThriftyDAgger бара проценувач на ризик фитна на успеси и неуспеси што не постои пред твој прво рунди.

Колку долга требаше biti единствена превземање?

Долга доволна за достигнување состојба политика може да продолжи од, и не подолга: продолжена превземање врти рунда во преинише сесија и плави коректива сет со номиналска однесување. LazyDAgger наод ја реже другиот начин исто така - многу многу кратки преклучување се нивна сопствена цена.

Требаше ли ја обучувам само на коригирани сегменти?

Не - таа е најчест начин растрошите рунда. Модел фина-тјунирање само на опоравувања видела скоро ништего но опоравувања. Мешај исправки во оригинално датасет со извори избрани експлицитна; за идете понатаму, погледајте интервенција-пондирана пристапи како IWR или Sirius, кои нагоре-пондирање човечна-вожена оквири наместо изолирање нив.

Што ако интервенција стапка не пада по рунда?

Земи таа во лице вредност: рунда не помогна. Пред додавање исправки, проверка евтина објаснување - човек оператор праг дрифт, биле исправки козметички, ја направи композ датасет вистински содржат нив, была обука почетна од намерена контролна точка. Рунда што молчаливо почна од базна модел гледа точно како рунда што не успеа да научи.

Не-интервенција дава информација?

Под Expert Intervention Learning, да: тесно каде надзорник набљудуваше и не постапи се читаш као слаба доказ што состојба и акција биле прифатливи, формализирана как ограничување на функцијата на вредност. Најчесто практични потокови, вклучување ова една, знаме само што човекот вози.

За единствена крак на стол избор е направена: держи врата сама себе, напиши надолу што го отвор, и потрошете товар на податоци обработка иза неа наместо на автоматизирање преклучување. Платформа страна е опиш на DAgger петелја страна, обука опции по политика семејство под обука и цена. За позадина, почни со имитација учење и имитација учење на SO-100; за прво рунда, трчај твој прво политика е пократка патека.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started