
Elgesio klonavimas atitinka politiką ekspertų būsenos pasiskirstymui ir tada diegiama savarankiškai. Skirtumas tarp tų dviejų pasiskirstymų yra todėl, kad politika, kuri atrodo gerai validavimo metu, nušoka nuo stalo 300-ame žingsnyje. Tai mūsų DAgger serijos teorija: iš kur atsiranda kvadratinis klaidos terminas, ką keičia duomenų agregacija, ką numano be-žalos įrodymas ir kurią sąskaitą dar turi mokėti žmonių ekspertas.
Yra specifinė klaida, su kuria anksčiau ar vėliau susiduria kiekvienas, kuris treniruoja manipuliacijos politiką. Politika siekia kubo, priartėja dvi centimetrus, svyruoja, nusidrasko į šalį, tada daro ką nors, nedalyvaudama užduotyje. Validavimo nuostoliai buvo gerai. Atvira kilpa, grąžinta į atliktus epizodus, buvo gerai. Ir vis tiek ranka baigiasi padėtyje, kurios nėra mokymo duomenyse, ir iš ten ji neturi ką prasmingo pasakyti.
Ta klaida turi vardą ir nustatytas teorinius pagrindus. Tai yra pirmasis iš keturių straipsnių apie DAgger, ir jis apima pačią argumentaciją: kodėl politikos pritaikymas demonstratoriaus paties trajektorijoms sukuria klaidą, kuri gali augti su epizodo ilgio kvadratu, ką keičia duomenų agregacija ir ką be-žalos įrodymas neviešina. Kilpa su realia aparatūra yra aprašyta DAgger kilpos paleidimas SO-100, žmonių vartuojama varianta HG-DAgger ir žmonių vartuojamos intervencijos, ir matavimo klausimą DAgger kilpos matavimas.
Trumpa versija
- •Elgesio klonavimas treniruoja eksperto būsenos pasiskirstymą ir vertinamas pagal pačios politikos. Neatitikimas didėja per epizodą.
- •Ross ir Bagnell parodė papildomąją sąnaudą gali augti kaip T kvadratu kartų per žingsnio klaidai; DAgger straipsnis nurodo tą ribą ir pastebėja, kad ji yra tiesa.
- •DAgger žymi būsenas, kurias pati politika aplankė, ir peratrenira kiekvieną nubrėžtą duomenų rinkinį, o ne tik naujausią.
- •Garantija yra sumažinimas į be-žalos interneto mokymą: agregavimas ir peratrenirimas yra Sekti lyderį.
- •Tai galioja santykius su geriausiu nuostoliu pasiekiamu politikos klasėje, o ne santykius su nuliu - ir ekspertas vis tiek turi žymėti būsenas, kurias jis niekada nebūtų sukūręs.
Prielaida, kurią tyliai daro elgesio klonavimas
Demonstravimo duomenų rinkinys yra stebėjimo-veikimo porų krūva. Elgesio klonavimas atitinka funkciją tai krūvai su įprastu prižiūriku mokymusi ir sustoja. Tai yra seniausia idėja srityje. Pomerleau ALVINN, 1988 metais, buvo trisloji atgalinę sklaidą esanti tinklo klasė, kuri paėmė vaizdinius iš kameros ir lazerinės nuotolio ieškiklio ir sukūrė kryptį, į kurią turėtų keliauti transporto priemonė; ji buvo treniruota simuliuotais kelio vaizdinius ir sekė tikrusias kelias esant tam tikroms lauko sąlygoms. Receptas nėra daug pasikeitusia; tinklai turi.
Tai, kas praleidiama, yra patikrinimas, iš kur tos poros atsirado. Kiekvienas iš jų sėdi trajektorijoje, kurią demonstratorius sukūrė. Politika, kurią diegiasi, sukuria savo. Greitai, kai jis nukrypsta, jis klausiamas apie būsenas, kurios nebuvo mokymo pasiskirstyme, ir jo atsakymas jį pajuda toliau. Ross, Gordon ir Bagnell atidaro DAgger straipsnį su tuo tiksliai: nuosekli numatymas pažeidžia i.i.d. prielaidą po statistiniu mokymusi, nes mokytojo paties numatymai nustato įvestis, kurias jis mato toliau.
Aiškiausia iliustracija tame straipsnyje nėra roboto visai. Beveik optimalaus planisto klonavimas Super Mario Bros. sukūrė politiką, kuri pakartotinai įstrigo į kliūtį, o ne per ją šoko. Priežastis yra visa argumentacija vienoje frazėje: ekspertas visada šoko iš patogaus atstumo, todėl duomenų rinkinyje nebuvo jokios būsenos, kurioje Mario būtų prispaustas prie kliūties, todėl nėra žymės, ką daryti, kai jis buvo.
Pakeiskite Mario dėl SO-100 rankos ir struktūra yra identiska. Jūsų demonstracijos rodo švarius priartėjimus ir švarius griebus, o ne pirštinę, užsidariusią dvi centimetrus trumpai - todėl politika neturi supratimo, ką daryti iš ten, ir kas nors, ką jis spėja, jį pajuda toliau. Kovariacinis poslinkis yra duomenų rinkimo procedūros savybė, o ne tinklo architektūra.Iš kur atsiranda kvadratinis terminas2010 AISTATS straipsnis Ross ir Bagnell,
Efektyvūs imitacinio mokymo sumažinimai
, daro kaupimąsi tikslų. Tegul T yra užduoties horizonta, tegul užduoties savikaina būtų ribota vienetu intervalu, ir tegul epsilon yra surogatinis nuostolis, išmatuotas po eksperto būsenos pasiskirstymu - skaičius, kurį praneša jūsų validavimo rinkinys. Tada šios politikos pagalva, kuri buvo paleista T žingsnių, yra T kvadratu kartų epsilon ribota. Ross, Gordon ir Bagnell nurodo tai kaip Teoremą 2.1 DAgger straipsnyje ir prideda frazę, kuris reikalingas: riba yra tiesa. Uždaviniai egzistuoja, kur politika su epsilon nuostoliu eksperto pasiskirstyme iš tikrųjų patiria papildomą sąnaudą, augančią kvadratiškai T.Tiesa nėra tipinė. Kvadratinis terminas yra blogiausias atvejis per problemų klasę, o ne numatymas apie jūsų paimdavo-ir-padėkite užduotį. Tai, ką jis nustato, yra tai, kad daugiau eksperto demonstracijos negali šalinti problemą: jis tik paaštrėja epsilon įvertinimą pasiskirstymui, kuriame politika nebus bandyta.Bėgimo maršrutas yra tame pačiame straipsnyje, iš naujo nurodomas kaip Teorema 2.2. Jei politika pasiekia nuostolį epsilon po jos pačios būsenos pasiskirstymu, ir vienas neteisingas veiksmas išlaida daugiausia u pagal atsigavimo sumą eksperto, papildoma sąnada yra u kartų T kartų epsilon ribojama - tiesa horizonto. Konstanta u yra įdomus dydis: daugiausia 1, kai 0-1 nesutarimu su eksperto, ir O(1), kai ekspertas gali atsigauti per kelis žingsnių. Pioriausiu atveju jis yra O(T), ir tiesa riba yra tada ne geriau nei kvadratinė.NustatymasRiba dėl papildomo nuostolio virš eksperto
Ką jis remiasi
Elgesio klonavimas (Ross & Bagnell 2010, iš naujo nustatytas kaip Thm. 2.1 Ross et al. 2011)T kvadratu kartų epsilonepsilon išmatuotas eksperto būsenos pasiskirstyme; savikaina [0,1]; riba yra tiesa
| Bet kokia politika su epsilon nuostoliu pagal jos pačios pasiskirstymą (Thm. 2.2) | u kartų T kartų epsilon | u riboja atsigavimo sumą vieno neteisingai veiksmui; daugiausia 1, kai 0-1 nuostolys, O(T) blogiausiu atveju |
|---|---|---|
| Priekin mokymas (Ross & Bagnell 2010) | u kartų T kartų epsilon | vienas politika per žingsnį; reikalingas T politikos ir žinomas, baigtinis T |
| SMILe (Ross & Bagnell 2010) | beveik tiesa T ir epsilon į kai kurias problemų klases | alpha O(1/T kvadratu), N O(T kvadratu log T); duoda stochastinę mišinę |
| DAgger (Thm. 3.2, Ross et al. 2011) | u kartų T kartų epsilon_N, plius O(1) | N apie uT tvarka; stipriai išgaubtas ribojamas nuostolis; be-žalos mokytojas; epsilon_N yra geriausias nuostolis atgal |
| Roboto darbastalis, atstovaujantis būsenas, kurias politika aplankė ir kuri niekada nepasireiškė demonstravimo rinkinyje | Būsenos, kurios svarbi DAgger raundui yra tie, kuriuos niekas nedemonstravęs: beveik pasisekęs griebimas, pusiau atviras pirštinė, ranka objekto praeityje. | Dvi bandymai prieš DAgger |
| Priekin mokymas yra sąžiningas, bet nepraktiškas atsakymas. Mokykitės atskiros politikos kiekvienam laiko žingsnį, tvarka, kiekvienam pagal būsenos pasiskirstymą, kurį sukūrė politikos jau fiksuoti ankstesni žingsniai, todėl kiekviena politika mato tiksliai pasiskirstymą, su kuriuo jis susidurti. Lova yra aprašyme: T politikos, treniruojamos nuosekliai, nėra ankstyvo baigymo. | epizodą | per sekundę, T yra šimtais. |

politiką vietoj.
DAgger: viena idėja, vienas langelisDuomenų agregacija išlaiko determinuotą politiką ir persikelia taisymo į duomenų rinkimą. Kiekvienas raundas: išvirtite esamą politiką, įrašykite būsenas, kurias jis aplankė, paprašykite eksperto, ką teisingas veiksmą būtų buvęs kiekviename, pridėti tas poras prie duomenų rinkinio, kurį jūs jau turite, peratrenira dėl sąjungos. Vardas yra algoritmas - jūs agregatai, jūs niekada nešalinate.DAgger meta-algoritmo, Algoritmas 3.1 Ross, Gordon & Bagnell (2011).
Trys detalės nešioja daugiau svorio nei jos atrodo. Žymės yra būsenos, kurias aplankė mišri politika, bet veikla suteikta eksperto - politika suteikia klausimus, ekspertas atsakymus. Peratrenirimas yra ant viso agregato, kuris daro kiekvieną raundą Sekti-Lyderį žingsnį: per raundą n jūs renkate geriausią politiką atgal visos trajektorijos iki šiol. Tai rėminimas yra tai, ką pagrindžia įrodymas. Ir algoritmas baigiasi grąžindamas geriausią politiką iš sekos kaip pasirinktas su validavimo rinkiniu, nes teoremos garantuoja, kad kai kurią politika iš sekos yra gerai, o ne paskutinis.
Beta grafikas, ir kodėl jis nėra tinimo žaismas
Mišri politika yra beta_i kartų ekspertas plius vienas minus beta_i kartų mokytojas. Taškas yra praktiškas: pirmaisiais nustatyti politikos yra treniruojamos labai mažai duomenų, daro daug klaidų, ir kitaip praleisty raundą į būsenas, kurios tampa nereikalinga, kai politika pagerėja.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setGrafikasKą jis daroKą straipsnis praneša
beta_1 = 1
Pirmasis raundas yra gryna eksperto demonstracija; nereikalinga pradinė politika
Rekomenduojamas pradinis taškas kiekvieniame variante
| beta_i = 1 jei i = 1, kitaip 0 | Ekspertas tik pirmame raunde; nėra laisvo parametro | Straipsnio parametru-laisvoji versija, kurią jis sako dažnai atliekama geriausią praktikoje; 2980 ant Super Mario Bros. po 20 iteracijų |
|---|---|---|
| beta_i = p^(i-1) su p = 0.5 | Eksperto tikimybė nyksta geometriškai | 3030 ant to paties benchmarko, šiek tiek prieš parametru-laisvą versiją |
| beta_i = p^(i-1) su p = 0.9 | Ekspertas išlieka kilpoje daug ilgiau | Žymiai lėtesnis konvergencija; vis dar gerėja, kai 20 iteracijų baigtas |
| Skirtumas tarp 2980 ir 3030 į skalę, bėgantis į maždaug 4300 yra mažas, bet straipsnio paaiškinimas yra naudingiausias praktinis pastaba skyriuje. Su parametru-laisvą grafiką, Mario įstrigo toje pačioje vietoje anksti ir sukūrė masę beveik pasikartojančiais duomenimis iš tą vietą; leidimas ekspertui vairuoti dalelę laiko tiek jį atlaisvo ir išplėtė būsenos šilumą. Grafikas yra mažiau apie mišinio santykį nei apie tai, ar jūsų duomenų rinkimas nuolat sukuria naujas būsenas ar tą pačią klaidą. | Kodėl grafikas neperkeliama į fizinę ranką, kaip parašyta | Stochastinė per laiko žingsnį mišinio reiškia perjungti kontrolę valdžią valdžia per valdžios norma, 30 kartų per sekundę ant tipinio SO-100 nustatymo. Jokia teleoperation sąsaja nedaro to saubia ar prasminga. Ant tikra aparatūra beta grafikas suteikia kelią žmonių sprendimui apie kada perimti: skirtingas algoritmas su skirtinga analize. |
| Garantija: sumažinimas į be-žalos interneto mokymą | Čia yra žingsnis, kuris daro straipsnį tuo, kas jis yra. Traktuokite kiekvieną DAgger raundą kaip vieną pavyzdį interneto mokymo problemoje, kur nuostolis pas raundą i yra surogatinis nuostolis pagal politikos naudojamo būsenos pasiskirstymą per raundą i. Mokytojas įsipareigoja politika prieš pamatydamas tą nuostolį, ir seka yra ne-stacionari, nes ji priklauso nuo politikos, parengtos iki šiol. | Algoritmas yra be-žalos, jei jo vidutinis nuostolis per N raundus priartėja prie geriausio vieno politika atgal. Sekti-Lyderį ant stipriai išgaubtas nuostoliais yra tokia algoritmas, su vidurkiu atsigeistu sutūpimas 1/N tvarka - ir peratrenirimas ant viso agregato yra tiksliai Sekti-Lyderį. Bet koks kitas be-žalos mokytojas tarnauti taip pat: analizė yra sumažinimas, o ne savybė vienas optimizier. |
Vienas lemma sviesčia tarpą tarp mišrios politikos, kuri rinko duomenis ir nubrėžtos politikos, kuri bus diegiama: Lemma 4.1 riboja L1 atstumą tarp jų pasiskirstymų 2 T beta_i. Tai kodėl betas turi nykus - nuo eksperto dar laiko vertybę kontrolės valdžios, būsenos jūs rinkti nėra būsenos, kurias jūsų politika sukurs. Derinkite lemą pagal regret ribą ir pagrindiniai rezultatai sekite: po maždaug T iteracijų, kai kurie politika iš sekos turi surogatinis nuostolis pagal jos pasiskirstymą dėl O(1/T) iš epsilon_N. Prašalinti šioje tiesią ribą ir jūs laipu Teoremoje 3.2.
Ką įrodymas neviešina
Teoremos teiginiai yra sąlyginiai, ir sąlygos yra sunumeruotos.
DAgger garantija, nuodugniai perskaityta
Ką jis duoda jums
Ką jis neduoda jums
Riba tiesa, o ne kvadratinė T, pagal nustatytą prielaidas.
Stacionari determinuota politika, o ne stochastinė mišinė.
Tikra sumažinimas: bet koks be-žalos interneto mokytojas įdeda į.
- Jis reikalingų be-žalos metodo arba stipriai išgaubtas surogatinis nuostolis - stipresnis nei klasifikacija sumažinimu jis pastatyti su, kaip autoriai pastebėti.
- Konstanta u gali būti O(T) blogiausiu atveju, ir tiesa riba yra tada surinka grįžti į kvadratinę.
- Jis riboja iteracijas, o ne eksperto žymas. Ant roboto, žymas yra biudžetas.
- Jis prielaido ekspertas gali būti klausiamas ties kiekviena aplankyta būsena ir atsakyti teisingai. Tai prielaido yra visa sąnada.
- Vienas toliau rezultatą dažnai cituojamas kaip paneigimas ir nėra vienas. Rajaraman, Yang, Jiao ir Ramachandran tyrinėti minimax ribas imitacinio mokymo episodinėje MDPs su baigtinio valstybės S ir horizonto H, ir prokuruoti suboptimalumo apačioje riba apie |S| H kvadratu žemyn N, kurie laiko net, kai mokytojas gali aktyviai klausti eksperto aplankyte būseną. Tai blogiausio-atvejis norma per MDPs klasę fiksuotoje episodo biudžete, ir ką jis paaišnudu yra mintis, kad sąveika pagerina minimax norma; DAgger teorema yra kitokios teiginys, ribojant diegiamą politiką santykiais ką jos pačios politika klasė gali pasiekti.
- Swamy, Choudhury, Bagnell ir Wu vėliau klasifikuoti šias algoritmus, kurie laipsnių eksperto elgesio jie sutampa, ir pristatinėjo nuovarginę momento atkūrimo, kuri skelbia kaip gerai kiekviena šeima suavoja kaupiantis klaidą. Apžvalga Osa ir Celemin apima algoritminio peizažą ir žmogaus-atsiliepimo sąsajas.
- Sąskaita: žymėti būsenas, kuriuos ekspertas niekada nesukūrė
- Visas viršuje prielaidos ekspertas, kuris gali būti klausiamas visur. Simuliacijoje su planu, kuris yra beveik nemokamai - Mario bandymai naudojami beveik-optimalaus plano su visa prieiga prie žaidimo valstybė. Su žmogumi ant roboto jis yra išlaidos dominas, ir keistas vienas: žmogumi turi sukurti teisingą veiksmą konfigūracijoje jų pačios kompetencija niekada būtų sukūrę.
- Kelly, Sidrane, Driggs-Campbell ir Kochenderfer pasakyti objektą tiesiogiai HG-DAgger straipsnyje. Vanilla DAgger reikalinga eksperto, kad teiktų veiksmą žymas nuo ne yra visai kontrolę sistemos. Tai sumažina saugą, ir su žmogumi ekspertai labai tikėtina pabloginti kokybę iš surinktos žymas, kurie jie nukelti į suvoktas aktuatorius lag. Žyma jūs gauti atgal nėra žyma algoritmas prielaido.
- Laskey ir kolegų ataka problema iš kito šono su DART, ir jų rėminimas yra tiesus: on-policy metodai yra nuobodūs žmogaus prižiūrėtojai, pridėti skaičiavime apkrova, ir gali aplankyte pavojingus būsenas per mokymą. Jų alternatyva inžinieriai kalibruotas triukšmas į prižiūrėtojo paties demonstracija, todėl atsigavimas gauna demonstravimas be roboto niekada veikti nepatikimas politika. Ant MuJoCo Humanoid jie praneša DART sumažinus prižiūrėtojo sukauptos atlyginimo 5 procentų per mokymą, nors DAgger vykdo politikos su 80 procentų mažiau sukauptas atlyginimo nei prižiūrėtojo; ant griebus sumaišytą su Toyota HSR, vidutinio 62 procentų padidėjimas virš elgesio klonavimas.
Zhang ir Cho SafeDAgger traktuokite klausimus į nuovokas politika kaip retas išteklius: atskiras saugą politika numato, be klausimu, ar pagrindinė politika ketina nuokrypti iš nuorodos virš ribos, ir tik tie būsenos yra įduoti. Visas trys reaguoti į tą pačią faktą - DAgger analizė apmoka nieko dėl eksperto žymas, ir tikrovė apmoka daug.
Dalis to, ką nė kas neperspėja apie
Žymėjimas iš-pasiskirstymo būsenos yra protiškai sunkesnė nei demonstravimas užduotį. Normalus demonstravimas reiškia vykdant variklio plano jūs jau turite. Korekcija politika, kuri yra padėti pirštinę kažkur jūs niekada nebūtų reiškia statydamas atsigavimas iš sviesto, po laiku spauda, su roboto dar judančiu. Tikėtis mažesnę naudingą minučių per seansa nei gryna įrašymo seansa, ir žiūrėti savo korekcija kokybę nykus per vieną.
LeRobot duomenų rinkinio struktūra nurodančia epizodus, rėmius ir per-rėmį stulpai kaip saugomi diskine
Korekcijai tapti duomenų rinkiniu tik, kai intervencijos rėmiai žymimi - LeRobot formatą, per-rėmį stulpas šalia stebėjimas ir veiksmų.
Ką tai reiškia SO-100 ant jūsų stalo
Vertinkite horizonta į savo vienetų. Dvidešimties sekundžių epizode esant 30 rėmius per sekundę yra 600 sprendimo žingsniai, ir T visų ribose yra tas skaičius. Ties T = 600, skirtumas tarp termino skalinio su T ir skalinio su T kvadratu yra skirtumas tarp politika, kuri atsigauna iš blogo priartėjimo ir viena, kuri negali.
veiksmų didindami

.
Antrasis vertinimas yra progreso metrika. Jūs negali matuoti epsilon pagal politika pačios pasiskirstymą tiesiogiai - tai reikalinga žemės-tiesa eksperto veiksmų kiekvienas aplankyta būsena, ką nors jūs bandote nežymiai sukurti. Ką žmogaus-vartuojama kilpa duoda jums vietoj yra intervencijos dalis: dalis iš rėmių į bėgimą, kuriame žmogumi yra paimtas per. Jis yra stovyklą, ir jis judėti priežasčių nesusije iki politika - pacientas operatorius intervencijas mažiau. Naudojamas konsistentiškai, jis yra vienas skaičius, kuris sako ar raundas buvo vertas popiet.
Trečias vertinimas yra duomenų-kokybės perspėjimas analizė nesijaučia. Mandlekar ir kolegų tyrinėti šešis neprisijungus mokymo algoritmus penki simuliavimo ir trys tikra-pasaulis daugiapakopė manipuliacijos užduotys, ir praneša jautrumas algoritmaing dizaino pasirinkimai, priklausomybė dėl kokybės iš demonstracija, ir variabilumo priežastis nuo sustabdymo kriterijus. Belkhale, Cui ir Sadigh tvirtinti, duomenų kokybė turėtų formalizuoti per veiksmų divergencija ir perėjimo šilumą, ir pastebėti, kad valstybės šilumą nėra visada naudinga. DAgger raundas prideda būsenas nėra kas sąmoningai pasirinkę: kai kurie yra atsigavimas duomenys jūs reikalas, kai kurie yra roboto negraudžiantis jums svaidydami dėl perimties kontrolę.Mechaniškai raundas yra šešti žingsniai: bėgimą išvadą su įrašymo ant, paimti per kada politika elgiasi blogai, peržiūrėti bėgimą ir dėl-vu kiekvienos epizodo, sinchronizuoti korekcijai, sudaryti mišrią duomenų rinkinį iš originalus plius korekcijai su epizodo pasirinkimas padaryti aiškiai per šaltinį, ir tęsti mokymą iš ankstesnis kontrolinis taškas o ne bazinis modelis. Į ay-robots tie žingsniai egzistuoti kaip mygtukai, kurie pašalina šildymo, bet ne sprendimą. Dvi pagyrimai: tęsdamasis iš kontrolinio taško inicijuoja svarmenys ir nėra optimizier atnaujinti, ir lyderio-rankos lyginimas žingsnis yra dar lengvai bandyta aparatūra. Žr. mokymas
ir
duomenų rinkiniai
.DAgger kilpa, jau suveltynytaPerimti per gyvą išvadą bėgimą, per-rėmį intervencijos žymėjimas, dėl-vu epizodai kaip korekcijai arba vertinimai, sudaryti mišrią duomenų rinkinį su aiškus epizodo pasirinkimas per šaltinį, ir tęsti mokymą iš egzistuoto kontrolinio taško yra visas sukurtas. Jūs vis dar nusprendžiate kada paimti per ir ką laikyti - tos dalies neatomatai.Žr., kaip DAgger kilpa darbaiŠeimos medis, vienoje lentelėjeMetodasKas renkasi būsenas
Ekspertas
| Švarus demonstracija | Nėra atsigavimas duomenys; klaida gali sukaupti kvadratiškai T | Priekin mokymas | Mokytojas, per laiko žingsnį |
|---|---|---|---|
| Žymas kartu indukuota pasiskirstymą | T atskiros politikos; negrąžima ilgi horizonta | SMILe / SEARN | Stochastinė mišinė eksperto ir mokytojas |
| Žymas kartu mišinio pasiskirstymą | Komponentai mišinio skiriasi kokybėje | DAgger | Mišri politika, beta nykus nuliu |
| Teisingas veiksmą kiekvienam aplankyta būsena | Žymėjimas būsenas ekspertas niekada sukūrė, nuo ne kontrolęje | DART | Ekspertas, trikdimas įneštas triukšmu |
| Demonstracija pagal kalibruotas triukšmu | Triukšmu turi būti kalibruotas prie mokytojas klaida | HG-DAgger | Mokytojas, kol žmogumi paimti per |
| Korekcijai tik žmogumi-vartuojama segmentais | Priklauso žmogumi nusprendimą apie kada intervencija | SafeDAgger | Mokytojas, filtruotas saugą vartą |
| Žymas tik kada vartai klauso | Vartai patys turi būti šiek tiek treniruoti ir pasitikėti | Dažnai užduoti klausimai | Ar aš iš tikrųjų stebėti kvadratinį klaidos augimą ant mano roboto? |
| Ne kaip švarus kreivę. Riba yra blogiausias atvejis: tiesa, nes kai kurie problema pasiekti jį, ne, nes jūsų. Ką jūs matyti yra pasekmė - politika, kuri taškai gerai ant atlaikomos rėmius, nepavyksta tikra užduotį, ir negerina, kada jūs įrašyti daugiau iš to paties. Jeigu daugiau švarus duomenų baigiasi pagalba, kas kovariacinis poslinkis, ne duomenų-tūrio problema. | Ar aš turėti implementuoti beta mišinio į vadinti jį DAgger? | Parametru-laisvoji versija - ekspertas raunde vienas, gryna mokytojas po - yra teisėtas ypatingas atvejis ir dažnai atliki geriausią originalaus bandymo. Ką jūs negali šalinti yra agregacija: peratrenirimas tik ant naujausios korekcijai nutraukti Sekti-Lyderį interpretacija, kuris yra kur be-žalos argumentas ateina iš. Mokymas korrekcijai vienas yra daug silpnesnis procedūra. | Kodėl grąžinti geriausia politika ant validavimo rinkinio, o ne paskutinis? |
Nes teoremos garantija gerai politika egzistuoti kažkur iš sekos, ne tas tai yra galutinis pasikartoti - riba yra ant minimalaus virš sekos. Siuntimas kas atėjo iš paskutinio raundo atmetimas nustatyto sąlyga rezultato, ir paskutinis raundas nėra patikimai geriausia.
Kiek raundų turėčiau plano?▾
Teorija nori iteracijų apie T tvarka, kurie šešiasdešimties sekundžių epizode nėra skaičius kas-nors bėga ant aparatūra. Originalios bandymu buvo dvidešimties iteracijų kiekvienas benchmarko. Praktikoje jūs bėgimą raundai iki intervencijos dalis baigiasi kritimas, daug žemiau skaičius analizė prielaido - tikra spraga teorija ir praktika.
Ką jei mano politika klasė paprasčiausiai negali atstovauti eksperto?▾
Tada DAgger nedaryti jums gelbą, ir riba sako - jis yra reikštas santykyje prie epsilon_N, geriausias nuostolis klasėje atgal. Jeigu, kuris yra didelis dėl klaidingos architektūros, nuovarginę stebėjims arba kamera, kuri negali matyti scenos, agregacija duoda jums politika, kuris yra optimalūs dėl klasę negali padaryti užduotį. Bėgimą atvira-kilpa atsakai prieš atlaikotos epizodai prieš jūs rinkti korekcijai.
Kur eiti iš čia▾
Jeigu jūs nėra treniravę politiką dar, šios teorios yra anksti: įrašyti duomenų rinkinio pirmas, pradedant nuo
mokyti jūsų pirmu politika▾
ir
darbastalio kliento▾
. Jeigu jūs yra svėrimo kitą šimtą švarus demonstracija prieš pradeda korekcijai: švarus demonstracija nedaryti taisyti pasiskirstymo problema. Dėl mechanika, tęsti su
žmogaus-vartuojama varianta
ir tada SO-100 walkthrough.darbastalio kliento. Jeigu jūs yra svėrimo kitą šimtą švarus demonstracija prieš pradeda korekcijai: švarus demonstracija nedaryti taisyti pasiskirstymo problema. Dėl mechanika, tęsti su žmogaus-vartuojama varianta ir tada SO-100 walkthrough.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started