Abstraktus roboto manipuliacijos scenos vaizdavimas, iliustruojantis būsenos pasiskirstymą, kurį mokytas politika aplankė vykdymo metu
DAggerImitacinis mokymasElgesio klonavimasRoboto mokymasTeorija

DAgger paaiškinta: kodėl elgesio klonavimas nusidrasko ir ką iš tiesų įrodo duomenų agregacija

AY-Robots ResearchAugust 27, 202615 min skaitymo

Elgesio klonavimas atitinka politiką ekspertų būsenos pasiskirstymui ir tada diegiama savarankiškai. Skirtumas tarp tų dviejų pasiskirstymų yra todėl, kad politika, kuri atrodo gerai validavimo metu, nušoka nuo stalo 300-ame žingsnyje. Tai mūsų DAgger serijos teorija: iš kur atsiranda kvadratinis klaidos terminas, ką keičia duomenų agregacija, ką numano be-žalos įrodymas ir kurią sąskaitą dar turi mokėti žmonių ekspertas.

Yra specifinė klaida, su kuria anksčiau ar vėliau susiduria kiekvienas, kuris treniruoja manipuliacijos politiką. Politika siekia kubo, priartėja dvi centimetrus, svyruoja, nusidrasko į šalį, tada daro ką nors, nedalyvaudama užduotyje. Validavimo nuostoliai buvo gerai. Atvira kilpa, grąžinta į atliktus epizodus, buvo gerai. Ir vis tiek ranka baigiasi padėtyje, kurios nėra mokymo duomenyse, ir iš ten ji neturi ką prasmingo pasakyti.

Ta klaida turi vardą ir nustatytas teorinius pagrindus. Tai yra pirmasis iš keturių straipsnių apie DAgger, ir jis apima pačią argumentaciją: kodėl politikos pritaikymas demonstratoriaus paties trajektorijoms sukuria klaidą, kuri gali augti su epizodo ilgio kvadratu, ką keičia duomenų agregacija ir ką be-žalos įrodymas neviešina. Kilpa su realia aparatūra yra aprašyta DAgger kilpos paleidimas SO-100, žmonių vartuojama varianta HG-DAgger ir žmonių vartuojamos intervencijos, ir matavimo klausimą DAgger kilpos matavimas.

Trumpa versija

  • Elgesio klonavimas treniruoja eksperto būsenos pasiskirstymą ir vertinamas pagal pačios politikos. Neatitikimas didėja per epizodą.
  • Ross ir Bagnell parodė papildomąją sąnaudą gali augti kaip T kvadratu kartų per žingsnio klaidai; DAgger straipsnis nurodo tą ribą ir pastebėja, kad ji yra tiesa.
  • DAgger žymi būsenas, kurias pati politika aplankė, ir peratrenira kiekvieną nubrėžtą duomenų rinkinį, o ne tik naujausią.
  • Garantija yra sumažinimas į be-žalos interneto mokymą: agregavimas ir peratrenirimas yra Sekti lyderį.
  • Tai galioja santykius su geriausiu nuostoliu pasiekiamu politikos klasėje, o ne santykius su nuliu - ir ekspertas vis tiek turi žymėti būsenas, kurias jis niekada nebūtų sukūręs.

Prielaida, kurią tyliai daro elgesio klonavimas

Demonstravimo duomenų rinkinys yra stebėjimo-veikimo porų krūva. Elgesio klonavimas atitinka funkciją tai krūvai su įprastu prižiūriku mokymusi ir sustoja. Tai yra seniausia idėja srityje. Pomerleau ALVINN, 1988 metais, buvo trisloji atgalinę sklaidą esanti tinklo klasė, kuri paėmė vaizdinius iš kameros ir lazerinės nuotolio ieškiklio ir sukūrė kryptį, į kurią turėtų keliauti transporto priemonė; ji buvo treniruota simuliuotais kelio vaizdinius ir sekė tikrusias kelias esant tam tikroms lauko sąlygoms. Receptas nėra daug pasikeitusia; tinklai turi.

Tai, kas praleidiama, yra patikrinimas, iš kur tos poros atsirado. Kiekvienas iš jų sėdi trajektorijoje, kurią demonstratorius sukūrė. Politika, kurią diegiasi, sukuria savo. Greitai, kai jis nukrypsta, jis klausiamas apie būsenas, kurios nebuvo mokymo pasiskirstyme, ir jo atsakymas jį pajuda toliau. Ross, Gordon ir Bagnell atidaro DAgger straipsnį su tuo tiksliai: nuosekli numatymas pažeidžia i.i.d. prielaidą po statistiniu mokymusi, nes mokytojo paties numatymai nustato įvestis, kurias jis mato toliau.

Aiškiausia iliustracija tame straipsnyje nėra roboto visai. Beveik optimalaus planisto klonavimas Super Mario Bros. sukūrė politiką, kuri pakartotinai įstrigo į kliūtį, o ne per ją šoko. Priežastis yra visa argumentacija vienoje frazėje: ekspertas visada šoko iš patogaus atstumo, todėl duomenų rinkinyje nebuvo jokios būsenos, kurioje Mario būtų prispaustas prie kliūties, todėl nėra žymės, ką daryti, kai jis buvo.

Pakeiskite Mario dėl SO-100 rankos ir struktūra yra identiska. Jūsų demonstracijos rodo švarius priartėjimus ir švarius griebus, o ne pirštinę, užsidariusią dvi centimetrus trumpai - todėl politika neturi supratimo, ką daryti iš ten, ir kas nors, ką jis spėja, jį pajuda toliau. Kovariacinis poslinkis yra duomenų rinkimo procedūros savybė, o ne tinklo architektūra.Iš kur atsiranda kvadratinis terminas2010 AISTATS straipsnis Ross ir Bagnell,

Efektyvūs imitacinio mokymo sumažinimai

, daro kaupimąsi tikslų. Tegul T yra užduoties horizonta, tegul užduoties savikaina būtų ribota vienetu intervalu, ir tegul epsilon yra surogatinis nuostolis, išmatuotas po eksperto būsenos pasiskirstymu - skaičius, kurį praneša jūsų validavimo rinkinys. Tada šios politikos pagalva, kuri buvo paleista T žingsnių, yra T kvadratu kartų epsilon ribota. Ross, Gordon ir Bagnell nurodo tai kaip Teoremą 2.1 DAgger straipsnyje ir prideda frazę, kuris reikalingas: riba yra tiesa. Uždaviniai egzistuoja, kur politika su epsilon nuostoliu eksperto pasiskirstyme iš tikrųjų patiria papildomą sąnaudą, augančią kvadratiškai T.Tiesa nėra tipinė. Kvadratinis terminas yra blogiausias atvejis per problemų klasę, o ne numatymas apie jūsų paimdavo-ir-padėkite užduotį. Tai, ką jis nustato, yra tai, kad daugiau eksperto demonstracijos negali šalinti problemą: jis tik paaštrėja epsilon įvertinimą pasiskirstymui, kuriame politika nebus bandyta.Bėgimo maršrutas yra tame pačiame straipsnyje, iš naujo nurodomas kaip Teorema 2.2. Jei politika pasiekia nuostolį epsilon po jos pačios būsenos pasiskirstymu, ir vienas neteisingas veiksmas išlaida daugiausia u pagal atsigavimo sumą eksperto, papildoma sąnada yra u kartų T kartų epsilon ribojama - tiesa horizonto. Konstanta u yra įdomus dydis: daugiausia 1, kai 0-1 nesutarimu su eksperto, ir O(1), kai ekspertas gali atsigauti per kelis žingsnių. Pioriausiu atveju jis yra O(T), ir tiesa riba yra tada ne geriau nei kvadratinė.NustatymasRiba dėl papildomo nuostolio virš eksperto

Ką jis remiasi

Elgesio klonavimas (Ross & Bagnell 2010, iš naujo nustatytas kaip Thm. 2.1 Ross et al. 2011)T kvadratu kartų epsilonepsilon išmatuotas eksperto būsenos pasiskirstyme; savikaina [0,1]; riba yra tiesa

Bet kokia politika su epsilon nuostoliu pagal jos pačios pasiskirstymą (Thm. 2.2)u kartų T kartų epsilonu riboja atsigavimo sumą vieno neteisingai veiksmui; daugiausia 1, kai 0-1 nuostolys, O(T) blogiausiu atveju
Priekin mokymas (Ross & Bagnell 2010)u kartų T kartų epsilonvienas politika per žingsnį; reikalingas T politikos ir žinomas, baigtinis T
SMILe (Ross & Bagnell 2010)beveik tiesa T ir epsilon į kai kurias problemų klasesalpha O(1/T kvadratu), N O(T kvadratu log T); duoda stochastinę mišinę
DAgger (Thm. 3.2, Ross et al. 2011)u kartų T kartų epsilon_N, plius O(1)N apie uT tvarka; stipriai išgaubtas ribojamas nuostolis; be-žalos mokytojas; epsilon_N yra geriausias nuostolis atgal
Roboto darbastalis, atstovaujantis būsenas, kurias politika aplankė ir kuri niekada nepasireiškė demonstravimo rinkinyjeBūsenos, kurios svarbi DAgger raundui yra tie, kuriuos niekas nedemonstravęs: beveik pasisekęs griebimas, pusiau atviras pirštinė, ranka objekto praeityje.Dvi bandymai prieš DAgger
Priekin mokymas yra sąžiningas, bet nepraktiškas atsakymas. Mokykitės atskiros politikos kiekvienam laiko žingsnį, tvarka, kiekvienam pagal būsenos pasiskirstymą, kurį sukūrė politikos jau fiksuoti ankstesni žingsniai, todėl kiekviena politika mato tiksliai pasiskirstymą, su kuriuo jis susidurti. Lova yra aprašyme: T politikos, treniruojamos nuosekliai, nėra ankstyvo baigymo.epizodą per sekundę, T yra šimtais.
SMILe, iš to paties straipsnio, ir SEARN, iš Daume, Langford ir Marcu darbos struktūroje numatymo, imtis kitą kelią: viena stacionari politika, bet stochastinė. Kiekvienas kartojimas treniruoja komponentą ir prideda jį į mišinį, perkeldamas tikimybės masę iš eksperto. Rezultatas yra mišinys, kuriame kai kurie komponentai yra blogesnę nei kiti - ant fizinio ginklo, kontroleris, kuris gali pavyzdžiui pablogintą komponentą per judesį. Tai nurodytas motyvacija norint
determinuotą

politiką vietoj.

DAgger: viena idėja, vienas langelisDuomenų agregacija išlaiko determinuotą politiką ir persikelia taisymo į duomenų rinkimą. Kiekvienas raundas: išvirtite esamą politiką, įrašykite būsenas, kurias jis aplankė, paprašykite eksperto, ką teisingas veiksmą būtų buvęs kiekviename, pridėti tas poras prie duomenų rinkinio, kurį jūs jau turite, peratrenira dėl sąjungos. Vardas yra algoritmas - jūs agregatai, jūs niekada nešalinate.DAgger meta-algoritmo, Algoritmas 3.1 Ross, Gordon & Bagnell (2011).

Trys detalės nešioja daugiau svorio nei jos atrodo. Žymės yra būsenos, kurias aplankė mišri politika, bet veikla suteikta eksperto - politika suteikia klausimus, ekspertas atsakymus. Peratrenirimas yra ant viso agregato, kuris daro kiekvieną raundą Sekti-Lyderį žingsnį: per raundą n jūs renkate geriausią politiką atgal visos trajektorijos iki šiol. Tai rėminimas yra tai, ką pagrindžia įrodymas. Ir algoritmas baigiasi grąžindamas geriausią politiką iš sekos kaip pasirinktas su validavimo rinkiniu, nes teoremos garantuoja, kad kai kurią politika iš sekos yra gerai, o ne paskutinis.

Beta grafikas, ir kodėl jis nėra tinimo žaismas

Mišri politika yra beta_i kartų ekspertas plius vienas minus beta_i kartų mokytojas. Taškas yra praktiškas: pirmaisiais nustatyti politikos yra treniruojamos labai mažai duomenų, daro daug klaidų, ir kitaip praleisty raundą į būsenas, kurios tampa nereikalinga, kai politika pagerėja.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
Teorija primato tiksliai viena sąlyga: bėgimo vidutinis betas turi eiti nulį. Analizė veikia su beta_i ribojama (1 - alfa) laipsnį i-1, dėl konstantos alfa, nepriklausoma nuo T.

GrafikasKą jis daroKą straipsnis praneša

beta_1 = 1

Pirmasis raundas yra gryna eksperto demonstracija; nereikalinga pradinė politika

Rekomenduojamas pradinis taškas kiekvieniame variante

beta_i = 1 jei i = 1, kitaip 0Ekspertas tik pirmame raunde; nėra laisvo parametroStraipsnio parametru-laisvoji versija, kurią jis sako dažnai atliekama geriausią praktikoje; 2980 ant Super Mario Bros. po 20 iteracijų
beta_i = p^(i-1) su p = 0.5Eksperto tikimybė nyksta geometriškai3030 ant to paties benchmarko, šiek tiek prieš parametru-laisvą versiją
beta_i = p^(i-1) su p = 0.9Ekspertas išlieka kilpoje daug ilgiauŽymiai lėtesnis konvergencija; vis dar gerėja, kai 20 iteracijų baigtas
Skirtumas tarp 2980 ir 3030 į skalę, bėgantis į maždaug 4300 yra mažas, bet straipsnio paaiškinimas yra naudingiausias praktinis pastaba skyriuje. Su parametru-laisvą grafiką, Mario įstrigo toje pačioje vietoje anksti ir sukūrė masę beveik pasikartojančiais duomenimis iš tą vietą; leidimas ekspertui vairuoti dalelę laiko tiek jį atlaisvo ir išplėtė būsenos šilumą. Grafikas yra mažiau apie mišinio santykį nei apie tai, ar jūsų duomenų rinkimas nuolat sukuria naujas būsenas ar tą pačią klaidą.Kodėl grafikas neperkeliama į fizinę ranką, kaip parašytaStochastinė per laiko žingsnį mišinio reiškia perjungti kontrolę valdžią valdžia per valdžios norma, 30 kartų per sekundę ant tipinio SO-100 nustatymo. Jokia teleoperation sąsaja nedaro to saubia ar prasminga. Ant tikra aparatūra beta grafikas suteikia kelią žmonių sprendimui apie kada perimti: skirtingas algoritmas su skirtinga analize.
Garantija: sumažinimas į be-žalos interneto mokymąČia yra žingsnis, kuris daro straipsnį tuo, kas jis yra. Traktuokite kiekvieną DAgger raundą kaip vieną pavyzdį interneto mokymo problemoje, kur nuostolis pas raundą i yra surogatinis nuostolis pagal politikos naudojamo būsenos pasiskirstymą per raundą i. Mokytojas įsipareigoja politika prieš pamatydamas tą nuostolį, ir seka yra ne-stacionari, nes ji priklauso nuo politikos, parengtos iki šiol.Algoritmas yra be-žalos, jei jo vidutinis nuostolis per N raundus priartėja prie geriausio vieno politika atgal. Sekti-Lyderį ant stipriai išgaubtas nuostoliais yra tokia algoritmas, su vidurkiu atsigeistu sutūpimas 1/N tvarka - ir peratrenirimas ant viso agregato yra tiksliai Sekti-Lyderį. Bet koks kitas be-žalos mokytojas tarnauti taip pat: analizė yra sumažinimas, o ne savybė vienas optimizier.

Vienas lemma sviesčia tarpą tarp mišrios politikos, kuri rinko duomenis ir nubrėžtos politikos, kuri bus diegiama: Lemma 4.1 riboja L1 atstumą tarp jų pasiskirstymų 2 T beta_i. Tai kodėl betas turi nykus - nuo eksperto dar laiko vertybę kontrolės valdžios, būsenos jūs rinkti nėra būsenos, kurias jūsų politika sukurs. Derinkite lemą pagal regret ribą ir pagrindiniai rezultatai sekite: po maždaug T iteracijų, kai kurie politika iš sekos turi surogatinis nuostolis pagal jos pasiskirstymą dėl O(1/T) iš epsilon_N. Prašalinti šioje tiesią ribą ir jūs laipu Teoremoje 3.2.

Empirinė pusė yra kuklus pagal dabartinius standartus. Į Super Tux Kart prižiūrimas bazė negerino vidutinis smūgius per ratą, kai daugiau duomenų atėjo, DAgger pasiekės politika, kuri niekada nenukrito nuo kelio po penkiolika iteracijų, ir SMILe po dvidešimties dar nukrito maždaug du kartus per ratą. Ant rašybos benchmarko, ženklo tikslumas buvo 82 procentų be struktūros, 83.6 procentų prižiūrėjo, 85.5 procentų su DAgger. Nė vienas iš jų nėra manipuliacijos rezultatas.

Ką įrodymas neviešina

Teoremos teiginiai yra sąlyginiai, ir sąlygos yra sunumeruotos.

DAgger garantija, nuodugniai perskaityta

Ką jis duoda jums

Ką jis neduoda jums

Riba tiesa, o ne kvadratinė T, pagal nustatytą prielaidas.

Stacionari determinuota politika, o ne stochastinė mišinė.

Tikra sumažinimas: bet koks be-žalos interneto mokytojas įdeda į.

Betono iteracijos skaičius - maždaug T raundai prieš regret terminas pasmerktas nereikalingas.
Garantija bent vieno politika iš sekos, todėl galutinis validavimo praėjimas.
  • Jis reikalingų be-žalos metodo arba stipriai išgaubtas surogatinis nuostolis - stipresnis nei klasifikacija sumažinimu jis pastatyti su, kaip autoriai pastebėti.
  • Konstanta u gali būti O(T) blogiausiu atveju, ir tiesa riba yra tada surinka grįžti į kvadratinę.
  • Jis riboja iteracijas, o ne eksperto žymas. Ant roboto, žymas yra biudžetas.
  • Jis prielaido ekspertas gali būti klausiamas ties kiekviena aplankyta būsena ir atsakyti teisingai. Tai prielaido yra visa sąnada.
  • Vienas toliau rezultatą dažnai cituojamas kaip paneigimas ir nėra vienas. Rajaraman, Yang, Jiao ir Ramachandran tyrinėti minimax ribas imitacinio mokymo episodinėje MDPs su baigtinio valstybės S ir horizonto H, ir prokuruoti suboptimalumo apačioje riba apie |S| H kvadratu žemyn N, kurie laiko net, kai mokytojas gali aktyviai klausti eksperto aplankyte būseną. Tai blogiausio-atvejis norma per MDPs klasę fiksuotoje episodo biudžete, ir ką jis paaišnudu yra mintis, kad sąveika pagerina minimax norma; DAgger teorema yra kitokios teiginys, ribojant diegiamą politiką santykiais ką jos pačios politika klasė gali pasiekti.
Jis santykius pagal epsilon_N, geriausias nuostolis klasėje atgal, ne santykiais nuliu. Jei jūsų klasė negali atstovauti eksperto, jis tuščias praktikoje.
  • Swamy, Choudhury, Bagnell ir Wu vėliau klasifikuoti šias algoritmus, kurie laipsnių eksperto elgesio jie sutampa, ir pristatinėjo nuovarginę momento atkūrimo, kuri skelbia kaip gerai kiekviena šeima suavoja kaupiantis klaidą. Apžvalga Osa ir Celemin apima algoritminio peizažą ir žmogaus-atsiliepimo sąsajas.
  • Sąskaita: žymėti būsenas, kuriuos ekspertas niekada nesukūrė
  • Visas viršuje prielaidos ekspertas, kuris gali būti klausiamas visur. Simuliacijoje su planu, kuris yra beveik nemokamai - Mario bandymai naudojami beveik-optimalaus plano su visa prieiga prie žaidimo valstybė. Su žmogumi ant roboto jis yra išlaidos dominas, ir keistas vienas: žmogumi turi sukurti teisingą veiksmą konfigūracijoje jų pačios kompetencija niekada būtų sukūrę.
  • Kelly, Sidrane, Driggs-Campbell ir Kochenderfer pasakyti objektą tiesiogiai HG-DAgger straipsnyje. Vanilla DAgger reikalinga eksperto, kad teiktų veiksmą žymas nuo ne yra visai kontrolę sistemos. Tai sumažina saugą, ir su žmogumi ekspertai labai tikėtina pabloginti kokybę iš surinktos žymas, kurie jie nukelti į suvoktas aktuatorius lag. Žyma jūs gauti atgal nėra žyma algoritmas prielaido.
  • Laskey ir kolegų ataka problema iš kito šono su DART, ir jų rėminimas yra tiesus: on-policy metodai yra nuobodūs žmogaus prižiūrėtojai, pridėti skaičiavime apkrova, ir gali aplankyte pavojingus būsenas per mokymą. Jų alternatyva inžinieriai kalibruotas triukšmas į prižiūrėtojo paties demonstracija, todėl atsigavimas gauna demonstravimas be roboto niekada veikti nepatikimas politika. Ant MuJoCo Humanoid jie praneša DART sumažinus prižiūrėtojo sukauptos atlyginimo 5 procentų per mokymą, nors DAgger vykdo politikos su 80 procentų mažiau sukauptas atlyginimo nei prižiūrėtojo; ant griebus sumaišytą su Toyota HSR, vidutinio 62 procentų padidėjimas virš elgesio klonavimas.

Zhang ir Cho SafeDAgger traktuokite klausimus į nuovokas politika kaip retas išteklius: atskiras saugą politika numato, be klausimu, ar pagrindinė politika ketina nuokrypti iš nuorodos virš ribos, ir tik tie būsenos yra įduoti. Visas trys reaguoti į tą pačią faktą - DAgger analizė apmoka nieko dėl eksperto žymas, ir tikrovė apmoka daug.

Dalis to, ką nė kas neperspėja apie

Žymėjimas iš-pasiskirstymo būsenos yra protiškai sunkesnė nei demonstravimas užduotį. Normalus demonstravimas reiškia vykdant variklio plano jūs jau turite. Korekcija politika, kuri yra padėti pirštinę kažkur jūs niekada nebūtų reiškia statydamas atsigavimas iš sviesto, po laiku spauda, su roboto dar judančiu. Tikėtis mažesnę naudingą minučių per seansa nei gryna įrašymo seansa, ir žiūrėti savo korekcija kokybę nykus per vieną.

LeRobot duomenų rinkinio struktūra nurodančia epizodus, rėmius ir per-rėmį stulpai kaip saugomi diskine

Korekcijai tapti duomenų rinkiniu tik, kai intervencijos rėmiai žymimi - LeRobot formatą, per-rėmį stulpas šalia stebėjimas ir veiksmų.

Ką tai reiškia SO-100 ant jūsų stalo

Vertinkite horizonta į savo vienetų. Dvidešimties sekundžių epizode esant 30 rėmius per sekundę yra 600 sprendimo žingsniai, ir T visų ribose yra tas skaičius. Ties T = 600, skirtumas tarp termino skalinio su T ir skalinio su T kvadratu yra skirtumas tarp politika, kuri atsigauna iš blogo priartėjimo ir viena, kuri negali.

Tai yra dalis, kodėl veiksmų didindami padeda: kada politika skleidžia trumpą veiksmų seką per išvadą žingsnis, skaičius sprendimo taškai krituliai, ir iš ten yra mažiau šansų sukaupti. Zhao, Kumar, Levine ir Finn vardas kaupiantis klaida kaip motyvacija, Veiksmų Didindami su Transformers, ir praneša 80 prie 90 procentų sėkmė ant šešias sunkias tikra-pasaulis užduotys, ant mažo-sąnaudų bimanual aparatūra, iš dešimties minučių vertas demonstracija. Didindami nešalina kovariacinį poslinkį - būsenos yra vis dar politika pačios - bet trumpina veiksmingo horizonta. Žr.

veiksmų didindami

 ir
SO-100 imitacinio mokymo vadovas

.

Antrasis vertinimas yra progreso metrika. Jūs negali matuoti epsilon pagal politika pačios pasiskirstymą tiesiogiai - tai reikalinga žemės-tiesa eksperto veiksmų kiekvienas aplankyta būsena, ką nors jūs bandote nežymiai sukurti. Ką žmogaus-vartuojama kilpa duoda jums vietoj yra intervencijos dalis: dalis iš rėmių į bėgimą, kuriame žmogumi yra paimtas per. Jis yra stovyklą, ir jis judėti priežasčių nesusije iki politika - pacientas operatorius intervencijas mažiau. Naudojamas konsistentiškai, jis yra vienas skaičius, kuris sako ar raundas buvo vertas popiet.

Trečias vertinimas yra duomenų-kokybės perspėjimas analizė nesijaučia. Mandlekar ir kolegų tyrinėti šešis neprisijungus mokymo algoritmus penki simuliavimo ir trys tikra-pasaulis daugiapakopė manipuliacijos užduotys, ir praneša jautrumas algoritmaing dizaino pasirinkimai, priklausomybė dėl kokybės iš demonstracija, ir variabilumo priežastis nuo sustabdymo kriterijus. Belkhale, Cui ir Sadigh tvirtinti, duomenų kokybė turėtų formalizuoti per veiksmų divergencija ir perėjimo šilumą, ir pastebėti, kad valstybės šilumą nėra visada naudinga. DAgger raundas prideda būsenas nėra kas sąmoningai pasirinkę: kai kurie yra atsigavimas duomenys jūs reikalas, kai kurie yra roboto negraudžiantis jums svaidydami dėl perimties kontrolę.Mechaniškai raundas yra šešti žingsniai: bėgimą išvadą su įrašymo ant, paimti per kada politika elgiasi blogai, peržiūrėti bėgimą ir dėl-vu kiekvienos epizodo, sinchronizuoti korekcijai, sudaryti mišrią duomenų rinkinį iš originalus plius korekcijai su epizodo pasirinkimas padaryti aiškiai per šaltinį, ir tęsti mokymą iš ankstesnis kontrolinis taškas o ne bazinis modelis. Į ay-robots tie žingsniai egzistuoti kaip mygtukai, kurie pašalina šildymo, bet ne sprendimą. Dvi pagyrimai: tęsdamasis iš kontrolinio taško inicijuoja svarmenys ir nėra optimizier atnaujinti, ir lyderio-rankos lyginimas žingsnis yra dar lengvai bandyta aparatūra. Žr. mokymas

ir

duomenų rinkiniai

.DAgger kilpa, jau suveltynytaPerimti per gyvą išvadą bėgimą, per-rėmį intervencijos žymėjimas, dėl-vu epizodai kaip korekcijai arba vertinimai, sudaryti mišrią duomenų rinkinį su aiškus epizodo pasirinkimas per šaltinį, ir tęsti mokymą iš egzistuoto kontrolinio taško yra visas sukurtas. Jūs vis dar nusprendžiate kada paimti per ir ką laikyti - tos dalies neatomatai.Žr., kaip DAgger kilpa darbaiŠeimos medis, vienoje lentelėjeMetodasKas renkasi būsenas

Ką ekspertas suteikia

Pagrindinė savikaina

Elgesio klonavimas

Ekspertas

Švarus demonstracijaNėra atsigavimas duomenys; klaida gali sukaupti kvadratiškai TPriekin mokymasMokytojas, per laiko žingsnį
Žymas kartu indukuota pasiskirstymąT atskiros politikos; negrąžima ilgi horizontaSMILe / SEARNStochastinė mišinė eksperto ir mokytojas
Žymas kartu mišinio pasiskirstymąKomponentai mišinio skiriasi kokybėjeDAggerMišri politika, beta nykus nuliu
Teisingas veiksmą kiekvienam aplankyta būsenaŽymėjimas būsenas ekspertas niekada sukūrė, nuo ne kontrolęjeDARTEkspertas, trikdimas įneštas triukšmu
Demonstracija pagal kalibruotas triukšmuTriukšmu turi būti kalibruotas prie mokytojas klaidaHG-DAggerMokytojas, kol žmogumi paimti per
Korekcijai tik žmogumi-vartuojama segmentaisPriklauso žmogumi nusprendimą apie kada intervencijaSafeDAggerMokytojas, filtruotas saugą vartą
Žymas tik kada vartai klausoVartai patys turi būti šiek tiek treniruoti ir pasitikėtiDažnai užduoti klausimaiAr aš iš tikrųjų stebėti kvadratinį klaidos augimą ant mano roboto?
Ne kaip švarus kreivę. Riba yra blogiausias atvejis: tiesa, nes kai kurie problema pasiekti jį, ne, nes jūsų. Ką jūs matyti yra pasekmė - politika, kuri taškai gerai ant atlaikomos rėmius, nepavyksta tikra užduotį, ir negerina, kada jūs įrašyti daugiau iš to paties. Jeigu daugiau švarus duomenų baigiasi pagalba, kas kovariacinis poslinkis, ne duomenų-tūrio problema.Ar aš turėti implementuoti beta mišinio į vadinti jį DAgger?Parametru-laisvoji versija - ekspertas raunde vienas, gryna mokytojas po - yra teisėtas ypatingas atvejis ir dažnai atliki geriausią originalaus bandymo. Ką jūs negali šalinti yra agregacija: peratrenirimas tik ant naujausios korekcijai nutraukti Sekti-Lyderį interpretacija, kuris yra kur be-žalos argumentas ateina iš. Mokymas korrekcijai vienas yra daug silpnesnis procedūra.Kodėl grąžinti geriausia politika ant validavimo rinkinio, o ne paskutinis?

Nes teoremos garantija gerai politika egzistuoti kažkur iš sekos, ne tas tai yra galutinis pasikartoti - riba yra ant minimalaus virš sekos. Siuntimas kas atėjo iš paskutinio raundo atmetimas nustatyto sąlyga rezultato, ir paskutinis raundas nėra patikimai geriausia.

Kiek raundų turėčiau plano?

Teorija nori iteracijų apie T tvarka, kurie šešiasdešimties sekundžių epizode nėra skaičius kas-nors bėga ant aparatūra. Originalios bandymu buvo dvidešimties iteracijų kiekvienas benchmarko. Praktikoje jūs bėgimą raundai iki intervencijos dalis baigiasi kritimas, daug žemiau skaičius analizė prielaido - tikra spraga teorija ir praktika.

Ką jei mano politika klasė paprasčiausiai negali atstovauti eksperto?

Tada DAgger nedaryti jums gelbą, ir riba sako - jis yra reikštas santykyje prie epsilon_N, geriausias nuostolis klasėje atgal. Jeigu, kuris yra didelis dėl klaidingos architektūros, nuovarginę stebėjims arba kamera, kuri negali matyti scenos, agregacija duoda jums politika, kuris yra optimalūs dėl klasę negali padaryti užduotį. Bėgimą atvira-kilpa atsakai prieš atlaikotos epizodai prieš jūs rinkti korekcijai.

Kur eiti iš čia

Jeigu jūs nėra treniravę politiką dar, šios teorios yra anksti: įrašyti duomenų rinkinio pirmas, pradedant nuo

mokyti jūsų pirmu politika

ir

darbastalio kliento

. Jeigu jūs yra svėrimo kitą šimtą švarus demonstracija prieš pradeda korekcijai: švarus demonstracija nedaryti taisyti pasiskirstymo problema. Dėl mechanika, tęsti su

žmogaus-vartuojama varianta

ir tada SO-100 walkthrough.darbastalio kliento. Jeigu jūs yra svėrimo kitą šimtą švarus demonstracija prieš pradeda korekcijai: švarus demonstracija nedaryti taisyti pasiskirstymo problema. Dėl mechanika, tęsti su žmogaus-vartuojama varianta ir tada SO-100 walkthrough.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started