Apstraktna vizuelizacija scene robotske manipulacije, ilustrujući distribuciju stanja koju naučena politika posjeći tijekom izvršavanja
DAggerImitation LearningBehavior CloningRobot LearningTeorija

DAgger Objašnjeno: Zašto se Behavior Cloning Klizi i što Dataset Aggregation Zapravo Dokazuje

AY-Robots ResearchAugust 27, 202615 min čitanja

Behavior cloning uklapa politiku na distribuciju stanja eksperta i zatim je implementira sa vlastitom. Razlika između te dvije distribucije je razlog što politika koja izgleda dobro pri validaciji pada sa stola u koraku 300. Ovo je теorijski dio naše DAgger serije: odakle dolazi kvadratni termin greške, što dataset aggregation mijenja, što dokaz bez kajanja pretpostavlja i koji dio računa čovjek-ekspert još mora platiti.

Postoji specifična greška koju će svatko tko trenira manipulacijsku politiku prije ili kasnije susresti. Politika dopira do kocke, dolazi unutar dva centimetra, čini se nesigurnom, klizi sa strane, zatim radi nešto nevezano za zadatak. Validacijski gubitak je bio dobar. Open-loop reprodukcija protiv izdvojenih epizoda je bila dobra. I dalje, ruka završi u pozi koja se nikada ne pojavljuje u podacima za trening, i odatle nema ničega pametnog što bi mogla reći.

Ta greška ima ime i uspostavljenu teoretsku podlogu. Ovo je prvi od četiri članka o DAgger, i pokriva sam argument: zašto preuređivanje politike na vlastitim trajektorijama demonatratora proizvodi grešku koja može rasti sa kvadratom dužine epizode, što dataset agregacija mijenja i što dokaz bez kajanja ne obećava. Petlja na pravoj hardveru je pokrivena u pokretanju DAgger petlje na SO-100, varijanta s čovjekom koja drži kapiju u HG-DAgger i čovjek-drže intervencije, i mjerenja pitanja u mjerenja DAgger petlje.

Kratka verzija

  • Behavior cloning trenira na distribuciji stanja eksperta i vrednuje se na vlastitoj. Neusklađenost se sabija tijekom epizode.
  • Ross i Bagnell pokazali da dodatni troškak može rasti kao T na kvadrat puta greška po koraku; DAgger rad ponovno iznosi tu granicu i primjećuje da je tesna.
  • DAgger označava stanja koja sama politika posjeći, i ponovo trenira na svakom skupu podataka prikupljenom do sada, a ne samo na novom.
  • Garancija je redukcija na no-regret online learning: agregacija i ponovno trening je Follow-The-Leader.
  • Drži se relative na najbolji gubitak koji se može postići u klasi politike, a ne relativno na nulu - i ekspert još mora označiti stanja koja nikada ne bi mogla proizvesti.

Pretpostavka koju behavior cloning tiho čini

Skup demonstracijskih podataka je gro pari opažanja-akcije. Behavior cloning uklapa funkciju u tu gro sa običnim nadgledanim učenjem i tu stane. To je najstarija ideja u polju. Pomerleau ALVINN, 1988., bila je troslojna mrežа sa propagacijom unazad koja je uzimala slike sa kamere i laserskog daljinskog mjerača i proizvela pravac kretanja vozila; trenirana je na simuliranim cestovnim slikama i slijedila je prave ceste pod nekim terenskim uvjetima. Recept se nije mnogo promijenio; mreže jesu.

Šta se preskače je provjera odakle su ti parovi došli. Svaki od njih leži na trajektoriji koju je demonstrator proizveo. Politika koju implementirate proizvodи svoju. U trenutku kada se razlikuje, biva je upita o stanjima koja nisu bila u distribuciji treninga, i njen odgovor je vodi dalje. Ross, Gordon i Bagnell otvaraju DAgger rad upravo sa ovim: sekvencijalna predikcija krši i.i.d. pretpostavku ispod statističkog učenja, jer sopstvene predikcije učenika određuju inpute koje vidi dalje.

Najjasnija ilustracija u tom radu nije robot uopće. Kloniranje gotovo-optimalnog planera za Super Mario Bros. proizvelo je politiku koja se je ponavljano zaglavljivala uz prepreku umjesto da je preskoči. Razlog je čitav argument u jednoj rečenici: ekspert je uvijek skakao sa udobne distance, tako da skup podataka nije sadržavao stanje u kojem je Mario pritisnuta uz prepreku, i zato nema oznake za šta treba raditi kad je.

Zamijeni Mario sa SO-100 rukom i struktura je identična. Vaše demonstracije pokazuju čist pristup i čist stisak, a ne hvatač koji se zatvara dva centimetra kratko - tako da politika nema pojma šta raditi odatle, i šta god pogađa je vodi dalje. Covariate shift je svojstvo procedure prikupljanja podataka, a ne arhitekture mreže.

Gdje kvadratni termin dolazi

2010. AISTATS rad od strane Ross i Bagnell, Efficient Reductions for Imitation Learning, čini sabijanje preciznim. Neka T bude horizont zadatka, neka trošak zadatka bude ograničen u intervalu jedinice, i neka epsilon bude surrogate gubitak mjeren pod eksperta distribucijom stanja - broj koji vam validacijski skup izvještava. Tada je dodatni trošak izvođenja te politike za T koraka, relativno prema eksperta, ograničen sa T na kvadrat puta epsilon. Ross, Gordon i Bagnell ponovo iznose ovo kao Teorema 2.1 u DAgger radu i dodaju rečenicu koja je važna: granica je tesna. Problemi postoje gdje politika sa epsilon gubitkom na distribuciji eksperta zaista snosi dodatni trošak koji raste kvadratno u T.

Tesna ne znači tipična. Kvadratni termin je najgori slučaj preko klase problema, ne predikcija o vašem pick-and-place zadatku. Šta uspostavlja je da više demonstracije eksperta ne može ukloniti problem: samo oštri procjenu epsilon na distribuciji na koju politika neće biti testirana.

Ruta bježanja je u istom radu, ponovno iznose kao Teorema 2.2. Ako politika postiže gubitak epsilon ispod vlaste distribucije stanja, i jedna pogrešna akcija trošta najviše u troškove-do-odlaska ispod eksperta, dodatni trošak je ograničen sa u puta T puta epsilon - linearno u horizontu. Konstanta u je zanimljiva količina: najviše 1 za 0-1 neslaganje sa ekspertom, i O(1) kad god ekspert može oporaviti se unutar nekoliko koraka. U najgorem slučaju je O(T), i linearna granica tada nije bolja od kvadratne.

PostavljanjeGranica na dodatnom trošku preko ekspertaNa čemu se odmarajući
Behavior cloning (Ross & Bagnell 2010, ponovno iznete kao Thm. 2.1 u Ross et al. 2011)T na kvadrat puta epsilonepsilon mjerena na distribuciji stanja eksperta; trošak u [0,1]; granica je tesna
Bilo koja politika sa epsilon gubitkom ispod vlaste distribucije (Thm. 2.2)u puta T puta epsilonu ograničava trošak-do-odlaska penalizaciju pogrešne akcije; najviše 1 za 0-1 gubitak, O(T) najgori slučaj
Forward training (Ross & Bagnell 2010)u puta T puta epsilonjedna politika po vremenskom koraku; treba T politike i poznat, konačan T
SMILe (Ross & Bagnell 2010)blizu-linearno u T i epsilon na nekim klasama problemaalpha u O(1/T na kvadrat), N u O(T na kvadrat log T); daje stohastičku smjesu
DAgger (Thm. 3.2, Ross et al. 2011)u puta T puta epsilon_N, plus O(1)N na redu uT; snažno konveksni ograničeni gubitak; no-regret učenik; epsilon_N je najbolji gubitak unatrag
Robot radni prostor predstavljajući stanja koja politika posjeći koja se nikada nije pojavila u skupu demonstracija
Stanja koja su važna za DAgger rundu su ona koja nikada nije nitko demonstrirao: gotovo-promašeni stisak, polno-otvoreni hvatač, ruka prošla objektom.

Dva pokušaja koja su došla prije DAgger

Forward training je pošten ali nepraktičan odgovor. Trenira odvojena politika za svaki vremenski korak, redom, svaka na distribuciji stanja inducirane politikama već fiksiranim za raniji korake, tako da svaka politika vidi točno distribuciju sa kojom se susrće. Uvjet je u opisu: T politike, treninзirane sekvencijalno, bez raniјeg zaustavljanja. Za manipulacijske epizode na 30 framera u sekundi, T je u stotinama.

SMILe, od istog rada, i SEARN, od Daume, Langford i Marcu rada na strukturiranoj predikciji, uzimaju drugi put: jedna stacionarna politika, ali stohastička. Svaka iteracija trenira komponentu i dodaje je smjesi, pomjеrajući vjerojatnost dalje od eksperta. Rezultat je smješa u kojoj su neke komponente gore od ostalih - na fizičkoj ruci, upravljač koji može uzorkovati loša komponenta za vrijeme kretanja. To je navedena motivacija za želju stacionarne determinističke politike umjesto.

DAgger: jedna ideja, jedan okvir

Dataset Aggregation drži determinističku politiku i pomjera ispravku u prikupljanju podataka. Svaka runda: izvedu trenutnu politiku, zabilježi stanja koja posjeći, pitaj eksperta šta bi bila ispravna akcija u svakom, dodaj te parove skupu podataka koji već imaš, ponovo trenira na uniji. Ime je algoritam - agregatuješ, nikada ne odbacuješ.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
Meta-algoritam DAgger, Algoritam 3.1 Ross, Gordon & Bagnell (2011).

Tri detalja nose više težine nego što izgledaju. Oznake su za stanja posjećena od strane mješovite politike, ali akcije dolaze od eksperta - politika pruža pitanja, ekspert odgovore. Ponovno trening je na čitavoj agregaciji, što čini svaku rundu Follow-The-Leader korakom: u krugu n birate najbolju politiku unatrag preko svake trajektorije do sada. To je okvir na kojem se dokaz zavješava. I algoritam završava vraćanjem najbolje politike u nizu kao odabrane u skupu za validaciju, jer teoremi garantiraju da je neka politika u nizu dobra, a ne da je posljednja.

Beta schedule, i zašto nije tuning gumb

Mješovita politika je beta_i puta ekspert plus jedan minus beta_i puta učenik. Poanta je praktična: prve nekoliko učenih politika su treninzirane na vrlo malo podataka, prave mnoge greške, i inače bi provodile rundu u stanjima koja postanu irelevantna čim se politika poboljšava.

Teorija nameće točno jedan uslov: teći prosjek betas mora ići na nulu. Analiza radi sa beta_i ograničenim sa (1 - alpha) na stepenu i-1, za konstantu alpha nezavisna od T.

ScheduleŠta radiŠta rad izvještava
beta_1 = 1Prva runda je čista demonstracija eksperta; nema potrebe za početnom politikomPreporučena početna točka u svakoj varijanti
beta_i = 1 ako i = 1, inače 0Ekspert samo u prvoj rundi; nema slobodnog parametraVarijanta bez parametra rada, koju kaže često izvršava najbolje u praksi; 2980 na Super Mario Bros. nakon 20 iteracija
beta_i = p^(i-1) sa p = 0,5Vjerojatnost eksperta pada geometrijski3030 na istoj točki, malo ispred verzije bez parametra
beta_i = p^(i-1) sa p = 0,9Ekspert ostaje u petlji mnogo dužeZnatno sporija konvergencija; još se poboljšava kad je završena 20 iteracija

Razlika između 2980 i 3030 na skali koja teče do otprilike 4300 je mala, ali objašnjenje rada je najkorisnije praktično napomeno u odjeljku. Sa verzijom bez parametra, Mario se zaglavljivao na istoj točki rano i генериро je masa blizu-duplikatnih podataka iz tog jednog mjesta; dozvoliti eksperta da vozi dio vremena jest i otključao ga i proširio je raznolikost stanja. Schedule je manje o omjeru miješanja nego o tome da li vaša prikupljanja podataka nastavlja proizvesti nova stanja ili ista neuspjeha.

Zašto se schedule ne prenosi na fizičku ruku kako je napisano

Stohastička po-vremenskom mješovitost znači prebacivanje autoritet kontrole na brzini kontrole, 30 puta u sekundi na tipičnoj SO-100 postavci. Nema teleoperacijskih sučelja koje čini to sigurno ili značajno. Na pravoj hardveru beta schedule ustupa mjesto ljudskoj odluci o kada preuzeti: drugi algoritam sa drugom analizom.

Garancija: redukcija na no-regret online learning

Evo poteza koji čini rad onim što jeste. Tretiraj svaku DAgger rundu kao jedan primjer u online learning problemu, gdje je gubitak u krugu i surrogate gubitak ispod distribucije stanja politike korištene u krugu i. Učenik se obvezuje politike prije nego što vidi taj gubitak, i niz je nestacionaran jer zavisi od politika proizvedenih do sada.

Algoritam je no-regret ako njegov prosječni gubitak preko N rundi približuje najbolje jednoj politici unatrag. Follow-The-Leader na snažno konveksnim gubicima je takav algoritam, sa prosjačnim kajanjem skupljajući se po redoslijedu 1/N - i ponovno trening na čitavoj agregaciji je točno Follow-The-Leader. Bilo koji drugi no-regret učenik bi služio kao dobro: analiza je redukcija, ne svojstvo jednog optimizatora.

Jedna lema premošćuje razliku između mješovite politike koja je prikupila podatke i naučene politike koja će biti implementirana: Lema 4.1 ograničava L1 udaljenost između njihovih distribucija stanja sa 2 T beta_i. Ovo je zašto betas moraju opadati - dok ekspert još drži znamenitost autoritet kontrole, stanja koja prikupljate nisu stanja koju će vaša politika proizvesti. Kombiniraj lemmu sa regret graničnom linijom i glavni rezultat slijedi: nakon otprilike T iteracija, neka politika u nizu ima surrogate gubitak ispod vlaste distribucije unutar O(1/T) od epsilon_N. Uklonite to u linearnu granicu i dolazite na Teorema 3.2.

Empirijska strana je skromna prema sadašnjim standardima. U Super Tux Kart nadgledavana linija nije poboljšala njene prosječne padove po krugu kako su stigli podatci, DAgger dostigao politiku koja nikad nije pala sa trake nakon petnaest iteracija, i SMILe nakon dvadeset je još padala otprilike dva puta po krugu. Na mjerilu rukopisa, točnost znaka je bila 82 posto bez strukture, 83,6 posto nadgledanu, 85,5 posto sa DAgger. Nijedan od ovoga nije rezultat manipulacije.

Šta dokaz ne obećava

Tvrdnje teoreme su uvjetne, i uvjeti su opterećenja nošenja.

DAgger garancija, čitana pažljivo
Šta vam daje
  • Granica linearna umjesto kvadratne u T, prema navedenim pretpostavkama.
  • Stacionarna determinističke politike umjesto stohastičke smjese.
  • Pravi redukcija: bilo koji no-regret online učenik se uklanja.
  • Specifičan broj iteracija - otprilike T rundi prije nego što termin kajanja prestane biti bitan.
  • Garancija za barem jednu politiku u nizu, od toga zatvarajući prolaz validacije.
Šta ne daje
  • To je relativno prema epsilon_N, najbolji gubitak u klasi unatrag, ne relativno na nulu. Ako vaša klasa ne može predstaviti eksperta, prazna je u praksi.
  • Trebam no-regret metoda ili snažno konveksni surrogate gubitak - jači od redukcije klasifikacije na kojima se gradi, kako autori primjećuju.
  • Konstanta u može biti O(T) u najgorem slučaju, i linearna granica se tada sruši u kvadratnu.
  • Ograničava iteracije, ne expert oznake. Na robotu, oznake su budžet.
  • Pretpostavlja da se ekspert može upitati na svakom posjećenom stanju i točno odgovora tamo. Ta pretpostavka je čitav trošak.

Jedan daljnji rezultat se često citira kao pobijanje i nije jedan. Rajaraman, Yang, Jiao i Ramachandran studija minimax granice imitation learinga u episodičnim MDPs sa konačnim prostorem stanja S i horizont H, i dokazuju donju granicu neoptimalnosti na redu |S| H kvadrat preko N koja drži čak i kada učenik može aktivno upitati eksperta u posjećenim stanjima. To je najgori slučaj stopa preko klase MDPs na fiksnom budžetu epizode, i šta to isključuje je ideja da interakcija poboljšava minimax stopu; DAgger teorema je drugačija izjava, ograničavajući implementiranu politiku relativno prema šta može postići njena vlastita klasa politike.

Swamy, Choudhury, Bagnell i Wu kasnije klasificirali su te algoritme prema kojima trenutaka ponašanja eksperta se podudaraju, i uveli pojam momenta oporavljivost koji delineacija kako dobro svaka obitelj ublažava sabijajući greške. Pregledi od Osa i od Celemin pokrivaju algoritmički krajolok i sučelja za čovjeka-povratnu informaciju.

Račun: označavanje stanja koja ekspert nikad nije proizveo

Sve gore pretpostavlja eksperta koji može biti upitan bilo gdje. U simulaciji sa planera koja je gotovo besplatna - Mario eksperimenti su koristili gotovo-optimalnog planera sa punim pristupom stanja igre. Sa čovjekom na robotu to je dominantni trošak, i čudan: čovjek mora proizvesti ispravnu akciju u konfiguraciji čija vlastita kompetencija nikada ne bi stvorila.

Kelly, Sidrane, Driggs-Campbell i Kochenderfer navode prigovor izravno u HG-DAgger radu. Vanilla DAgger zahtijeva od eksperta da pruži oznake akcije dok nije potpuno u kontroli sustava. Ovo smanjuje sigurnost, i sa čovjekom ekspertima vjerojatno će degradirati kvalitetu prikupljenih oznaka, koju pripisuju percipiranom zaostajanju izvršitelja. Oznaka koju dobijete nazad nije oznaka koju je algoritam pretpostavio.

Laskey i kolege napadaju problem sa druge strane sa DART, i njihova okvira je direktna: on-policy tehnike su dosadne za čovjeka supervizore, dodaje računsku opterećenja, i mogu posjetiti opasna stanja tijekom trenerstva. Njihova alternativa ubrizgava kalibrirani šum u demonstracije samog supervizora, tako da se oporavak demonstrira bez robota koji ikad izvršava nepouzdanu politiku. Na MuJoCo Humanoid oni izvještavaju DART smanjuje supervisor kumulativnu nagradu sa 5 posto tijekom trenerstva, dok DAgger izvršava politike sa 80 posto manje kumulativne nagrade od supervizora; na prihvaćanju u neredu sa Toyota HSR, prosječan 62 posto povećanja preko behavior cloninga.

Zhang i Cho SafeDAgger tretira upite na referentnu politiku kao rijedak resurs: odvojena politika sigurnosti predviđa, bez upita, da je primarnoj politici o odgovoru od referenca izvan praga, i samo ta stanja se prosleđuju. Sva tri reagiraju na istu činjenicu - DAgger analiza naplaćuje ništa za expert oznake, i realnost naplaćuje puno.

Dio koji vam nikada ne upozoravanje

Označavanje off-distribucije stanja je mentalno teže nego demonstracija zadatka. Normalna demonstracija znači izvršavanje motornog plana koji već imate. Korigiranje politike koja je stavila hvatač negdje gdje vi nikad ne biste znači konstruiranje oporavka na mjestu, pod vremenskim pritiskom, sa robotom koji se još kreće. Očekivati manje upotrebljive minute po sesiji nego na običnoj sesiji snimanja, i promatrati vlastitu kvalitetu korekcije degradirati tijekom jedne.

LeRobot struktura skupu podataka pokazujući epizode, framera i po-frame stupce kao pohranjena na disku
Korekcije postaju skupu podataka samo kad se intervencije okvira označe - u LeRobot formatu, po-frame stupac pokraj opažanja i akcije.

Šta to znači za SO-100 na vašem stolu

Prevedite horizont u vaše vlastite jedinice. Epizoda od dvadeset sekundi na 30 framera u sekundi je 600 donošenja odluke koraka, i T u svakoj granici je taj broj. Na T = 600, razlika između termin skaliranje sa T i jedan skaliranje sa T kvadrat je razlika između politike koja se oporavlja od loše pristupa i jedna koja to ne čini.

Ovo je dio zašto akcijske komade pomaže: kada politika izvršava kratku sekvencu akcija po korak zaključivanja, broj točaka odluke pada, i tako broj mogućnosti sabijanja. Zhao, Kumar, Levine i Finn naziv sabijanja greške kao motivacija za Action Chunking sa Transformers, i izvještavaju 80 do 90 posto uspjeha na šest teško zadataka iz stvarnog svijeta, na jeftinom bimanualnom hardveru, od deset minuta vrijedan demonstracija. Komadanje ne uklanja covariate shift - stanja su još politike vlaste - ali skraćuje efektivni horizont. Pogledaj akcijsko komadanje i SO-100 imitation learning vodič.

Druga prijevod je metrika napretka. Ne možete mjeriti epsilon ispod vlastite distribucije politike izravno - koji trebam expert-činnost činnosti za svakog posjećenog stanja, stvar koju pokušavate izbjeći stvaranja. Šta ljudski-drže petlja vam daje umjesto toga je intervencijska stopa: razlomak okvira u vožnji tijekom koje je čovjek preuzeo. To je proxy, i pomjera za razloge neuvezan u politiku - strpljivi operater interveniram manje. Korišteno konzistentno, to je jedan broj koji kaže da li je runda bila dostojne popodnevni.

Treća prijevod je upozorenja od kvalitete podataka koju analiza ne pokriva. Mandlekar i kolege su studirali šest offline algoritama na pet simuliranih i tri iz stvarnog svijeta multi-stage manipulacijskim zadacima, i izvještavaju osjetljivost na algoritmičke dizajne izbore, ovisnost od kvalitete demonstracija, i varijabilnosti uzrokovane zaustavljanja kriterija. Belkhale, Cui i Sadigh tvrde da bi kvalitetu skupu podataka trebalo formalizirati kroz akcijsku divergenciju i prijelaznu raznolikost, i primjetiti da raznolikost stanja nije uvijek korisna. DAgger runda dodaje stanja nikoga namjerno ne biralu: neka su oporavka podataka trebate, neka su robota muljajući dok se muljate za kontrolu preuzimanja.

Mehanički runda je šest koraka: pokreni zaključivanje sa snimanjem, preuzmi kad politika radi loše, pregledaj vožnju i prikupi svaki epizodu, sinhronizira korekcije, sastavlja mješoviti skupu podataka iz originala plus korekcije sa odabira epizode napravljeno eksplicitno po izvoru, i nastavi trening iz prethodnog checkpoint umjesto baznog modela. Na ay-robots te korake postoje kao gumbima, što uklanja vodovod ali ne sodstvo. Dva upozorenja: nastavljajući od checkpoint inicijalizira težine i nije optimizator čini nastavak, i lider-ruka poravnanja je još lagano testirano na hardveru. Pogledaj trening i skupu podataka.

DAgger petlja, već kablirana

Preuzimanje tijekom živog zaključivanja vožnje, po-frame intervenciji označavanja, prikupljanja epizode kao korekcije ili evaluacije, sastavljanja mješoviti skupu podataka sa eksplicitnim odabira epizode po izvoru, i nastavka trenerstva od postojećeg checkpoint su sve ugrađene. Vi još odlučite kada preuzeti i šta zadržati - taj dio ne automatizira.

Pogledaj kako DAgger petlja radovi

Obiteljsko stablo, u jednoj tablici

MetodaTko bira stanjaŠta ekspert pružaGlavni trošak
Behavior cloningEkspertČista demonstracijaNema oporavka podataka; greška može sabijati kvadratno u T
Forward trainingUčenik, po vremenskom korakuOznake duž inducirane distribucijeT odvojene politike; neuporabiva za duge horizonte
SMILe / SEARNStohastička mješovitost eksperta i učenikaOznake duž mješovite distribucijeKomponente mješovitosti se razlikuju u kvaliteti
DAggerMješovita politika, beta opadajući nuliIspravna akcija za svako posjećeno stanjeOznačavanje stanja koja bi ekspert nikad nije proizveo, dok nije potpuno u kontroli
DARTEkspert, perturbiran ubrizganih šumomDemonstracije ispod kalibriranog šumaŠum mora biti kalibriran na greške učenika
HG-DAggerUčenik, dok čovjek preuzmeKorekcije samo u čovjek-drže segmentimaOvisi od čovjeka sudska o kada interveniram
SafeDAggerUčenik, filtrirano sigurnosnom kapijomOznake samo kada se kapija pitaKapija sama mora biti trenirana i pouzdana

Često postavljana pitanja

Trebam li doista promatrati kvadratnog greške rasta na mom robotu?

Ne kao čista kriva. Granica je najgori slučaj: tesna u tome što neki problem postigne to, ne da će vaš. Što vidite je posljedica - politika koja ocjenjuje dobro na izdvojenim okvira, ne uspjeva na pravi zadatak, i ne poboljšava kada snimite više od istoga. Ako više čistih podataka prestane pomagati, to je covariate shift, a ne problem količine podataka.

Trebam li provesti mješovitost betas da ga zovem DAgger?

Verzija bez parametra - ekspert u prvoj rundi, čist učenik naknadni - je legitimna poseban slučaj i često je djelomično najbolje u originalnom eksperimentima. Šta ne možete padati je agregacija: ponovno trening samo na novim korekcijama razbija Follow-The-Leader interpretacija, što je gdje dolazi no-regret argument. Trening na samo korekcije je mnogo slabija procedura.

Zašto vratiti najbolju politiku na skupu za validaciju umjesto zadnje?

Jer teoremi jamče dobru politiku postoji negdje u nizu, a ne da je završni ponavljač - granica je na minimalnu preko niza. Upotreba bilo šta došlo je od posljednje runde odbacuje navedeno stanje rezultata, i posljednja runda nije pouzdano najbolja.

Koliko rundi trebao bih planirati?

Teorija želi iteracije na redu T, koji za 600-korak epizodu nije broj da bilo tko pokreće na hardveru. Originalni eksperimenti su koristili dvadeset iteracija na svakom točkom. U praksi vodite runde dok intervencijska stopa prestane pada, daleko ispod broja analiza pretpostavljava - pravi raskorak između teorije i prakse.

Šta ako moja politika klasa jednostavno ne mogu predstaviti eksperta?

Tada DAgger ne čuva vas, i granica kaže tako - to je izraženo relativno prema epsilon_N, najbolji gubitak u klasi unatrag. Ako je to veliki jer pogrešne arhitekture, nedostaju opažanja ili kamera koja ne može vidjeti scene, agregacija vam daje politiku koja je optimalna unutar klase koja ne mogu raditi zadatak. Pokreni open-loop reproduciranja protiv izdvojenih epizode prije nego što prikupljate korekcije.

Gdje ići odavde

Ako niste trenirali politiku još, ova teorija je preuranja: prvo zabilježi skupu podataka, počevši od trening vaše prve politike i desktop klijenta. Ako procjenjujete stotinu čistih dodatne demonstracije protiv započinjućih korekcije: čista demonstracija ne popravljanja distribucije problem. Za mehaniku, nastaviti sa varijanta sa čovjekom-drže i tada SO-100 vodiči.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started