
Käitumuskloonimise korral sobitab algoritm poliitika eksperdile iseloomuliku olekujaotuse järgi ja selle peale juurutatakse see iseseisvalt. Nende kahe jaotuse vahe on põhjus, miks poliitika, mis valideerimises suurepärane välja näeb, kõnnib sammul 300 laua pealt maha. See on meie DAgger-seeria teooriaosa: kust tuleb ruutvigatermin, mida muudab andmekogumi kogumine, mida eeldab no-regret tõestus ja millist osa arvest inimekspert veel tasuma peab.
On olemas konkreetne rike, millega kohtub igaüks, kes treenib manipuleerimispoliitikaid varem või hiljem. Poliitika sirutab käppa kuubi poole, jõuab kahe sentimeetri kaugusele, kohaneb, libiseb külgsuunas, seejärel teeb midagi ülesandega seotut. Valideerimiskadu oli hea. Avatud ahela taasesitus seisvate episoodide vastu oli hea. Siiski jõuab õlg sellisele positsioonile, mis treeniandmetes kusagil ei esine, ja sealt pole tal midagi mõistlikku öelda.
Sel rikkel on nimi ja sellel on taga korralik teooria. See on neljast artiklist esimene DAgger, ja see käsitleb argumenti ennast: miks poliitika sobitamine demonstraatori enda trajektooridele tekitab vea, mis võib kasvada episoodi pikkuse ruuduga, mida muudab andmekogumi kogumine ja mida no-regret tõestus ei lubada. Tegelik riistvarasilmus on käsitletud DAgger tsükli käitamine SO-100-l, inimese kontrolli all olev variant HG-DAgger ja inimese kontrollitud sekkumised, ja mõõtmise küsimus DAgger tsükli mõõtmine.
Lühiversioon
- •Käitumuskloonimis treenib eksperdi olekujaotusele ja hindab poliitika enda jaotust. Mittevastavus kumuleerub episoodi jooksul.
- •Ross ja Bagnell näitasid, et lisakulud võivad kasvada T ruudu korra sammu vigaga; DAgger uurimus esitab selle piiri ümber ja märgib, et see on tihe.
- •DAgger märgistab olekud, milleid poliitika külastab, ja treenib ümber kõigil siiani kogutud andmekogumitel, mitte ainult kõige uuemal.
- •Garantii on taandamine kahetsuseta veebis õppimisele: kogumine ja ümbertrenimine on Follow-The-Leader.
- •See kehtib poliitika klassis saavutatava parima kadumisega võrreldes, mitte nulliga - ja ekspert peab siiski märgistama olekud, mida ta kunagi poleks tootnud.
Eeldus, mida käitumuskloonimis vaikselt esitab
Demonstratsioon andmekogum on jälgimine-tegevuse paaride hunnik. Käitumuskloonimis sobib funktsiooni sellele hunnile tavapärase juhendatud õppega ja seisab seal. See on kõige vanima idee valdkonnas. Pomerleau ALVINN 1988. aastal oli kolmekihiline tagasikliimamise võrk, mis võttis pilte kaamerast ja laserite ulatuse leidjast ning tootis suuna, kuhu sõiduk peaks liikuma; seda treeniti simuleeritud teepiltidel ja järgis tegelikke teid mõnedel välitingimustel. Retsept ei ole palju muutunud; võrgud on.
Mida vahele jäetakse, on kontroll, kust need paarid pärinevad. Igaüks neist asub demonstraatori koostatud trajektooril. Poliitika, mida te kasutusse võtate, toodab oma. Niipea kui see kaldub, vastab muudetavale olekutele, mis ei olnud treeningjaotuses, ja selle vastus liigutab seda kaugemale. Ross, Gordon ja Bagnell avanevad DAgger uurimuse sellega täpselt: järjestikune ennustus rikub i.i.d. eeldus statistilise õppimise all, sest õppija enda ennustused määravad sisendid, mida ta järgmisena näeb.
Selgeim illustratsioon selles uurimusesseta pole robot üldse. Super Mario Brose peaaegu optimaalse planeerija kloonimis tekitas poliitika, mis jäi korduvalt takistuse vastu kinni, selle asemel et üle hüpata. Põhjus on kogu argument ühe lausega: ekspert alati hüppas mugavast kaugusest, nii et andmekogus puudus olek, milles Mario oli takistuse vastu surutud, ja seetõttu polnud silti selle kohta, mida teha, kui ta sinna jõudis.
Asenda Mario SO-100 käega ja struktuur on identne. Teie demonstratsioonid näitavad puhtast lähendamist ja puhtast haardest, mitte griiperit kahest sentimeetrist lühem sulgemist - nii et poliitikale pole aimugi, mida sealt teha, ja kõik, mida ta arvab, viib selle kaugemale. Kovariaatne nihe on omadus andmete kogumise protseduur, mitte võrgu arhitektuurist.
Kust tuleb ruuttermin
2010. aasta AISTATS uurimus Ross ja Bagnell, Jäljendusõppe tõhusad taandamised, muudab kumuleerumise täpseks. Olgu T ülesande horisont, olgu ülesande maksumus piiratud ühiku intervallis ja olgu epsilon asendatusviga, mida mõõdetakse eksperdise olekujaotus - arv, mille teie valideerimishulk teatab. Seejärel on selle poliitika käitamise lisakulud T sammut ette võrreldes eksperdi suhtes piiratud T ruudu korra epsiloniga. Ross, Gordon ja Bagnell esitavad selle DAgger uurimuse 2.1 teoreemina ja lisavad olulise lause: piir on tihe. Probleemid on olemas, kus poliitika, millel on epsilon kadu eksperdi jaotuses, tõepoolest kasvab kvadraatiliselt T-s.
Tihe ei tähenda tüüpilisust. Ruuttermin on halvim juhtum probleemide klassis, mitte ennustus teie valimis ja paigutamis ülesandeest. Mida see kehtestab, on see, et rohkem eksperdi demonstratsiooni ei saa probleemi eemaldada: see teeb epsilon hinnangu teravamaks jaotusele, mida poliitika ei ole testitud.
Põgenemise tee on samas uurimuses, esitatud teoreemiga 2.2. Kui poliitika saavutab kadumise epsilon all oma olekujaotus, ja ühe vale tegevuse maksumusest kuni käi maksumusetus eksperdiga on maksimaalselt u, siis lisakulud on piiratud u korda T korda epsilon - lineaarne horisondis. Konstant u on huvitav suurus: maksimaalselt 1 0-1 mitteühtluses eksperdi suhtes ja O(1), kui ekspert saab taastuda mõne sammuga. Halvimal juhul on see O(T) ja lineaarne piir pole siis ruutlikust parem.
| Seadistus | Piir lisatulule eksperdile | Millel see põhineb |
|---|---|---|
| Käitumuskloonimis (Ross & Bagnell 2010, esitatud Thm. 2.1 Ross jt 2011) | T ruudu korda epsilon | epsilon mõõdetud eksperdise olekujaotuses; kulu [0,1]; piir on tihe |
| Iga poliitika, millel on epsilon kadu oma jaotuse all (Thm. 2.2) | u korda T korda epsilon | u piirab ühe vale tegevuse kulu käimise karistust; maksimaalselt 1 0-1 kaole, O(T) halvim juhtum |
| Edasi trenimine (Ross & Bagnell 2010) | u korda T korda epsilon | üks poliitika ajasammu kohta; vajab T poliitikat ja teadaolevat, lõplikku T |
| SMILe (Ross & Bagnell 2010) | peaaegu lineaarne T ja epsilon mõnestel probleemiklassidel | alfa O(1/T ruudu), N O(T ruudu log T); annab stohhastilise segu |
| DAgger (Thm. 3.2, Ross jt 2011) | u korda T korda epsilon_N, pluss O(1) | N uT järjekord; tugevalt kumer piiratud kadu; kahetsuseta õppija; epsilon_N on parim kadu tagantjärele |

Kaks katset, mis tulid enne DAggerit
Edasi trenimine on aus kuid ebapraktiline vastus. Treenige eraldi poliitika iga ajassammu jaoks, järjekorras, igaüks olekujaotusele, mis on indutseeritud poliitikate poolt, mis on juba määratud varasemate sammude jaoks, nii et iga poliitika näeb täpselt jaotust, millega ta silmitsi seisab. Lõks on kirjelduses: T poliitikat, treenitud järjestikku, ilma varase peatuseta. Manipuleerimise jaoks episood 30 kaadri sekundis, T on sadades.
SMILe, samast uurimusest, ja SEARN, Daume, Langford ja Marcu tööst struktureeritud ennustamise kohta, võtavad teise tee: üks statsionaarne poliitika, kuid stohhastiline. Iga iteratsioon treenib komponenti ja lisab selle segule, nihutades tõenäosuse massi eksperdi eest. Tulemuseks on segu, milles mõned komponendid on halvemad kui teised - füüsilisel käel, kontroller, mis võib valida halva komponendi liikumise ajal. See on avaldatud motivatsioon statsionaarse soov deterministlik poliitika asemel.
DAgger: üks idee, üks kast
Dataset Aggregation säilitab deterministliku poliitika ja liigutab paranduse andmekogumisse. Iga ring: lahti käivitatav praegune poliitika, salvestage riigid, mida külastab, küsige eksperdi käest, mis oleks õige tegevus olnud igaühes, lisage need paarid andmekogumile, mida teil juba on, treenige ümber liidu. Nimi on algoritm - te aggregeerite, te kunagi ei käitu.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setKolm detaili kannavad rohkem kaalu, kui nad paistab. Sildid on seisundite jaoks, mida külastab segapoliitika, kuid tegevused pärinevad eksperdi käest - poliitika esitab küsimused, ekspert vastused. Ümbertrenimine on kogu agregaadil, mis muudab iga ringi Follow-The-Leader sammuks: ringil n valite parima poliitika tagantjärele iga dossiee üle siiani. See raamistik on see, millele tõestus tuggineb. Ja algoritm lõpetab parimast poliitikaga jadas, mida valitakse valideerimishulgal, sest teoreemid garanteerivad, et mingi poliitika jadas on hea, mitte et viimane on.
Beetagraafik ja miks see pole häälestusknopf
Segapoliitika on beta_i korda ekspert pluss üks miinus beta_i korda õppija. Punkt on praktiline: esimesed õpitud poliitikad on treenitud väga väikese andmemahuga, teevad palju vigu ja kulutaksid muidu rollikuse olekutes, mis muutuvad asjatuks, kui poliitika paraneb.
Teooria seab täpselt ühe tingimuse: beetade jooksev keskmine peab minema nulli. Analüüs töötab beetaga_i piiratud (1 - alfa) astmega i-1, konstandiks alfa sõltumatuks T.
| Ajakava | Mida ta teeb | Mida uurimus teatab |
|---|---|---|
| beta_1 = 1 | Esimene ring on puhas eksperdi demonstratsioon; algne poliitika pole vajalik | Soovitatav lähtepunkt igas variandis |
| beta_i = 1 kui i = 1, muul juhul 0 | Ekspert ainult esimeses ringis; breiparameetrit pole | Uurimuse parameetrita versioon, mis ütleb, et praktikas toimib sageli paremini; 2980 Super Mario Bros. 20 iteratsiooni järel |
| beta_i = p^(i-1) p = 0,5 | Eksperdise tõenäosus mureneb geomeetriliselt | 3030 samal etalonmääratkis, pisut ette parameetrita versiooni |
| beta_i = p^(i-1) p = 0,9 | Ekspert jääb silmusesse palju kauemaks | Märkimisväärselt aeglasem konvergents; ikka paranev, kui 20 iteratsiooni lõppesid |
Vahe 2980 ja 3030 vahel skaalal, mis ulatub umbes 4300-ni, on väike, kuid uurimuse seletus sellest on praktilisem märkus sektsioonis. Parameetrita graafiku korral Mario kiiludes sama koha juurde varakult ja tekitas massi peaaegu dubleerivaid andmeid sellest ühest kohast; lasta eksperdil ajam murdosa ajal nii vabastas ta ja laiendas olekute valikut. Ajakava käsitletakse vähem segamissuhtarvust kui sellest, kas teie andmekogumi kogumine paljastab uusi olekuid või sama rike.
Stohhastiline ajassammu-kohene segu tähendab juhtimisasutuse lülitamist juhtimiskiirusel, 30 korda sekundis tüüpilisel SO-100 seadistuses. Ükski kaugjuhitamise liides ei tee seda turvaliseks või mõttelikuks. Tegelikul riistvaral annab beetagraafik järgi inimese otsusele millal üle võtta: erinev algoritm erineva analüüsiga.
Garantii: taandamine kahetsuseta veebis õppimisele
Siin on käik, mis muudab uurimuse selleks, mis see on. Käsitlege iga DAgger ringi näitena võrgus õppimise probleemis, kus kadu ringil i on asendatusviga poliitika olekujaotuse all, mida kasutatakse ringil i. Õppija kinnitab poliitikale enne selle kadumise nägemist ja jada on mittestaatiliselt, sest see sõltub siiani toodetud poliitikatest.
Algoritm on kahetsuseta, kui selle keskmine kadu N ringis läheneb parima ühe poliitika omale tagantjärele. Follow-The-Leader tugevalt kumertel kadudel on selline algoritm, keskmise kahetsuse vähenemisega 1/N järjekord - ja täienel agregaadil treenimine on täpselt Follow-The-Leader. Iga teine kahetsuseta õppija sobituks samuti: analüüs on taandamine, mitte ühe optimaatori omadus.
Üks lemma ühendab lünga segapoliitika vahel, mis kogus andmeid, ja õpitud poliitika vahel, mida juurutatakse: Lemma 4.1 piirab L1 kaugust nende olekujaotuste vahel 2 T beta_i. See on põhjus, miks beetad peavad vähenema - kui ekspert endiselt hoiab märkimisväärset juhtimisasutust, ei ole riigid, mida kogute, riigid, mida teie poliitika toodab. Kombineerige lemma kahetsuse piiriga ja peamine tulemus järgneb: pärast ligikaudu T iteratsiooni omab mõni poliitika jadas asendatusviga oma jaotuse all O(1/T) sees epsilon_N. Sisestage see lineaarse piiri ja maandute Theorem 3.2.
Empiiriline pool on praeguste standardite järgi tagasihoidlik. Super Tux Kartis ei parandanud juhendatud lähtejoon oma keskmist kukkumist ringi kohta, kui rohkem andmeid saabus, jõudis DAgger poliitikale, mis kunagi ei kukkunud rajalt pärast viieteist iteratsiooni, ja SMILe kahekümne järel kukkus endiselt umbes kaks korda ringi kohta. Käekirja etalonmääratkis oli tähemärkide täpsus 82 protsenti ilma struktuurita, 83,6 protsenti juhendatud, 85,5 protsenti DAggeriga. Ükski neist pole manipuleerimise tulemus.
Mida tõestus ei lubade
Teoreem väited on tinglikud ja tingimused on koormusekandvad.
- Piir lineaarne, mitte ruutlikult T, nimetatud eelduste all.
- Statsionaarne deterministlik poliitika, mitte stohhastiline segu.
- Tõeline taandamine: iga kahetsuseta veebis õppija sobitub.
- Konkreetne iteratsiooni loendus - ligikaudu T ringid enne kahetsuse termini olulisuse lõpetamist.
- Garantii vähemalt ühe poliitika jaoks jadas, siit lõpetava valideerimise läbikäik.
- See on epsilon_N suhtes, parim kadu klassis tagantjärele, mitte nulli suhtes. Kui teie klass ei saa eksperti esindada, on see praktikas tühi.
- See vajab kahetsuseta meetodit või tugevalt kumerat asendatusviga - tugevamalt kui klassifikeerimise taandamist, mille peal ta ehitab, nagu autorid märgivad.
- Konstant u võib olla O(T) halvimal juhul ja lineaarne piir langetab seejärel tagasi ruutlikuks.
- See piirab iteratsioone, mitte eksperdi silte. Robotis on sildid eelarve.
- See eeldab, et eksperti saab päringuga kõigis külastatud olekutes ja ta vastab õigesti seal. See eeldus on kogu kulu.
Üks edasine tulemus tsiteeritakse sageli pöördumisena ja see pole. Rajaraman, Yang, Jiao ja Ramachandran uurivad jäljendusõppe minimaaksi piiranguid episoodilistes MDP-des lõpliku olekuruumiga S ja horisondiga H ning tõestavad suboptimaalse alampiiri |S| H ruudu järjekord üle N, mis kehtib isegi siis, kui õppija võib aktiivselt päringuga eksperdist külastatud olekutes. See on halvim määr MDP-de klassis fikseeritud episoodi eelarve korral ja mida see välistab, on ideeda, et interaktsioon parandab minimaaksi määra; DAgger teoreem on erinev väide, seades poliitika piiriga juurutatakse suhtes sellega, mida selle enda poliitika klass saavutada.
Swamy, Choudhury, Bagnell ja Wu klassifitseerisid hiljem neid algoritme eksperdi käitumise hetkedega, mida nad vastavad, ja tutvustasid hetke taastamise mõistet, mis määratleb, kui hästi iga perekond leevendab kumuleeruvat viga. Osa ja Celemin uuringud katavad algoritmilise maastiku ja inimese tagasiside liideste.
Arve: märgistused olekud, mida ekspert kunagi ei tootnud
Kõik ülal eeldab eksperti, keda võib päringuga küsida kõikjal. Simulatsioonis plaanijaga, mis on peaaegu tasuta - Mario katsed kasutasid peaaegu optimaalset plaanijat täielike juurdepääsuga mängule. Inimese ja roboti korral on see domineeriv kulu ja kummaline: inimene peab tootma õige tegevuse konfiguratsioonis, mida nende enda pädevus kunagi ei oleks loonud.
Kelly, Sidrane, Driggs-Campbell ja Kochenderfer esitavad vastuväite otse HG-DAgger uurimuses. Vanilla DAgger nõuab eksperdi varustamist tegevuse siltidega, olles süsteemi täisfunktsionaal all. See vähendab ohutust ja inimese eksperdiga on tõenäoline kogutud siltide kvaliteedi halvenemise, mida nad seostavad tajutava aktuaatori viitega. Silt, mille te tagasi saate, pole silt, mida algoritm eeldas.
Laskey ja kolleegid rünnavad probleemi teisest küljest DARTiga ja nende raamistik on otsekohe: poliitika järgsed tehnikad on inimese järelevalvijatele tedinud, lisavad arvutuslikku koormust ja võivad külastada ohtlikke olekuid treenimise ajal. Nende alternatiiv süstib kalibeeritud müra järelevalvija enda demonstratsioonidesse, nii et taastamine saab demonstreeritud robotiga kunagi käitamata mitteslampet poliitikat. MuJoCo humanoidil teatavad nad DARTist järelevalvija kumulatiivse tasuna vähenemisega 5 protsendi treenimise ajal, samal ajal DAgger käitab poliitikat 80 protsendiga väiksema kumulatiivse auhinnaga kui järelevalvija; haaramine segaminis Toyota HSRiga, keskmiselt 62 protsendine tõus käitumiskloonimise üle.
Zhang ja Cho SafeDAgger käsitleb päringuid referentsi poliitikal kui nappide ressursse: eraldi turvalisuse poliitika ennustab, ilma päringuta, kas esmane poliitika hakkab referentsist kalduma läve üle, ja ainult need olekud ülekanduvad. Kõik kolm reageerivad samale faktile - DAgger analüüs ei nõua midagi eksperdi siltidele ja tegelikkus maksab palju.
Väljavalitud olekute märgistamine on vaimselt raskem kui ülesande demonstreerimine. Normaalne demonstratsioon tähendab mootorikava käitamist, mis sul juba on. Poliitika parandamine, mis on griiperi kuhugi paigutanud, mida sa kunagi ei teeks, tähendab taastamise konstrueerimist kohapeal, ajaline surve all, robot endiselt liigub. Oodake vähem kasutatavaid minuteid sessiooni kohta kui tavalises salvestamise sessioonis ja jälgige oma paranduse kvaliteedi kulumist.

Mida see tähendab SO-100 jaoks teie laual
Tõlkige horisont oma ühikutesse. Kahekümne sekundi episood 30 kaadri sekundis on 600 otsuse sammu ja T iga piiri ülal on see number. T = 600 korral on erinevus termini vahel, mis skaleerib T ja ühega, mis skaleerib T ruudu, erinevus poliitika vahel, mis taastub halva lähendamise järelt ja ühega, mis ei taastuks.
See on osa sellest, miks tegevuse komplektimine aitab: kui poliitika väljastab tegevuste lühikese jada iga järelduse sammu kohta, langeb otsuse punktide arv, samuti võimaluste arv kumuleerumiseks. Zhao, Kumar, Levine ja Finn nimetavad kumuleeruvat viga motivatsiooniks Action Chunking Transformerstega ja teatavad 80 kuni 90 protsendilisest edust kuues raskes tegelikkaelühistlikus ülesandes, odavate bimanualse riistvara korral, kümne minuti vääriliste demonstratsioonide põhjal. Komplektimine ei eemalda kovariaatset nihet - olekud on endiselt poliitika omad - kuid see lühendab tõhusat horisonti. Näe tegevuse komplektimine ja SO-100 jäljendusõppe juhend.
Teine tõlge on edendamise mõõdik. Te ei saa epsiloni mõõta poliitika enda jaotuse all otseselt - see vajab maapinna-tõe eksperdi tegevusi iga külastatud oleku jaoks, asi, millest te püüate vältida. Mida inimese kontrollitud silmus teile annab, on sekkumise määr: kaadrite osa jooksus, mille jooksul inimene oli üle võtnud. See on prok ja ta liigub põhjustel, mis pole seotud poliitikaga - kannatlik operaator sekkub vähem. Järjepidevalt kasutatud on see üks number, mis ütleb, kas ring oli pärastlõunat väärt.
Kolmas tõlge on andmete kvaliteedinäide, mida analüüs ei kata. Mandlekar ja kolleegid uurisid kuut ühenduseta õppimise algoritmi viiel simuleeritud ja kolmel tegeliku maailma multi-etapi manipulatsiooni ülesandel ning teatavad algoritmi disaini valikute tundlikkusest, demonstratsioonide kvaliteedi sõltuvusest ja seiskamise kriteeriumiga põhjustatud muutlikkusest. Belkhale, Cui ja Sadigh väidavad, et andmekogumi kvaliteeti tuleb formaliseerida tegevuse lahknemise ja ülemineku mitmekesisuse kaudu ning märgivad, et oleku mitmekesisus ei ole alati kasulik. DAgger ring lisab olekud, mida keegi tahtlikult ei valinud: mõned on taastamise andmed, mida vajate, mõned on robot lehvimas teie käppida takeover juhtimise järgi.
Mehaaniliselt on ring kuus sammu: käita järeldus salvestamisega, võta üle, kui poliitika käitub valesti, vaata jooksu üle ja archiveeri iga episood, sünkrooni parandused, koosta segamis andmekogum originaalidest pluss parandustest selgelt valitud episoodi allikaga ja jätka treeningut eelnevast kontrollpunkt mitte baasmudelit. Ay-robotsil on need sammud nupitena, mis eemaldab paremvääringu, kuid mitte otsuse. Kaks hoiatust: jätkamine kontrollpunktist lähtuvalt lähtestab kaalud ja ei ole optimaatorite jätkamine, ja juhtija käe joondamise liigutus on riistvara peal endiselt kerge testimine. Näe trenimine ja andmekogumid.
DAgger silmus, juba juhtmestatud
Ülevõtmine reaalajas järelduse jooksul, kaadrite märgimine, episoodide failima parandused või hindamised, segamis andmekogumi koossein selge episoodi valikuga allikati ja trenimine olemasoleva kontrollpunkti jätkamine on kõik sisse ehitatud. Te otsustate siiski, millal üle võtta ja mida säilitada - see osa ei automateeri.
Vaata, kuidas DAgger silmus toimibPerekonna puu ühes tabelis
| Meetod | Kes valib olekud | Mida ekspert varustab | Peamine kulu |
|---|---|---|---|
| Käitumuskloonimis | Ekspert | Puhtad demonstratsioonid | Taastamise andmeid pole; viga võib kumuleeruda ruutlikult T |
| Edasi trenimine | Õppija, ajassammu kohta | Sildid inditseeritud jaotuse mööda | T eraldi poliitikat; pikad horisondid kasutamatu |
| SMILe / SEARN | Stohhastiline segu eksperdist ja õppijast | Sildid segu jaotuse mööda | Segu komponendid erinevad kvaliteedi poolest |
| DAgger | Segapoliitika, beetaga kahanev nullini | Õige tegevus iga külastatud oleku jaoks | Märgistus olekud, mida ekspert kunagi ei toodaks, olles kontrolli all |
| DART | Ekspert, häiritud injitseeritud müra poolt | Demonstratsioonid kalibreeritud müra all | Müra peab olema õppija veale kalibreeritud |
| HG-DAgger | Õppija, kuni inimene üle võtab | Parandused ainult inimese kontrollitud lõikudes | Sõltub inimese otsusest, millal sekkuda |
| SafeDAgger | Õppija, filtreeritud ohutuse värava poolt | Sildid ainult siis, kui värav küsib | Värav ise peab olema treenitud ja usaldatud |
Sageli esitatud küsimused
Kas ma tegelikult jälgin ruuthilge kasvamist minu robotis?▾
Mitte puhta kõvernagi. Piir on halvim juhtum: tihe selles, et mingi probleem saavutab selle, mitte teie omast. Mida te näete, on tagajärg - poliitika, mis skooritab hästi seisvate kaadrite peal, ebaõnnestub tegeliku ülesande korral ja ei parandu, kui teete samast rohkem. Kui rohkem puhtast andmete aitamine lõpeb, on see kovariaatne nihe, mitte andmemahu probleem.
Kas ma pean rakendama beetasegu, et nimetada seda DAggeritks?▾
Parameetrita versioon - ekspert ringis üks, puhas õppija pärast - on seaduslik erijuhtum ja sageli sooritatud paremini algsetes katsetes. Mida te ei saa poista, on kogumine: ümbertrenimine ainult uusimatel parandustel murdab Follow-The-Leader tõlgendamise, kust no-regret argument pärineb. Treenimine ainult parandustel on palju nõrgem protseduur.
Miks tagastada parim poliitika valideerimishulgal viimase asemel?▾
Sest teoreemid garanteerivad hea poliitika olemasolu kusagil jadas, mitte et see on viimane iteraat - piir on jada minimaalselt. Paigaldus ükskõik mis viimase ringi väljundist kärleb välja väidetud tingimuse tulemuses ja viimane ring pole usaldusväärset parim.
Mitu ringi peaksin planeerima?▾
Teooria tahab iteratsioone T järjekord, mis 600-astmeline episoodi jaoks pole arv, mida keegi riistvara peal käitab. Algne katse jooksid kakskümmend iteratsiooni iga etalonmääratkis. Praktikas jooksevad ringid, kuni sekkumise määr lakkab langemast, kaugelt allpool analüüsi arvu - tegeliku lünga teooria ja praktika vahel.
Mis kui minu poliitika klass lihtsalt ei saa eksperti esindada?▾
Siis DAgger ei päästa teid ja piir ütleb nii - see on väljendatud epsilon_N suhtes, parim kadu klassis tagantjärele. Kui see on suur valesti arhitektuur, puuduva jälgimise või kaamera, mis ei näe stseeni, agregatsiooni annab poliitika, mis on optimaalne klassis, mis ei saa ülesannet teha. Käitaga avatud ahela taasesitus seisvate episoodide vastu enne parandustes kogunemist.
Kuhu siit minna
Kui te pole poliitika veel treenind, see teooria on enneaegne: salvestage andmekogum esimesena, alustades oma esimese poliitika treenimine ja töölaua klient. Kui teete kaal veel sada puhtast demonstratsioonist vastu alustada parandustest: puhast demonstratsioonid ei pea jaotuse probleemi. Mehaanika jaoks jätkake inimese kontrollitud variant ja siis SO-100 jalutuskäik.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started