Robotimanipulatsiooni stseeni abstraktne renderdus, kujutades olekujaotust, mida õpitud poliitika täitmise ajal külastab
DAggerJäljendusõpeKäitumuskloonimisRobotiõpeTeooria

DAgger selgitatud: Miks Behavior Cloning triivib ja mida Dataset Aggregation tegelikult tõestab

AY-Robots ResearchAugust 27, 202615 min lugemist

Käitumuskloonimise korral sobitab algoritm poliitika eksperdile iseloomuliku olekujaotuse järgi ja selle peale juurutatakse see iseseisvalt. Nende kahe jaotuse vahe on põhjus, miks poliitika, mis valideerimises suurepärane välja näeb, kõnnib sammul 300 laua pealt maha. See on meie DAgger-seeria teooriaosa: kust tuleb ruutvigatermin, mida muudab andmekogumi kogumine, mida eeldab no-regret tõestus ja millist osa arvest inimekspert veel tasuma peab.

On olemas konkreetne rike, millega kohtub igaüks, kes treenib manipuleerimispoliitikaid varem või hiljem. Poliitika sirutab käppa kuubi poole, jõuab kahe sentimeetri kaugusele, kohaneb, libiseb külgsuunas, seejärel teeb midagi ülesandega seotut. Valideerimiskadu oli hea. Avatud ahela taasesitus seisvate episoodide vastu oli hea. Siiski jõuab õlg sellisele positsioonile, mis treeniandmetes kusagil ei esine, ja sealt pole tal midagi mõistlikku öelda.

Sel rikkel on nimi ja sellel on taga korralik teooria. See on neljast artiklist esimene DAgger, ja see käsitleb argumenti ennast: miks poliitika sobitamine demonstraatori enda trajektooridele tekitab vea, mis võib kasvada episoodi pikkuse ruuduga, mida muudab andmekogumi kogumine ja mida no-regret tõestus ei lubada. Tegelik riistvarasilmus on käsitletud DAgger tsükli käitamine SO-100-l, inimese kontrolli all olev variant HG-DAgger ja inimese kontrollitud sekkumised, ja mõõtmise küsimus DAgger tsükli mõõtmine.

Lühiversioon

  • Käitumuskloonimis treenib eksperdi olekujaotusele ja hindab poliitika enda jaotust. Mittevastavus kumuleerub episoodi jooksul.
  • Ross ja Bagnell näitasid, et lisakulud võivad kasvada T ruudu korra sammu vigaga; DAgger uurimus esitab selle piiri ümber ja märgib, et see on tihe.
  • DAgger märgistab olekud, milleid poliitika külastab, ja treenib ümber kõigil siiani kogutud andmekogumitel, mitte ainult kõige uuemal.
  • Garantii on taandamine kahetsuseta veebis õppimisele: kogumine ja ümbertrenimine on Follow-The-Leader.
  • See kehtib poliitika klassis saavutatava parima kadumisega võrreldes, mitte nulliga - ja ekspert peab siiski märgistama olekud, mida ta kunagi poleks tootnud.

Eeldus, mida käitumuskloonimis vaikselt esitab

Demonstratsioon andmekogum on jälgimine-tegevuse paaride hunnik. Käitumuskloonimis sobib funktsiooni sellele hunnile tavapärase juhendatud õppega ja seisab seal. See on kõige vanima idee valdkonnas. Pomerleau ALVINN 1988. aastal oli kolmekihiline tagasikliimamise võrk, mis võttis pilte kaamerast ja laserite ulatuse leidjast ning tootis suuna, kuhu sõiduk peaks liikuma; seda treeniti simuleeritud teepiltidel ja järgis tegelikke teid mõnedel välitingimustel. Retsept ei ole palju muutunud; võrgud on.

Mida vahele jäetakse, on kontroll, kust need paarid pärinevad. Igaüks neist asub demonstraatori koostatud trajektooril. Poliitika, mida te kasutusse võtate, toodab oma. Niipea kui see kaldub, vastab muudetavale olekutele, mis ei olnud treeningjaotuses, ja selle vastus liigutab seda kaugemale. Ross, Gordon ja Bagnell avanevad DAgger uurimuse sellega täpselt: järjestikune ennustus rikub i.i.d. eeldus statistilise õppimise all, sest õppija enda ennustused määravad sisendid, mida ta järgmisena näeb.

Selgeim illustratsioon selles uurimusesseta pole robot üldse. Super Mario Brose peaaegu optimaalse planeerija kloonimis tekitas poliitika, mis jäi korduvalt takistuse vastu kinni, selle asemel et üle hüpata. Põhjus on kogu argument ühe lausega: ekspert alati hüppas mugavast kaugusest, nii et andmekogus puudus olek, milles Mario oli takistuse vastu surutud, ja seetõttu polnud silti selle kohta, mida teha, kui ta sinna jõudis.

Asenda Mario SO-100 käega ja struktuur on identne. Teie demonstratsioonid näitavad puhtast lähendamist ja puhtast haardest, mitte griiperit kahest sentimeetrist lühem sulgemist - nii et poliitikale pole aimugi, mida sealt teha, ja kõik, mida ta arvab, viib selle kaugemale. Kovariaatne nihe on omadus andmete kogumise protseduur, mitte võrgu arhitektuurist.

Kust tuleb ruuttermin

2010. aasta AISTATS uurimus Ross ja Bagnell, Jäljendusõppe tõhusad taandamised, muudab kumuleerumise täpseks. Olgu T ülesande horisont, olgu ülesande maksumus piiratud ühiku intervallis ja olgu epsilon asendatusviga, mida mõõdetakse eksperdise olekujaotus - arv, mille teie valideerimishulk teatab. Seejärel on selle poliitika käitamise lisakulud T sammut ette võrreldes eksperdi suhtes piiratud T ruudu korra epsiloniga. Ross, Gordon ja Bagnell esitavad selle DAgger uurimuse 2.1 teoreemina ja lisavad olulise lause: piir on tihe. Probleemid on olemas, kus poliitika, millel on epsilon kadu eksperdi jaotuses, tõepoolest kasvab kvadraatiliselt T-s.

Tihe ei tähenda tüüpilisust. Ruuttermin on halvim juhtum probleemide klassis, mitte ennustus teie valimis ja paigutamis ülesandeest. Mida see kehtestab, on see, et rohkem eksperdi demonstratsiooni ei saa probleemi eemaldada: see teeb epsilon hinnangu teravamaks jaotusele, mida poliitika ei ole testitud.

Põgenemise tee on samas uurimuses, esitatud teoreemiga 2.2. Kui poliitika saavutab kadumise epsilon all oma olekujaotus, ja ühe vale tegevuse maksumusest kuni käi maksumusetus eksperdiga on maksimaalselt u, siis lisakulud on piiratud u korda T korda epsilon - lineaarne horisondis. Konstant u on huvitav suurus: maksimaalselt 1 0-1 mitteühtluses eksperdi suhtes ja O(1), kui ekspert saab taastuda mõne sammuga. Halvimal juhul on see O(T) ja lineaarne piir pole siis ruutlikust parem.

SeadistusPiir lisatulule eksperdileMillel see põhineb
Käitumuskloonimis (Ross & Bagnell 2010, esitatud Thm. 2.1 Ross jt 2011)T ruudu korda epsilonepsilon mõõdetud eksperdise olekujaotuses; kulu [0,1]; piir on tihe
Iga poliitika, millel on epsilon kadu oma jaotuse all (Thm. 2.2)u korda T korda epsilonu piirab ühe vale tegevuse kulu käimise karistust; maksimaalselt 1 0-1 kaole, O(T) halvim juhtum
Edasi trenimine (Ross & Bagnell 2010)u korda T korda epsilonüks poliitika ajasammu kohta; vajab T poliitikat ja teadaolevat, lõplikku T
SMILe (Ross & Bagnell 2010)peaaegu lineaarne T ja epsilon mõnestel probleemiklassidelalfa O(1/T ruudu), N O(T ruudu log T); annab stohhastilise segu
DAgger (Thm. 3.2, Ross jt 2011)u korda T korda epsilon_N, pluss O(1)N uT järjekord; tugevalt kumer piiratud kadu; kahetsuseta õppija; epsilon_N on parim kadu tagantjärele
Roboti töötsoon, mis esindab olekuid, milleid poliitika külastab, mis ei kunagi ilmunud demonstratsiooni kogumis
Olekud, mis DAgger tsükli jaoks olulised, on need, mida keegi ei demonstreerinud: peaaegu valesti käija, poollahti griiper, käsi objekti taga.

Kaks katset, mis tulid enne DAggerit

Edasi trenimine on aus kuid ebapraktiline vastus. Treenige eraldi poliitika iga ajassammu jaoks, järjekorras, igaüks olekujaotusele, mis on indutseeritud poliitikate poolt, mis on juba määratud varasemate sammude jaoks, nii et iga poliitika näeb täpselt jaotust, millega ta silmitsi seisab. Lõks on kirjelduses: T poliitikat, treenitud järjestikku, ilma varase peatuseta. Manipuleerimise jaoks episood 30 kaadri sekundis, T on sadades.

SMILe, samast uurimusest, ja SEARN, Daume, Langford ja Marcu tööst struktureeritud ennustamise kohta, võtavad teise tee: üks statsionaarne poliitika, kuid stohhastiline. Iga iteratsioon treenib komponenti ja lisab selle segule, nihutades tõenäosuse massi eksperdi eest. Tulemuseks on segu, milles mõned komponendid on halvemad kui teised - füüsilisel käel, kontroller, mis võib valida halva komponendi liikumise ajal. See on avaldatud motivatsioon statsionaarse soov deterministlik poliitika asemel.

DAgger: üks idee, üks kast

Dataset Aggregation säilitab deterministliku poliitika ja liigutab paranduse andmekogumisse. Iga ring: lahti käivitatav praegune poliitika, salvestage riigid, mida külastab, küsige eksperdi käest, mis oleks õige tegevus olnud igaühes, lisage need paarid andmekogumile, mida teil juba on, treenige ümber liidu. Nimi on algoritm - te aggregeerite, te kunagi ei käitu.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
DAgger metaalgoritm, algoritm 3.1 Ross, Gordon & Bagnell (2011).

Kolm detaili kannavad rohkem kaalu, kui nad paistab. Sildid on seisundite jaoks, mida külastab segapoliitika, kuid tegevused pärinevad eksperdi käest - poliitika esitab küsimused, ekspert vastused. Ümbertrenimine on kogu agregaadil, mis muudab iga ringi Follow-The-Leader sammuks: ringil n valite parima poliitika tagantjärele iga dossiee üle siiani. See raamistik on see, millele tõestus tuggineb. Ja algoritm lõpetab parimast poliitikaga jadas, mida valitakse valideerimishulgal, sest teoreemid garanteerivad, et mingi poliitika jadas on hea, mitte et viimane on.

Beetagraafik ja miks see pole häälestusknopf

Segapoliitika on beta_i korda ekspert pluss üks miinus beta_i korda õppija. Punkt on praktiline: esimesed õpitud poliitikad on treenitud väga väikese andmemahuga, teevad palju vigu ja kulutaksid muidu rollikuse olekutes, mis muutuvad asjatuks, kui poliitika paraneb.

Teooria seab täpselt ühe tingimuse: beetade jooksev keskmine peab minema nulli. Analüüs töötab beetaga_i piiratud (1 - alfa) astmega i-1, konstandiks alfa sõltumatuks T.

AjakavaMida ta teebMida uurimus teatab
beta_1 = 1Esimene ring on puhas eksperdi demonstratsioon; algne poliitika pole vajalikSoovitatav lähtepunkt igas variandis
beta_i = 1 kui i = 1, muul juhul 0Ekspert ainult esimeses ringis; breiparameetrit poleUurimuse parameetrita versioon, mis ütleb, et praktikas toimib sageli paremini; 2980 Super Mario Bros. 20 iteratsiooni järel
beta_i = p^(i-1) p = 0,5Eksperdise tõenäosus mureneb geomeetriliselt3030 samal etalonmääratkis, pisut ette parameetrita versiooni
beta_i = p^(i-1) p = 0,9Ekspert jääb silmusesse palju kauemaksMärkimisväärselt aeglasem konvergents; ikka paranev, kui 20 iteratsiooni lõppesid

Vahe 2980 ja 3030 vahel skaalal, mis ulatub umbes 4300-ni, on väike, kuid uurimuse seletus sellest on praktilisem märkus sektsioonis. Parameetrita graafiku korral Mario kiiludes sama koha juurde varakult ja tekitas massi peaaegu dubleerivaid andmeid sellest ühest kohast; lasta eksperdil ajam murdosa ajal nii vabastas ta ja laiendas olekute valikut. Ajakava käsitletakse vähem segamissuhtarvust kui sellest, kas teie andmekogumi kogumine paljastab uusi olekuid või sama rike.

Miks ajakava ei kande füüsilisele käele nii, nagu kirjutatud

Stohhastiline ajassammu-kohene segu tähendab juhtimisasutuse lülitamist juhtimiskiirusel, 30 korda sekundis tüüpilisel SO-100 seadistuses. Ükski kaugjuhitamise liides ei tee seda turvaliseks või mõttelikuks. Tegelikul riistvaral annab beetagraafik järgi inimese otsusele millal üle võtta: erinev algoritm erineva analüüsiga.

Garantii: taandamine kahetsuseta veebis õppimisele

Siin on käik, mis muudab uurimuse selleks, mis see on. Käsitlege iga DAgger ringi näitena võrgus õppimise probleemis, kus kadu ringil i on asendatusviga poliitika olekujaotuse all, mida kasutatakse ringil i. Õppija kinnitab poliitikale enne selle kadumise nägemist ja jada on mittestaatiliselt, sest see sõltub siiani toodetud poliitikatest.

Algoritm on kahetsuseta, kui selle keskmine kadu N ringis läheneb parima ühe poliitika omale tagantjärele. Follow-The-Leader tugevalt kumertel kadudel on selline algoritm, keskmise kahetsuse vähenemisega 1/N järjekord - ja täienel agregaadil treenimine on täpselt Follow-The-Leader. Iga teine kahetsuseta õppija sobituks samuti: analüüs on taandamine, mitte ühe optimaatori omadus.

Üks lemma ühendab lünga segapoliitika vahel, mis kogus andmeid, ja õpitud poliitika vahel, mida juurutatakse: Lemma 4.1 piirab L1 kaugust nende olekujaotuste vahel 2 T beta_i. See on põhjus, miks beetad peavad vähenema - kui ekspert endiselt hoiab märkimisväärset juhtimisasutust, ei ole riigid, mida kogute, riigid, mida teie poliitika toodab. Kombineerige lemma kahetsuse piiriga ja peamine tulemus järgneb: pärast ligikaudu T iteratsiooni omab mõni poliitika jadas asendatusviga oma jaotuse all O(1/T) sees epsilon_N. Sisestage see lineaarse piiri ja maandute Theorem 3.2.

Empiiriline pool on praeguste standardite järgi tagasihoidlik. Super Tux Kartis ei parandanud juhendatud lähtejoon oma keskmist kukkumist ringi kohta, kui rohkem andmeid saabus, jõudis DAgger poliitikale, mis kunagi ei kukkunud rajalt pärast viieteist iteratsiooni, ja SMILe kahekümne järel kukkus endiselt umbes kaks korda ringi kohta. Käekirja etalonmääratkis oli tähemärkide täpsus 82 protsenti ilma struktuurita, 83,6 protsenti juhendatud, 85,5 protsenti DAggeriga. Ükski neist pole manipuleerimise tulemus.

Mida tõestus ei lubade

Teoreem väited on tinglikud ja tingimused on koormusekandvad.

DAgger garantii, lugege tähelepanelikult
Mida see teile annab
  • Piir lineaarne, mitte ruutlikult T, nimetatud eelduste all.
  • Statsionaarne deterministlik poliitika, mitte stohhastiline segu.
  • Tõeline taandamine: iga kahetsuseta veebis õppija sobitub.
  • Konkreetne iteratsiooni loendus - ligikaudu T ringid enne kahetsuse termini olulisuse lõpetamist.
  • Garantii vähemalt ühe poliitika jaoks jadas, siit lõpetava valideerimise läbikäik.
Mida see teile ei anna
  • See on epsilon_N suhtes, parim kadu klassis tagantjärele, mitte nulli suhtes. Kui teie klass ei saa eksperti esindada, on see praktikas tühi.
  • See vajab kahetsuseta meetodit või tugevalt kumerat asendatusviga - tugevamalt kui klassifikeerimise taandamist, mille peal ta ehitab, nagu autorid märgivad.
  • Konstant u võib olla O(T) halvimal juhul ja lineaarne piir langetab seejärel tagasi ruutlikuks.
  • See piirab iteratsioone, mitte eksperdi silte. Robotis on sildid eelarve.
  • See eeldab, et eksperti saab päringuga kõigis külastatud olekutes ja ta vastab õigesti seal. See eeldus on kogu kulu.

Üks edasine tulemus tsiteeritakse sageli pöördumisena ja see pole. Rajaraman, Yang, Jiao ja Ramachandran uurivad jäljendusõppe minimaaksi piiranguid episoodilistes MDP-des lõpliku olekuruumiga S ja horisondiga H ning tõestavad suboptimaalse alampiiri |S| H ruudu järjekord üle N, mis kehtib isegi siis, kui õppija võib aktiivselt päringuga eksperdist külastatud olekutes. See on halvim määr MDP-de klassis fikseeritud episoodi eelarve korral ja mida see välistab, on ideeda, et interaktsioon parandab minimaaksi määra; DAgger teoreem on erinev väide, seades poliitika piiriga juurutatakse suhtes sellega, mida selle enda poliitika klass saavutada.

Swamy, Choudhury, Bagnell ja Wu klassifitseerisid hiljem neid algoritme eksperdi käitumise hetkedega, mida nad vastavad, ja tutvustasid hetke taastamise mõistet, mis määratleb, kui hästi iga perekond leevendab kumuleeruvat viga. Osa ja Celemin uuringud katavad algoritmilise maastiku ja inimese tagasiside liideste.

Arve: märgistused olekud, mida ekspert kunagi ei tootnud

Kõik ülal eeldab eksperti, keda võib päringuga küsida kõikjal. Simulatsioonis plaanijaga, mis on peaaegu tasuta - Mario katsed kasutasid peaaegu optimaalset plaanijat täielike juurdepääsuga mängule. Inimese ja roboti korral on see domineeriv kulu ja kummaline: inimene peab tootma õige tegevuse konfiguratsioonis, mida nende enda pädevus kunagi ei oleks loonud.

Kelly, Sidrane, Driggs-Campbell ja Kochenderfer esitavad vastuväite otse HG-DAgger uurimuses. Vanilla DAgger nõuab eksperdi varustamist tegevuse siltidega, olles süsteemi täisfunktsionaal all. See vähendab ohutust ja inimese eksperdiga on tõenäoline kogutud siltide kvaliteedi halvenemise, mida nad seostavad tajutava aktuaatori viitega. Silt, mille te tagasi saate, pole silt, mida algoritm eeldas.

Laskey ja kolleegid rünnavad probleemi teisest küljest DARTiga ja nende raamistik on otsekohe: poliitika järgsed tehnikad on inimese järelevalvijatele tedinud, lisavad arvutuslikku koormust ja võivad külastada ohtlikke olekuid treenimise ajal. Nende alternatiiv süstib kalibeeritud müra järelevalvija enda demonstratsioonidesse, nii et taastamine saab demonstreeritud robotiga kunagi käitamata mitteslampet poliitikat. MuJoCo humanoidil teatavad nad DARTist järelevalvija kumulatiivse tasuna vähenemisega 5 protsendi treenimise ajal, samal ajal DAgger käitab poliitikat 80 protsendiga väiksema kumulatiivse auhinnaga kui järelevalvija; haaramine segaminis Toyota HSRiga, keskmiselt 62 protsendine tõus käitumiskloonimise üle.

Zhang ja Cho SafeDAgger käsitleb päringuid referentsi poliitikal kui nappide ressursse: eraldi turvalisuse poliitika ennustab, ilma päringuta, kas esmane poliitika hakkab referentsist kalduma läve üle, ja ainult need olekud ülekanduvad. Kõik kolm reageerivad samale faktile - DAgger analüüs ei nõua midagi eksperdi siltidele ja tegelikkus maksab palju.

Osa, millest keegi sind ei hoiata

Väljavalitud olekute märgistamine on vaimselt raskem kui ülesande demonstreerimine. Normaalne demonstratsioon tähendab mootorikava käitamist, mis sul juba on. Poliitika parandamine, mis on griiperi kuhugi paigutanud, mida sa kunagi ei teeks, tähendab taastamise konstrueerimist kohapeal, ajaline surve all, robot endiselt liigub. Oodake vähem kasutatavaid minuteid sessiooni kohta kui tavalises salvestamise sessioonis ja jälgige oma paranduse kvaliteedi kulumist.

LeRobot andmekogumi struktuur, mis näitab episoode, kaadrit ja kaadrite kohta olevaid veerge, nagu salvestatud kettale
Parandused muutuvad andmekogumiks alles siis, kui sekkumiste kaadrit märgitakse - LeRobot formaadis kaadri kohta veerg jälgimise ja tegevuse kõrval.

Mida see tähendab SO-100 jaoks teie laual

Tõlkige horisont oma ühikutesse. Kahekümne sekundi episood 30 kaadri sekundis on 600 otsuse sammu ja T iga piiri ülal on see number. T = 600 korral on erinevus termini vahel, mis skaleerib T ja ühega, mis skaleerib T ruudu, erinevus poliitika vahel, mis taastub halva lähendamise järelt ja ühega, mis ei taastuks.

See on osa sellest, miks tegevuse komplektimine aitab: kui poliitika väljastab tegevuste lühikese jada iga järelduse sammu kohta, langeb otsuse punktide arv, samuti võimaluste arv kumuleerumiseks. Zhao, Kumar, Levine ja Finn nimetavad kumuleeruvat viga motivatsiooniks Action Chunking Transformerstega ja teatavad 80 kuni 90 protsendilisest edust kuues raskes tegelikkaelühistlikus ülesandes, odavate bimanualse riistvara korral, kümne minuti vääriliste demonstratsioonide põhjal. Komplektimine ei eemalda kovariaatset nihet - olekud on endiselt poliitika omad - kuid see lühendab tõhusat horisonti. Näe tegevuse komplektimine ja SO-100 jäljendusõppe juhend.

Teine tõlge on edendamise mõõdik. Te ei saa epsiloni mõõta poliitika enda jaotuse all otseselt - see vajab maapinna-tõe eksperdi tegevusi iga külastatud oleku jaoks, asi, millest te püüate vältida. Mida inimese kontrollitud silmus teile annab, on sekkumise määr: kaadrite osa jooksus, mille jooksul inimene oli üle võtnud. See on prok ja ta liigub põhjustel, mis pole seotud poliitikaga - kannatlik operaator sekkub vähem. Järjepidevalt kasutatud on see üks number, mis ütleb, kas ring oli pärastlõunat väärt.

Kolmas tõlge on andmete kvaliteedinäide, mida analüüs ei kata. Mandlekar ja kolleegid uurisid kuut ühenduseta õppimise algoritmi viiel simuleeritud ja kolmel tegeliku maailma multi-etapi manipulatsiooni ülesandel ning teatavad algoritmi disaini valikute tundlikkusest, demonstratsioonide kvaliteedi sõltuvusest ja seiskamise kriteeriumiga põhjustatud muutlikkusest. Belkhale, Cui ja Sadigh väidavad, et andmekogumi kvaliteeti tuleb formaliseerida tegevuse lahknemise ja ülemineku mitmekesisuse kaudu ning märgivad, et oleku mitmekesisus ei ole alati kasulik. DAgger ring lisab olekud, mida keegi tahtlikult ei valinud: mõned on taastamise andmed, mida vajate, mõned on robot lehvimas teie käppida takeover juhtimise järgi.

Mehaaniliselt on ring kuus sammu: käita järeldus salvestamisega, võta üle, kui poliitika käitub valesti, vaata jooksu üle ja archiveeri iga episood, sünkrooni parandused, koosta segamis andmekogum originaalidest pluss parandustest selgelt valitud episoodi allikaga ja jätka treeningut eelnevast kontrollpunkt mitte baasmudelit. Ay-robotsil on need sammud nupitena, mis eemaldab paremvääringu, kuid mitte otsuse. Kaks hoiatust: jätkamine kontrollpunktist lähtuvalt lähtestab kaalud ja ei ole optimaatorite jätkamine, ja juhtija käe joondamise liigutus on riistvara peal endiselt kerge testimine. Näe trenimine ja andmekogumid.

DAgger silmus, juba juhtmestatud

Ülevõtmine reaalajas järelduse jooksul, kaadrite märgimine, episoodide failima parandused või hindamised, segamis andmekogumi koossein selge episoodi valikuga allikati ja trenimine olemasoleva kontrollpunkti jätkamine on kõik sisse ehitatud. Te otsustate siiski, millal üle võtta ja mida säilitada - see osa ei automateeri.

Vaata, kuidas DAgger silmus toimib

Perekonna puu ühes tabelis

MeetodKes valib olekudMida ekspert varustabPeamine kulu
KäitumuskloonimisEkspertPuhtad demonstratsioonidTaastamise andmeid pole; viga võib kumuleeruda ruutlikult T
Edasi trenimineÕppija, ajassammu kohtaSildid inditseeritud jaotuse möödaT eraldi poliitikat; pikad horisondid kasutamatu
SMILe / SEARNStohhastiline segu eksperdist ja õppijastSildid segu jaotuse möödaSegu komponendid erinevad kvaliteedi poolest
DAggerSegapoliitika, beetaga kahanev nulliniÕige tegevus iga külastatud oleku jaoksMärgistus olekud, mida ekspert kunagi ei toodaks, olles kontrolli all
DARTEkspert, häiritud injitseeritud müra pooltDemonstratsioonid kalibreeritud müra allMüra peab olema õppija veale kalibreeritud
HG-DAggerÕppija, kuni inimene üle võtabParandused ainult inimese kontrollitud lõikudesSõltub inimese otsusest, millal sekkuda
SafeDAggerÕppija, filtreeritud ohutuse värava pooltSildid ainult siis, kui värav küsibVärav ise peab olema treenitud ja usaldatud

Sageli esitatud küsimused

Kas ma tegelikult jälgin ruuthilge kasvamist minu robotis?

Mitte puhta kõvernagi. Piir on halvim juhtum: tihe selles, et mingi probleem saavutab selle, mitte teie omast. Mida te näete, on tagajärg - poliitika, mis skooritab hästi seisvate kaadrite peal, ebaõnnestub tegeliku ülesande korral ja ei parandu, kui teete samast rohkem. Kui rohkem puhtast andmete aitamine lõpeb, on see kovariaatne nihe, mitte andmemahu probleem.

Kas ma pean rakendama beetasegu, et nimetada seda DAggeritks?

Parameetrita versioon - ekspert ringis üks, puhas õppija pärast - on seaduslik erijuhtum ja sageli sooritatud paremini algsetes katsetes. Mida te ei saa poista, on kogumine: ümbertrenimine ainult uusimatel parandustel murdab Follow-The-Leader tõlgendamise, kust no-regret argument pärineb. Treenimine ainult parandustel on palju nõrgem protseduur.

Miks tagastada parim poliitika valideerimishulgal viimase asemel?

Sest teoreemid garanteerivad hea poliitika olemasolu kusagil jadas, mitte et see on viimane iteraat - piir on jada minimaalselt. Paigaldus ükskõik mis viimase ringi väljundist kärleb välja väidetud tingimuse tulemuses ja viimane ring pole usaldusväärset parim.

Mitu ringi peaksin planeerima?

Teooria tahab iteratsioone T järjekord, mis 600-astmeline episoodi jaoks pole arv, mida keegi riistvara peal käitab. Algne katse jooksid kakskümmend iteratsiooni iga etalonmääratkis. Praktikas jooksevad ringid, kuni sekkumise määr lakkab langemast, kaugelt allpool analüüsi arvu - tegeliku lünga teooria ja praktika vahel.

Mis kui minu poliitika klass lihtsalt ei saa eksperti esindada?

Siis DAgger ei päästa teid ja piir ütleb nii - see on väljendatud epsilon_N suhtes, parim kadu klassis tagantjärele. Kui see on suur valesti arhitektuur, puuduva jälgimise või kaamera, mis ei näe stseeni, agregatsiooni annab poliitika, mis on optimaalne klassis, mis ei saa ülesannet teha. Käitaga avatud ahela taasesitus seisvate episoodide vastu enne parandustes kogunemist.

Kuhu siit minna

Kui te pole poliitika veel treenind, see teooria on enneaegne: salvestage andmekogum esimesena, alustades oma esimese poliitika treenimine ja töölaua klient. Kui teete kaal veel sada puhtast demonstratsioonist vastu alustada parandustest: puhast demonstratsioonid ei pea jaotuse probleemi. Mehaanika jaoks jätkake inimese kontrollitud variant ja siis SO-100 jalutuskäik.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started