Operaator juhib robotikal käsikaudu teleoperation liidese kaudu, käed juhtelementidel ja valmis üle võtma
DAggerInteraktiivne JäljendusõpeHG-DAggerRoboti PoliitikadSO-100

HG-DAgger ja Gated Variandid: Kes Otsustab, Millal Roboti Poliitika Üle Võtta

AY-Robots ResearchAugust 27, 202615 min lugemisaeg

Plain DAgger nõuab inimeselt riike silditada, samas kui robot on endiselt sõidus. Päris riistvaral on see ohtlik ja tekitab halbu silte. Gated variandid asendavad pimedate märgistamise väravaga, mida keegi peab hoidma: inimene HG-DAggeris, ohutuklassifikaator SafeDAggeris, komplekti lahkarvamustes EnsembleDAggeris, eelarveliselt hinnatud uudsus ja risk ThriftyDAggeris. See artikkel võrdleb neid selle järgi, kes väravat omab, milline signaal selle avab, ja milline on iga ühe maksumus — ja miks human-gated vorm on see, mis ellu jääb tegelikus kontakti võtmisel päris käega.

Kloonitud poliitika ebaõnnestub seal, kus selle treeningandmed otsa said. Parandus on andmete kogumine poliitika enda olekujaotuse järgi, mitte demonstraatori oma järgi, mis on see, mida DAgger teeb ja mida andmete agregatsioon sissejuhatus katab esimestest põhimõtetest. Jäetakse avatuks algoritmi keeruline osa: kui õppija sõidab, peaks ekspert ütlema, mida nad oleks teinud, iga riigi puhul, ilma juhtimises olema.

Simulaatoris skripteeritud eksperdiga, mis on tasuta. Lauaga päris käega sellel pole see tasuta ega turvaline. HG-DAgger autorid esitavad vastuväite täpselt: sellised proovivõtmisskeemid "nõuavad eksperdilt tegutsemissilte andmist ilma süsteemi täieliku juhtimiseta", mis "võib vähendada ohutust ja, inimesi kasutamisel ekspertidena, on tõenäoliselt halvendada kogutud siltide kvaliteeti tajutud aktuaatori hilinemise tõttu" (Kelly et al., 2019). Kaks ebaõnnestumist peituvad selles lauses: poliitika jätkab sõitu riikidesse, kuhu keegi seda soovida ei ole, ja selle riski eest ostetud sildid on halvemad kui need, mida inimene toodab, hoies juhtimist. Iga allolev variant vastab samale küsimusele — pane värav juhtimisele ja lase kellel otsusel, millal see avaneb. Nad erinevad selles, kes see keegi on.

Lühike versioon

  • Gated variandid asendavad pimedate märgistamise lülitiga poliitika juhtimise ja eksperdi juhtimise vahel. See, mis neid eraldab, on see, kes lülitit omab.
  • HG-DAgger annab lüliti inimesele ja kogub ainult andmeid, mis salvestatakse, samas kui inimene oli katkestamatult juhti.
  • SafeDAgger annab selle binaarsele klassifikaatorile, mis ennustab kõrvalekaldumist võrdluskava poliitikast; EnsembleDAgger nõuab madala komplekti dispersiooni ja väikest kaugust eksperdi tegevusest samaaegselt.
  • LazyDAgger lisab hüsterees, nii et juhtimine ei kahvi-kahvi; ThriftyDAgger väravad uudsuse või hinnatava riski alusel selgesõnalise sekkumise eelarve kaasabil.
  • Roboti värava signaalid vajavad midagi, millest peene häälestatud VLA hobiklassi käel tavaliselt puudub: võrdluspoliitika, odav komplekt, või kalibrieeritud epistemiline ebakindlus.
  • Värava on pool meetodit. Mis juhtub sekkumise segmentidega pärast — segada, kaaluda, koguda — otsustab, kas ring aitas midagi.

Human-gated ja robot-gated: erinevus, mis määrab

Interaktiivne jäljendusõpe on omal uuringul; Celemin ja kolleegid kataloogitavad selle piki tagasiside tüüpi, liidese, õppe mudeli, kasutaja kogemuse, rakenduse ja võrdlusaluse järgi. Erinevus, mis määrab teie insenertehniliselt, on lihtne kui ükski neist telgedest ja hiljutine töö nimetab seda otse: meetod on human-gated kui superviisor otsustab, millal sekkuda, ja robot-gated kui agent otsustab, millal abi paluda (Cai et al., 2025). Kõik muu on masinad, mis teenivad ühte neist kahest valikust. Kauplemine on nähtav algusest: inimese värava maksumus on jätkuv tähelepanu, ja roboti värava lubab anda selle tähelepanu tagasi — aga ainult kui signaal, millele ta väravat avab, on usaldusväärne, ja selle signaali ehitamine on omaette uuringprobleem.

SafeDAgger: klassifikaator, mis ennustab oma kõrvalekaldumist

Zhangi ja Choi SafeDAgger (2016) on varaseim neist väravadest. Võrdluspoliitika päringu tegemine on kallis osa, nii et teine, väike võrk — ohutupoliitika — ennustab, kas päringu tegemine on üldse väärt. See "tagastab binaarsildi, mis näitab, kas peamine poliitika on tõenäoliselt päringu tegemiseta võrdluspoliitikast kõrvale jääda". Silt on määratletud kahe poliitika tegevuste vahel olevate ruutkeskmiste L2 kõrvalekaldumise suhtes lävega tau ja klassifikaator sobib binaarsel risistemi-entropias. Jooksutamisel otsustab see riigi järgi, kas õppija jätkab sõitu või võrdlus võtab üle. Abstraktis teatatud vähem võrdlusepäringuid auto võidusõidu simulaatoris pluss konvergentsi kiirenemine, mida autorid omistasid automatiseeritud õppeplaan efektile, ilma arvuna antud.

Fängus on definitsioonist, mitte tulemustest. Klassifikaatori treenimine nõuab võrdluspoliitika tegevust iga riigis, mis kasutatakse selle sobitamiseks, mis eeldab, et võrdlus on teine programm. Kui teie võrdlus on inimene juhtivat käega, siis selle sildi komplekt pole odav ja meetod kaotab omaduse, mille jaoks see loodi.

EnsembleDAgger: kahvel ja lahkarvamus, mõlemad

Menda, Driggs-Campbell ja Kochenderfer (2019) käsitlevad värava kui tõenäosusliku küsimuse. EnsembleDAgger "läheneb Gaussian Process-le kasutades neuraalsete võrkude komplekti" ja loeb komplekti dispersiooni usaldusväärsuse asendajana: kõrge dispersioon tähendab piirkonda, mis pole treeningandmetes nagu, mis — eeldades, et ekspert väldin rikeste riikide — korrelatsioonid lähedusega rikistada. Reegel on konjunktsioon. Õppija võib tegutseda ainult siis, kui L2 kaugus selle keskmise tegevuse ja eksperdi tegevuse vahel jääb ühe lävest alla (lahkarvamus) ja selle ennustatud tegevuse dispersioon jääb teise järgi alla (kahvel). Kui kumbki ebaõnnestub, ekspert võtab juhtimise. Eesmärk on maksimeerida õppija tegevuste osa, piirates rikistamise tõenäosust; paberis teatatud paranenud ohutus ja õpe teiste DAgger variantide vastu pööratud pendlil ja MuJoCo HalfCheetah.

Lahkarvamusliige vajab eksperdi tegevust

See vaikselt diskvalifitseerib täielik reegel käepärast järelevalve puhul. Kaugus õppija tegevuse ja eksperdi tegevuse vahel nõuab eksperdi tegevust sel riigil, sel hetkel. Skripteeritud eksperdiga sobib. Inimesega, inimene peab pidevalt tegevusi tootma — täpselt koormus, mida gated variandid pidid eemaldama. Kahtlus liige on käepärane; konjunktsioon pole.

LazyDAgger: seiska lüliti kitkumast

Hoque ja kolleegid (2021) ründasid kulusid, mida varem paberid ei mõõtnud: lüliti ise. Iga sekkumine "katkestab muud tööd, mida inimene teeb, tekitab latentsust iga konteksti lülitusega järelevalve ja autonoomse juhtimise vahel, ja nõuab aega sooritamiseks". Värava, mis avaneb ja sulgub kümme korda minutis, on halvem kui üks, mis avab kümme sekundit, identsete autonoomse osa juures. LazyDAgger laiendab SafeDAggerit asümmeetriliste lävedega — raskem sisene järelevalve juhtimisele kui jääda sellele — nii et süsteem ei võngu piiril. Simulatsioonis "saab vähendada konteksti lülitusi keskmiselt 60% SafeDAgger üle 3 pideva juhtimise ülesande puhul, säilitades järjepidevuse poliitika jõudluse"; kangamanipulatsioonis ABB YuMiga "vähendab konteksti lülitusi 60% võrra, saavutades 60% kõrgema edumäära kui SafeDAgger jooksutamisajal".

ThriftyDAgger: uudsus või risk, eelarves

ThriftyDAgger (Hoque et al., CoRL 2021) algab järelevalvijast eelarve asemel poliitika asemel. See "kasutab õpitud lülituse poliitika paluda sekkumisi ainult riikides, mis on piisavalt (1) uudsed, kus roboti poliitika neil pole viidutugi käitumist jäljendamiseks, või (2) riskiga, kus robotil on madal kindlus ülesande lõpetamisel", uue mõõdikuga selle riski hindamiseks. Eelarve on sisend, mitte väljund: te vastate, kui palju inimese aega te kulutusite. Jooksutamisajal rakendatud meetod "saavutab 100% edumäära nii simulatsioon- kui füüsiliste ülesannete puhul", ja kasutaja uuring kümnele osalejale, juhivad kolmerobootit kõrvuti kontsentratsiooni ülesandega, teatab, et see "suurendab inimese ja roboti jõudlust vastavalt 58% ja 80% järgi võrreldes järgmise parima algoritmiga, piirates järelevalvija koormust". Laeva seadmine on loomulik kodu sellele tööle; Fleet-DAgger viitasitte hiljem formaliseeritud interaktiivsete laevadega õppe mitut roboti ja järelevalvijaga, soovitades Return on Human Effort kui kogust, mida optimeerida.

HG-DAgger: inimene hoiab värava

Kelly et al. (2019) lähevad teise viisi. Pole mingit lülitamise poliitika. Õppija rullitakse välja "kuni ekspert jälgib, et algaja on sisenenud osariik ohutu ruumi piirkonda", sel hetkel ekspert võtab juhtimise ja juhatab süsteemi tagasi. Agregatsiooni reegel on range osa: "Eksperdi tegevuse sildid kogutakse ja lisatakse andmekogumisse ainult nende taastamine trajektoorid, mille ajal inimesel oli juhtimise täieliku juhtimine." Midagi ei silditata, kuigi inimene on vaatleja.

See ei peatu lüliti juures. HG-DAgger õpib ka "ohutuläve mudeli-ebakindluse-põhisele riskimõõdikule, mida saab kasutada täielikult koolitatud algaja jõudluse ennustamiseks erinevates olekuruumi piirkondades": see registreerib, kui ebakindel oli õppija hetkil, mil inimene sekkus ja keskmistab viimase veerandi neist kirjetest, kus õppija enim sarnaneb oma lõplikule kujule. See pole värava, mida robot opereerib, vaid diagnostika, mis ütleb teile, kus valmis poliitika oodatakse hoida. Hindamine katab simuleeritud ja reaalse sõidu ülesande ning teatab paranenud jõudlusest nii DAgger kui käitumise kloonitamise osas.

Üks seotud rida muudab, mida sildi arvväärtusena loetakse. Spenceri ja kolleegide Eksperdi Sekkumise Õpe peab, et "iga eksperdi tagasiside summa, olgu sekkumise või sekkumiseta, annab teavet praeguse riigi kvaliteedi, tegevuse optimaalsuse või mõlema kohta", formaliseeritud piiranguna õppija väärtuse funktsioonil ja lahendatud ilma kahetsuseta võrgujuhtumisel. Selle lugemise alusel on venivused, kus inimene vaatas ja midagi ei teinud, on nõrk positiivne tõendus, mitte tühi. EIL õpib kokkupõrke vältimine umbes ühe minuti eksperdi juhtimisest.

Roboti käsi töötavate ruumiga kaamerad positsioneeritud andmete kogumiseks järelevalvega poliitika rullimise ajal
Inimese väravaga ring on tavaline järeldusseisund koos salvestiga. Raamid, millele operaator sõitis, on märgitud; ülejäänud jääb selleks, mis see oli.

Variandid kõrvuti

MeetodKes värava avabSignaalSaadavalolekTeatatud
DAgger (Ross et al., 2011)Keegi — õppija alati sõidabPuudub; ekspert silditab iga külastatud riikiEkspert võib silditada väljaspool poliitikale riike, ilma kontrolli all olematagiKahetsuseta vähendamine garantiidega õppija olekujaotuse alusel
HG-DAgger (Kelly et al., 2019)Inimese järelevalvijaJärelevalvija otsustus, et riik on ohtlikKeegi jälgib ja juhtimise puhas üleminekAliseldab DAgger ja käitumise kloonimine simuleeritud ja pärisel sõidu ülesande puhul; õpib ka riskläve
SafeDAgger (Zhang & Cho, 2016)RobotBinaarne klassifikaator L2 kõrvalekaldumiseks võrdluspoliitikast üle tauPääritav võrdluspoliitika klassifikaatori siltide jaoksVähem võrdluspäringuid auto võidusõidu simulaatoris, kiirem konvergentsus (arvut pole antud)
EnsembleDAgger (Menda et al., 2019)RobotKomplekti dispersioon ja kaugus eksperdi tegevusest, mõlemad lävest allVõrgud komplekt pluss eksperdi tegevus iga sammu puhulParanenud ohutus ja õpe pendli ja HalfCheetah puhul
LazyDAgger (Hoque et al., 2021)Robot, hüstereeegaSafeDAgger signaal eraldi sisene ja väljumise lävegaMida SafeDAgger vajab, pluss teine lävi häälestamiseks~60% vähem konteksti lülitust 3 ülesande puhul; 60% kõrgem eduasus YuMi kangal
ThriftyDAgger (Hoque et al., 2021)Robot, eelarvesUudsus, või hinnatav risk ülesande lõpetamata jättesÕpitud riskihinnang ja teatavas sekkumise eelarve100% eduasus jooksutamisajal; kasutaja uuring (N=10): 58% ja 80% kohanemised järgmise parima vastu
EIL (Spencer et al., 2020)Inimene — sekkumiseta ka loebSekkumine ja selle puudumine piiranguna väärtuse funktsioonilVõrgujuhtimine ilma kahetsuseta väärtuse piiranguleKokkupõrke vältimine umbes ühe minuti eksperdi juhtimisest

Mida iga värava ostab, ja mida see maksab

Loe "vajadused" veergu alla ja muster langeb välja: iga roboti värava signaal seal on pealekujutus, mida tuleb valmistada, ja igal pealekujutusel on oma arve.

  • Kõrvalekalde signaalid (SafeDAgger, LazyDAgger, poole EnsembleDAgger reeglist) vajavad võrdluspoliitika. Kas teil on skripteeritud ekspert, sel juhul on huvitav probleem juba lahendatud, või inimene hoiab tegevusi taustale toodetud nii, et kaugus saab arvutatud.
  • Kahtluse signaalid vajavad kalibreeritud epistemilist ebakindlust. Väikeste juhtimise võrkude komplekt seda ligikaudselt; kolme miljardi parametri suuruse nägemise-keele-tegevuse mudeli komplekt on mälu ja latentsuse probleem esimese ees.
  • Uudsus ja riskisignaalid vajavad õpitud hindajat ülesande lõpetamisest, sobitud piisavalt edukatel ja ebaõnnestunud rullil. Ülesande puhul, millega te veel tööd teete, need andmed esimesel ringil pole olemas.
  • Inimese värava vajab tähelepanu ja midagi muud — ainus signaal, mis on esimesel päeval saadavalolek, mis tahes poliitika arhitektuuri puhul, lisa mudeli treenimiseta.
  • Ükski roboti värava eemaldab inimese ruumist. Nad vähendavad, kui sageli inimene peab tegutsema, mitte kas ta peab olema.

On vaikimisi erinevus selles, mida värava toodab. Robot värava lähtetulemus keskel trajektoori käijale inimesele liikumisarm suvalisel asendil. Inimese värava laseb operaatoril valida hetk — pärast jõudmist, enne haaramist, mitte keskel kõike. Taastumise segmendid kahest ei ole võrdse puhtusega, ja need segmendid on ümmaringu kogu toode.

Miks human-gated vorm võidab päris riistvaral

See on insenertehnikaline argument, mitte võrdlusaluse tulemus — pole paberit, mille me leidsime, käivitab kõik viis värava samal manipulaatoril sama poliitika klassiga. See toetub neljale punktile.

Esiteks, järelevalvija on niikuinii olemas. Keegi ei jää SO-100 käsi käitamisele teadmatult esemete kõrval, mida see saab ümber lükata. Kui keegi jälgib, siis sisenemisvõimaluse maksumus väravale on nullilähedane; kalibreeritud riskihinnanguga on projekt.

Teiseks, määrus, mida te tegelikult mõõta saate modernsele poliitikale, on sageli vale kogus. Difusiooni või vooluga sobitamise pea tekitab variatiivsust proovitud tegevuste kogumites, ja see variatsioon peegeldab mitmeotsasid, millele pea treeniti, mitte epistemilist ignorantsi riigi kohta. EnsembleDAgger kahtelu termin kasutab komplekti täpselt viimase jäädvustamiseks. Kaks näevad välja sama number ja pole; tegevuse kogumisele ja voolavastamine kirjed katavad, kuidas need head tegevusi esimese kohaga annavad.

Kolmandaks, tõrked, mis manipulatsiooni puhul loevad, on sageli semantiline, mitte statistiliselt ebatavaline. Poliitika sulgeb haarajat kaks sentimeetrit varem, või jõuab usaldusväärselt kahe identse kuubi vale puhul, pole kõrge dispersioonse riigis — see on usaldusväärselt vale. Ükski dispersioon lävi ei pea seda; inimene vaadates püüab selle kohe.

Neljandaks, sildi kvaliteet — originaal HG-DAgger punkt ja see, mida kõige tavalisemalt vahele jäetakse. Sildid kogutud, kui inimene on juhtimise katkestamatult, ületavad sildid narratiseeritud liikuva süsteemi üle. Kui eesmärk on korrakskipanev andmed, mis on väärt agregatsiooni, kohustus tõend asub automatiseeritud väravaga.

Kus roboti väravad maksavad välja

Pilt muutub, kui üks järelevalvija on vastutuvas paljude robotite puhul — režiim ThriftyDAgger kasutaja uuring ja Fleet-DAgger formsaliseerida sihtmärk. Laevaga, inimese tähelepanu on piisav ressurss ja ebatäiuslik jaotus alistab puudust. Ühe käega ühe laua peal te pole selles režiimis.

Inimese väravaga silmus, juba juhtmestikud

Ülevõtmine käivitamisel järelduses seanss, per-raam sekkumise lipud parandatud segmendid, koondava iga käigu korrektuuridesse või hindamisesse, koostava segateatmete andmekogumi allikaist, mille teie valite, ja jätkates koolitamist olemasolevatest kontrollpunktist on ehitatud, mitte käsitsi skriptidega. Ülevõtmine töötab juhtiva käega, või klaviatuuri ja liugurdiga, kui teil üks ole.

Vaata, kuidas DAgger silmus käivitub

Värava pool meetodit; andmete käitlemine on teine pool

Värav otsustab, millised raamid inimene sõitis, mitte mida nendega teha, ja teine otsus on kus ringid on kõige tavalisemalt raisatud. Esimene reegel on see, mida D DAggeris seisab: koguge, ärge asenda. Peene häälestusest kontrollpunkt puhtalt mõne saja parandav raamdil annab teile mudeli, mis on näinud peaaegu midagi peale taastumiste ja unustanud nimerolli trajektoori.

Teine reegel on see, et sekkumise raamid pole tavalisad raamid. Mandlekar et al. ehitas kaugteleoperation süsteemi 6-DoF manipulatsiooni jaoks, mis laseb operaatoritel jälgida poliitikaid ja üle võtta rikistumisel, siis koolitatud iteratiivselt algoritmiga, mis "julgustab poliitikale õppida, kuidas läbida pullid interventsioonide kaudu"; agendid, kes on koolitatud nendel andmeil, ületasid agendid, kes on koolitatud võrdse ordinaarsete demonstratsiooni arvuga. Sirius surub idee juurutamisesse, "kaalumine treeningproovid ligikaudse inimese usaldusväärsusega ja optimeerides poliitikad kaalutud käitumusega klooniminega". Mõlemad vajavad per-raam markerit, mis oli inimese sõitja, mille tõttu sekkumise lipp loeb rohkem kui see näeb.

Kolmas reegel on see, et automaatne segamine on ansaks. Koostatud andmekogum, mille allikaid te ei saa loetelu, on see, mida te ei saa siluda, kui järgmine ring halveneb. Sel platvormil on koostepaste otsene selle tõttu — algne andmekogum pluss parandused, episoodi valik allika kaupa, ja tulemus on tavaline LeRobot andmekogum mis sünkib ja treenib nagu iga teine; andmekogumi dokumentatsioon katab vormi poole.

Samm ringisMida ta toodabKõige tavalisem viis, kuidas see valesti läheb
Käivita järelduslus salvestamise pealeKäik poliitika enda olekujaotuse allSalvestatud kui lihtne teleoperation, kaotades, et poliitika sõitis
Üle võtmine rikistumiselParandus segmendid per-raam sekkumise lipugaKosmetiline võnkumine korrigeerimine, siis stiil õppimine taastumise asemel
Koonda iga episoodParandused, hindamine, või jäta vaheleKõigi hoidmine; halvad ülevõtmine maksavad rohkem kui episood oli väärt
Sünkroonige parandusedAndmekogum versioonid algse kõrvalParandused, mis kunagi ei lahku kohalikult masina
Koosta segaandmekogumAlgne pluss parandused, otsese valikVaikimisi autosegamine, nii et hilisem regressioon ei saa jäljenda allikale
Jätkake kontrollpunktiKontrollpunkt lähtestatud eelmisestOodates optimeerija taastamist; kaalu lähtestada mudel, mitte taastada optimeerija olek

Seadke värava inimene tegelikult saab hoida

"Inimene otsustab" pole spetsifikatsioon. Kaks operaatorit erinevate lävega toodavad võrreldamatud ringid, ja triivuv lävi tekitab trendi, mida te ei saa lugeda. Kirjutage käivitajad alla enne esimest käiku.

  1. Nime tingimused, mis värava avamise — jõudmine väljast rohkem kui fikseeritud serva võrra, haaraj sulgumine miski peale, liigese triiv piiri suunas, seisak rohkem kui sekundit või kahte — ja hoida loetelu muutumatuna ringile.
  2. Nime mis ei ava seda. Ületamine poliitika taastub iseenda pealt on treeningandmed; ülevõtmine seal kustutab taastumise, mille ta juba teab.
  3. Üle võtmine piisavalt vara puhta käepärase jaoks, käepärast varast nii rutakalt nagu olek on taastane.
  4. Logi, miks sa võtsid üle, episoodi kaupa. Kolm ringi hiljem on ainus kirje, kas sama tõrge naaseb.
  5. Hoia kaamerad, ülesande teksti ja operaator paigas ringidel. Muuda ühte ja numbrid lakkavad olemast võrreldavad.

Mehaaniliselt käepäraste kahel variandil. Juhtiva käega, juht peab jõudma järgi kaasajale praegusele asendile enne pöördemomendi üleandmist, või käsi hüppab; see joondamise liigutus on kõige vähem testitud ahelaosa päris riistvaral. Ilma juhtiva käeta on käepärast käsitsi esimest vajutust alates: järgi peetakse ja operaator nuudeldab ühes liiges klaviatuurist või lohistab liugurdeid, serveri poole klambitega hoida iga sisend väike — paar kraadi iga klahvivajutuse kohta, käppa liugureid värskendamise kohta, sest suur samm heldisse asendisse on kuidas te rebite servoj. Samm-sammulise versiooni klahvikombinatsiooni on läbiminek DAgger ringust SO-100 puhul; taust mõlemale teleoperation režiimidel on teleoperation dokumentid ja juht-järge kirje.

Toetatud poliitika arhitektuuride võrdlus nende koolitamis- ja järeldusomaduste koos
Värav on arhitektuuri-agnostik. Milline poliitika te parandaks, muudaks käepärase maksumus, mitte kuidas käepäraste töötab.

Lugemine, kas värava tegi midagi

Inimese väravaga ringi meetrike on sekkumise määr: sekkumise raamid jagatuna käigu raamidega. Sellel on üks töökoht — kui see ei lange ringidele, ring ei ostnud midagi, ja järgmine peaks muutma midagi muud kui andmete kogust.

See on kallutatev meetrika ja te peaksite teadma kuidas. See mõõdab operaatori läve nii palju kui poliitika võimelisust, mille tõttu läve loetelu hoib fikseeritud; operaator, kes lõdvestab seansi jooksul tekitab langevat kõverat nulliga taga. See ka ignoreerib raskust — kümme raamid kokkupõrke peatamiseks ja kümme nuudeldava haardi näevad identsed. Paar seda fikseeritud hindamise komplektiga ühtegi parandus andmeid kunagi tõmmata. Artikkel DAgger silmuse mõõtmisest töötab hindamise kujunduse kaudu, kaasa arvatud kuidas hindamise episoodid hoida välja koolitamise segus.

Inimese värava, ausalt
Mida ta annab
  • Töötab päeval üks, poliitika arhitektuuridel, pole ekstra mudeli häälestamiseks
  • Jäädvustab usaldusväärselt-vale tõrked, millest dispersioon lävi peal ei püüa
  • Toodab parandused salvestatud ajal operaator oli täielik juhtimine, hetkel nad valisid
  • Annab per-raam markeri, et sekkumise kaalutud meetodid nagu IWR ja Sirius tarbivad
Mida ta ei tee
  • Maksab pidevat järelevalvet; see ei skaleedu ühele inimesele ja paljudele robotitele
  • Sõltub operaatori järjepidevusest — triivuv lävi kahjustab sekkumise määra
  • Toodab riskimudelit iseenda poolt; HG-DAgger õpitud lävi ja ThriftyDAgger hindaja on ekstra masinad
  • Arvestab raamid, mitte tagajärgi
  • Ei saa päästa poliitika, mille tõrge on juhtimise ülalpool, nagu vahetatud kaamera või valesti märgend ülesande string

Avatud küsimused tasub nähtavuses hoida

Võrdlusalused on nõrgad. Spenceri ja kolleegid uurisid neid, mida kasutatakse jäljendusõppe lähenemiste testimiseks ja leidsid neid "realiseeritav ja lihtne ja seega ebapiisav raskematest režiimidest vea liitumise jäädvustamiseks reaalmaailma otsuste tegemise probleemides" — ja ümbritsevat kirjandust vastaselt leidsid lihtsa käitumise kloonimine tegi hästi. See on põhjus skeptitseerile mis tahes DAgger varianti järjestuses, puhkavatel nendel ülesandel, kaasa arvatud mõned numbrid tabelis eespool.

Roboti väravad suurte poliitikate pole lahendatud kas. AIM töö asendab ebakindluse asendaja Q-funktsiooniga imitatsioon inimese sekkumise reegel ja teatab 40% parandust puhkavast maksumuses ja õppe tõhususes üle ThriftyDAgger — pideval ja diskreetsel juhtimises, mitte nägemise-keele-tegevuse mudelil käija manipulaatorist. Kas ükski neid värava ülekanded peenemalt VLA-le on avatud. Uuring teeb seotud punkti: välja terminoloogia ja struktuur pole ühendatud kirjanduse lõikes, mis teeb meetodid raske võrrelda. Teie enda käel, teie logid on tõendid, mis teil on.

Kas HG-DAgger tegelikult DAgger, kui inimene ainult sildib sekkumiste ajal?

See hoiab osa, mida loeb — andmed kogutud allika jaotuse all õppija indutseerib, agregeeritud sellega, mis tuli enne — ja langeb osa, mis ei jää ellu kontakti võtmisega riistvarast. Kelly et al. esita seda variatsioonina; 2011 kahetsuseta garantii ei kandida üle muutumatult.

Kas saan kasutada roboti värava peenemalt VLA poliitika SO-100 peal?

Mitte sirgjooneliselt. SafeDAgger klassifikaator vajab pääritavat võrdluspoliitika teil pole. EnsembleDAgger vajab komplekti, mis multi-miljardi-parameeter mudeli tähendab mitme koopia mälus pluss nende järeldus maksumus. ThriftyDAgger vajab riskihinnajat sobitud edudel ja tõrgete, mida pole enne teie esimest ringid.

Kui kaua peaks ühe käepärase olema?

Piisavalt jõudmiseks riigis poliitika saab jätka, ja mitte rohkem: pikenenud käepäraseid muuta käigud demonstratsioon seanss ja üleujutuse parandus komplekti nimerolli käitumise. LazyDAgger leid lõikab teise viisi ka — paljud väga lühikesed lülitused on oma maksumus.

Kas ma peaksin koolitust ainult parandus segmendid?

Ei — see on kõige tavalisem viis raisata ring. Mudel peenemalt ainult taastumiste on näinud peaaegu midagi peale taastumiste. Segusegage parandused algse andmekogumiga allikatest valitud otseselt; minna kaugemal, otsida sekkumise kaalutud lähenemisi nagu IWR või Sirius, mis üles-kaal inimese sõitja raamid, mitte eraldamine neid.

Mida kui sekkumise määr ei lange pärast ringi?

Võta see näo väärtusel: ring ei aidanud. Enne parandusi lisamine, kontrolli odavamad selgitused — operaator läve triiv, parandused kosmeelised, segaandmekogum tegelikult sisaldasid, treeningu algatanud sooviitud kontrollpunkt. Ring, mis vaikselt alustas algsest mudelist näeb täpselt nagu ring, mis ei õppinud.

Kas sekkumiseta kanna teabes?

Eksperdi sekkumise õpe alusel, jah: venid kus järelevalvija jälgis ja ei toiminud on loetud nõrk tõendus, et olek ja tegevus olid vastuvõetav, formaleeritud piiranguna väärtuse funktsioonil. Kõige praktiline torujuhtmed, kaasa arvatud see, märk ainult mida inimene sõitis.

Ühe käe jaoks laua peal valik on tehtud: hoida värava ise, kirjutada alla, millal see avaneb, ja kulu jõupingutus andmete käitlemisel taga seda, mitte automatiseerida lüliti. Platvorm pool on kirjeldatud DAgger silmuse leht, koolitamise valikud poliitika pere all koolitamine ja hinnad. Taustall, alusta jäljendusõpe ja jäljendusõpe SO-100 peal; esimese käigu jaoks, käivita esimene poliitika on lühem tee.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started