
Intervention rate - intervention kaadrite jagamine käigu kaadrite arvuga - on kõige odavam aus edusingnal, mis inimese valvega DAgger-silmusal on. See artikkel määrab selle nii, et kaks inimest arvutavad sama väärtuse, näitab, kuidas seda logida, ja käib läbi nelja viisiga, kuidas see sind petab: operaatori harjumus, triiv hindamise seadistuses, treenimine ainult paranduste põhjal ja inimene, kes korrigeerib kolmapäeval teisiti kui esmaspäeval.
DAgger-ring tundub produktiivne, kui sa selles oled. Sa juhtid poliitikaga, võtad üle, kui ta haardumist eksib, salvestad parandused, treenid uuesti ja järgmine käik näeb välja - sa annaksid sellele vandeid - veidi sujuvam. Kaks ringi hiljem ei saa sa öelda, kas midagi muutus, sest "veidi sujuvam" ei ole suurus.
Silmusal on vaja ühte numbrit ringi kohta, ja inimese valvega silmusal on see arv peaaegu tasuta: käigu osa, mil sul oli kontroll poliitika asemel. See artikkel määrab selle nii, et kaks inimest arvutavad sama väärtuse, logib selle, loeb saadud kõverat ja nimetab neli viisi, kuidas see sind petab, kui see seisab omaette. Teooria kohta, mida see tekst eeldab, vt DAgger-selgitus ja inimese valvega variant; praktilise vastekaaluks on DAgger-silmuse käitamine SO-100-l.
Lühiversioon
- •Intervention rate = intervention kaadrid / käigu kaadrid. Kaadrid, mitte episoodid, ja nimetaja sisaldab kaadrid, mida kasutasid parandamiseks.
- •Kõver kolme ringi jooksul tähendab, et ringid ei tee tööd - muuda segust, kontrollpunktist või ülesandest, mitte neljanda kogumine.
- •Langev intervention rate ei ole tõusev eduprotsent. Sinu lävend astumiseks kaldub allapoole, kui usaldus kasvab.
- •Ilma külmutatud hindamise protokollita - samad algpooosad, objektid, kaamerad, katsete arv - mõõdad sa ruumi.
- •Treenimine ainult paranduste põhjal kallutab olekujaotust. IWR-i vastus: joonista intervention ja mittesekkertsiooni valimid võrdsetes osades.
Miks ringil üldse arv on vaja
DAgger on olemas jaotusprobleemi tõttu ja jaotusprobleemid on silmale nähtamatud. Ross ja Bagnell näitasid, et immitatsiooni õppimine fikseeritud demokomplekti põhjal viib kuhjuvate vigadeni ja kahetsemise seosega, mis kasvab kvadraatiliselt aja horisondil: kui õppija lahkub olekutest, mida demonstraator külastas, ei ütle andmetes midagi, kuidas jälle tagasi tulla. DAgger parandab seda itereerimisega - käita poliitika, sildista olekud, mis ta külastab, agregeerimata, treenimata uuesti - mida Ross, Gordon ja Bagnell raamisena kaaderdavad mittekaotuste võrgutamiseks.
Sellel raamistikul on tagajärg, mille inimesed jätavad vahele. Garantii puudutab poliitikate jada üle iteratsioonide, mitte ühtegi üksikut käiku. See ei ütle midagi selle kohta, kas sinu ring kolm aitas. Ainus viis teada saada on mõõta iga iteratsiooni. Kelly ja kolleegid tutvustasid HG-DAggerit, sest klassikaline DAgger küsib eksperdilt tegevuse märgistuse ajal, mil noovik on veel kontrollis, mida artikkel väidab võib ohutust vähendada ja inimese ekspertide korral halvendada märgistuse kvaliteeti tajutava aktuaatori viivituse kaudu. HG-DAgger õpib ka turvanivoo mudeliga ebakindluse riskimeetrika jaoks ja teatab parandatud jõudlusest nii DAggerite kui ka käitumiskloonimise üle juhtimisülesandel. See ei avalda sekkutuste arve; need toodate ise.
Määratlus nii, et kaks inimest saavad sama numbri
Määratlete on üks rida: intervention kaadrid jagatuna käigu kaadritega. Kõik raske peitub selles, mis loeb kaadrina ja mis loeb käiguna.
Kaadrid, mitte episoodid
Episoodide loendamine vähemalt ühe sekkumisega on kasutud: kümme episoodi ühe põusega ja kümme, mille juhtisid kaheksakümne protsenti mõlemad annavad "10/10". Kaadrite loendus eraldab need ja see on granulaarasus, mis salvestis juba omab - LeRobot andmestiku vormingus iga ajahetk on rida, seega intervention lipp on üks boole'i veerg otsast ja tegevusest kõrval. Siin kirjutatakse kaadri kaupa sekkumise algusest ja kustutatakse, kui kontroll naaseb.
Nimetaja sisaldab parandusi
Kaks nimetajat on kaitstav - käigu kokku kaadrid või kaadrid, mida poliitika juhtis autonoomselt - ja nad lahknevad halvasti kõrgel sekkumise tasandil. Võta üle 400 1000 kaadrist ja esimene annab 40 protsenti, teine 67 protsenti. Ühe ringi võrdlemine mõõdetud esimese viisiga järgmisega mõõdetud teise viisiga on kuidas tõeline parandus kaob. Võta kokku kaadrid ja ära pöördu kunagi valikust seeria kestel tagasi.
Otsusta korraga, mis juhtub käepigistuse kaadritega
Alati on õmblus. Kui kontroll läheb üle, kuuluvad mõned kaadrid kummalegi poolele: käsi hoitakse, juht joondab, salvestis külmutab. Selles torujuhtmes jäävad käepigistuse kaadrid töötlemata voogu ja kunagi ei sisenege kureeritud episoodi - nad ei ole poliitika käitumus ega parandus, väärt treening. Loenda õmblus sama viisiga iga ringi kohta: 30 Hz-l kuus üleandmist kahe sekundi õmblus igaüks on 360 kaadrit, piisavalt liigutamaks protsendipunkti.
Kaadrid või episoodid; käik kokku või autonoomne; käepigistuse kaadrid sisse või välja. Mistahes kolmest muutustest vaikselt ringide vahel teeb kõvera mõtetuseks. Kirjuta kõik kolm üles.
Logides nii, et number elab seansi üle
Mõõdik käivitava protsessi olekupaneelil on lugemine: see kaob taaskäivitamisel ja ei saa joonistada. Üks järjestikusrida ühe käigu jaoks katab kogu seeria - sh milline kontrollpunkt sa juhtisid, kuna see muutub iga ringi ja segada neid anuulleerib, mis järgneb.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Kaks välja kannavad kaalu. train_mix on see, mille andsid järgmisele treenimistööle; ilma selleta ei saa midagi seostada. eval_protocol nimetab fikseeritud testi, mis sa seejärel juhtis, ja on väli, mis kõige sagedamini jäetakse tühjaks. Ay-robots kokapkis teatab ülevõtu staatus sekkumise kaadrite arvust tegemise seansi jaoks, seega logimine on pigem ülekirjutamine kui instrumenteerimine; andmestiku dokumentatsioon katab, kuhu kaadri kaupa veerud maanduvad.

Kõvera lugemine: kolm ringi, üks otsus
Kolm ringi on miinimum lugemiseks, sest kaks punkti on alati joon. Allpool olev tabel on raamatupidamismall kohahoidjaarvudega, mitte mõõtmised mis tahes käigust. Otsite monotoonset langust, mida tasakaalustab edu fikseeritud testis.
| Ring | Kontrollpunkt juhtis | Kaadrid | Intervention kaadrid | Määr | Edukad (20-st) |
|---|---|---|---|---|---|
| 0 (algjoon) | baaspoliitika | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | ringi 0 segunud | 5 610 | 980 | 17,5 % | 10 |
| 2 | ringi 1 segunud | 5 412 | 611 | 11,3 % | 11 |
| 3 | ringi 2 segunud | 5 380 | 598 | 11,1 % | 12 |
Ringid üks ja kaks teevad tööd. Ring kolm ei tee: 11,3 ja 11,1 protsenti on füüsilise käe käitamise käikude vahelise variatsiooni piires ja neljanda ringi sama paranduste kogumisega veedetakse pärastlõuna millekski. Tasane segment ütleb muuta midagi struktuurset.
- Ülejäänud ebaõnnestumised ei ole teleoperation parandatavad - objekt ulatus väljaspool, haardur geomeetria, liigend selle piirini. Ükski paranduse andmed ei paranda kinemaatilist seina.
- Parandused on liiga väikesed võrreldes baasi andmestikuga gradiendi liigutamiseks ja midagi kaaluda neid.
- Parandused vastuolus üksteisega, seega poliitika keskmistab kaks strateegiat ja maandub nende vahele.
- Ebaõnnestumise päritolu on ülavoolu: kaamera liikus, valgustus muutus, käepaelane vaade ei vasta enam treeningule.
- Ülesanne on selle poliitika klassi lae sellel riistvara, ja järgmine samm on rohkem baas andmed.
Viimased kaks ei ole silmuse ebaõnnestumised. Sirius-laivastus on inimese vajaduse vähenemine kavandatud tulemus: kui roboti autonoomia pareneb, kohanevad selle anomaaliate ennustajad oma ennustuskriteeriume muutustega, mis viivad vähem palju taotlusi inimese sekkumise jaoks ja järk-järgult väheneb inimese töökoormust aja jooksul. Seal kohaneb kriteerium kavatsusest. Käsitsi silmusal kohaneb sinu ka, vaikselt - seega määr, mis lamandab, sest ülesanne on selle poliitika klassi laes, näeb välja täpselt nagu üks, mis lamandub, sest operaator lõpetas märkamise. Milline on järgmine probleem.
Lõksu 1: langev määr ei ole tõusev eduprotsent
Intervention määr mõõdab täpselt üht asja: kui palju käigust sa otsustasin omada. See otsus on sinu oma, tehtud reaalajas, ja see liigub. Ringi nullis võtad üle esimese halva lähenemise nurga; ringi kolm oled sa vaadanud poliitika toibumist tosina sellest ja lasid tal proovida. Sinu lävi liikus; poliitika ei pruugi. Määr langeb kummasti.
Inimese usk on vähemalt modelleeritud suurus kirjanduses, mitte eeldatud konstant. Sirius uuesti kaalub treening valimid ligikaudse inimese usaldusega ja optimeerib poliitika kaalutud käitumise kloonimisega, teatades 8 protsentilise tõusu simulatsioonis ja 27 protsenti reaalsete riistvara valdkonnas praeguse kunsti poliitika edukamääral, kahel konvergentsikiirusel. See käsitleb usaldust kui kaalu andmetel. See ei korrigeerida teie pea lävend ringi null ja ring kolm vahel.
Sa ei saa eemaldada triivi, seega paarita määr millegi oma lävend ei saa puudutada: fikseeritud valiku proove, milles sa ei sekkumata, hindatud kriteeriumi vastu kirjutatuna enne ringi. Määr, mis langeb, kui paaritud eduprotsent jääb paigale, on habitatsiooni allkiri - väärt tabamist, sest seestpoolt silmuse tundub see edenemiselt.
| Intervention määr | Eduprotsent fikseeritud protokollis | Kõige tõenäolisem lugemine |
|---|---|---|
| langeb | tõuseb | Ring töötas. Jätka. |
| langeb | lamane | Sinu lävi triivid, või parandused eemaldas jõupingutus ilma vigade eemaldamiseta. |
| langeb | langeb | Parandused halvendavad poliitikale. Kontrolli segust ja nende sisemist järjekindlust. |
| lamane | lamane | Ring ei ostnud midagi. Muuda segu, kontrollpunkti või ülesannet enne rohkem kogumist. |
| tõuseb | langeb | Taandumine. Kahtlusta treening segu, muutunud kaamerat või kontrollpunkti segu muudatust enne kui meetodit kahtlustad. |
Lõksu 2: ilma fikseeritud protokollita, mõõdad sa ruumi
Päris roboti hindamine on kallis ja raske korrata. SIMPLER autorid motiveerivad simuleeritud hindamist vaatluse tõega, et selliste poliitikate päris-maailma hindamine ei ole skaleeritav ja silmitsi tulemuste paljunemise probleemidega, mis halveneb, kui poliitikad laienevad oma ülesannete spektrile. RoboArena rünnakud sellest teisest küljest üle kuuega kümnega paarses päris roboti hindamise episoodis seitsmea üldise poliitika jooksul, mis teostavad seitsme akadeemilise asutuse hindajad DROID platvormil. Selle hindajad valivad oma ülesanded ja keskkonna, kuid peavad hindama poliitika paare kaheksindselt; artikkel teeb teatavaks, et see rahva asemel autonoomselt paremate üldiste poliitikate jõudlusena rangemate poliitikate jõudlusena kui tavapärane tsentraliseeritud hindamine.
Sa ei käita 600 paarset episoodi ühel SO-100 töötoas. Mida sa saad teha on eemaldada dispersioon, mida sa kontrolli - piisavalt igav nimekiri, et see tavaliselt jäetakse vahele.
| Mõõde | Külmuta see | Mida triivid, kui sa ei tee |
|---|---|---|
| Alusta poos | Kirjutatud kodunurk, juhtis enne iga katset | Trajektoor algab jaotusest väljaspool |
| Objektid | Lindistatud märgid ja samad füüsilised objektid hindamiseks reserveeritud | "Parem" poliitika on tõesti lähedasem objekt |
| Kaamerad ja valgus | Samad paigutused, indeksid, eksponeerimine; ruudud suletud; fotojoonis seadistus | Vahetatud kaamera indeksid üksinda võivad domineerida tulemusele |
| Katsed ja peatamise reegel | Fikseeritud n, fikseeritud aeg, kriteerium kirjutatuna enne ringi | Ajajärgse kriteerium pöörduvad peaaegu tabamused millekski, mida sa vajad |
| Operaatori käitumine | Sekkumisi hindamiskatsetähe ajal | Hindamine muutub teiseks paranduse seansiks |
Seejärel aritmeetika, armetu katseteta arv töötube võib endale lubada. Normaalse ligikaudse all on 60 protsenti edu üle 20 katse kanab standardviga lähedal üksteist protsendipunkti - ruutjuur 0,6 kord 0,4 üle 20 - ja erinevus kahe sellise ringi vahel kanab umbes 15. Hüpe 60-st 70 protsendile on seega vastuolu millega midagi ei juhtunud. Viiskümmend katset kannavad numbri ringi umbes seitse punkti ja maksavad õhtul.
See asümmeetria on argument määra sekkumiseks: arvutatud üle tuhandete kaadrite mitte kahekümne binaarse tulemuse, liigub see varasemalt ja sujuvamalt. Hoiatus on, et episoodi raames olevad kaadrid on raskelt korreleeritud - üks halb haardumise tuhandveerand järjestikused sekkumise kaadrid - nii efektiivne valimi suurus on lähedasem üleandmiste arvule. Käsitlets määra varase indikaatorina ja edukuse määr aeglase maapinna tõena.
Hindamise episoode ei tohi kunagi sisestada koos treenimise andmestikku - muidu ring n+1 joonistatakse andmete vastu, mida ta treeniti ja kõver mõõdab memoreerimine.
Lõksu 3: treenimine ainult paranduste põhjal painutab poliitikale
Parandused on huvitavad andmed, nii et instinkt on neile koolitada. Ära tee seda. Nad tulevad ehituse tõttu olekuruumi kitsast lõigust, kus poliitika juba nurjus ja räägivad peaaegu midagi käigu enamiku kohta, mis töötas. Häälestada ainult sellisel slaidil ja sa saad poliitika head taastumise halvast lähenemisest, mis on unustanud kuidas teha puhtait. Mandlekar ja kolleegid ehitasid oma kaug sekkumise süsteem selle ümber. Nende raamistik: manipuleerimise ülesanded sisaldavad kitsaskohti, mis nõuavad täpse tegevuse jada - pod kohvmasinasse sisestamine on nende näide - kus väikesed kõrvalekalded viivad olekutesse demonstratsioonid kunagi ei katnud. Nende algoritm treenib iteratiivselt uue andmete kohta nii poliitika õpib läbida need kitsaskohad, ja nad teatavad, et agendid koolitatud sekkumise andmetel alistub agendid treenitud samaväärsete valimite arvule mittesekkertsiooni demonstraatoreist.
Paranduse-ainult häälestamine versus koostatud segu
- Sihtotstarbeline: gradient domineeritakse olekutest, mida sa hoolitset
- Odav testimiseks, kas paranduse stiil on õpitav üldse
- Häälestamine jaotus ei tundu enam ülesandejaotusele
- Nominaalne käitumine võib halveneda nähtavalt ühe ringi jooksul
- Määr võib langeda, kui edu langeb sellega - puhtad segmendid kaupitakse taastumisega
- Segamise suhe on hüperparameeter ja väärib üles kirjutatavat. Järgmise andmestiku koostamine on kus see otsustatud: algne demonstratsioon pluss paranduse komplekt, episoodi valik allikas pigem kui reegel, mis vaikselt tõmbab mis tahes saadaolevad. Siin see on üks koostamise samm kokapkis, ja tulemus on tavapärane andmestik - vt
treening dokumentatsioon. Mida ükski tööriist ei tee teile on salvestada milline suhe tootis milline kõver.Lõksu 4: inimene ei ole järjekindel ekspert
DAggerite teooria eeldab eksperti. Sa ei ole üht tehnilises mõttes: sinu parandused ei ole valimid fikseeritud tingimuslikust jaotusest tegude üle. ACT autorid nimetavad seda, kui loetlevad takistused häppemanipu manipulatsioonile - vead liituvad aja jooksul ja inimese demonstratsioonid võivad olla mittestatsionaarne. Nende süsteem jõuab siiani kaheksakümmend kuni üheksakümmend protsenti edu kuue päris ülesande kohta kümnen minuti demonstratsioonist, nii et probleem on lahendatav, mitte puudu.
Robomimic uuringu teeb punkti andmete küljelt. Kuue ühendamata algoritmiga viiel simuleeritud ja kolmel tegelikus maailma mitmeetapilise ülesandel on selle õppetunnid järgmised: tundlikkus disainivalikutele, sõltuvus demonstratsiooni kvaliteedist ja - üks, mis siin teeb kõige rohkem haiget - muutlikkus lõppukriteeriumide tõttu, sest treening ja hindamise eesmärgid erinevad. Madalaima kaotusega kontrollpunkt ei ole usaldusväärselt kõrgeima edukuse määraga.
On riistvara versioon sellest: sisendtüüp kujundab paranduse. A
Robomimic uuringu teeb punkti andmete küljelt. Kuue ühendamata algoritmiga viiel simuleeritud ja kolmel tegelikus maailma mitmeetapilise ülesandel on selle õppetunnid järgmised: tundlikkus disainivalikutele, sõltuvus demonstratsiooni kvaliteedist ja - üks, mis siin teeb kõige rohkem haiget - muutlikkus lõppukriteeriumide tõttu, sest treening ja hindamise eesmärgid erinevad. Madalaima kaotusega kontrollpunkt ei ole usaldusväärselt kõrgeima edukuse määraga.juhi-järgija seadistus toodab pideva, inimeste temboga trajektoorid. Klaviatuuri nudgid on hõlmatud serveri poolt - kaks kraadi käevarreliigestele, neli gripile - nii sama tahtmata saabub trepist väikeseid samme. Liugurid saadavad absoluutsed sihid ja server liigub kõige kuus kraadi nende poole kutsus. Kolm režiimi, kolm tegevuse jaotus; kõik kolm seguneda üks paranduse komplekt ja siis imestus miks lähenemise pöördus twitchy ise tekitatud. teleoperation dokumentatsioon katab mida iga režiim saadab.
Kaaluta sekkumisi: IWR ja mis tuli pärast
Kui parandused on väärt vähemus, järkige parandus on kaal mitte eksklusiivsus. Intervention Weighted Regression on viiterakendus: andmed jaotatakse sekkumis- ja mittesekkertsiooni valimiteks ja kaks partitsiooni valitakse võrdses osades treenimise ajal. Paranduse komplekt, mis on viis protsenti kaadrite siis panustab poole gradiendi ilma nominaalbeetuse katoamiseta jaotus.
Võrdne osakaal on alguspunkt, mitte seadus. Sirius üldistab selle asendades binaarse partitsiooni pideva kaalu lähendatud inimese usaldusest; Sirius laivastus liigutab otsuse upstreamis, kasutades visuaalse maailma mudelit ja anomaaliate ennustajaid otsustamiseks millal inimene on palutud üldse. Ühine lõng: sekkumis lipp on treening signaali, mitte ainult raamatupidamise veerg.
| Meetod | Kes otsustab millal inimene tegutseb | Kuidas sekkumise andmeid kasutatakse | Aruandatud tulemus |
|---|---|---|---|
| DAgger (2011) | Fikseeritud ajakava; ekspert sildid külastatud olekud | Üks kasvav andmestik, kaalumata | Raamisena reduktsioon mittekaotuste võrgutamiseks |
| HG-DAgger (2019) | Inimene valvates kontrolli reaalsüsteemis | Agregeeritud; pluss õpitud turvanivoo mudeli ebakindluse riskimeetrika jaoks | Parem kui DAgger ja BC juhtimisülesandes; sekkutuste arvud ei ole antud |
| IWR (2020) | Inimene teleoperatsiooni kaudu | Sekkumis- ja mittesekkertsiooni valimid võrdses osades | Alistab mittesekkertsiooni demosid võrdse valimi arvule |
| Sirius (2022) | Inimene juurutamise ajal | Kaalutud BC, kaalud ligikaudsest inimese usaldusest | 8% tõus simulatsioonis, 27% reaalsetes riistvaradel; 2x kiirema konvergentsiga |
| ThriftyDAgger (2021) | Süsteem valvates uudsuse ja riski | Interaktiivne kogumine järelevalve eelarve all | Kasutajauuring (N=10): 58% kõrgem inimene ja 80% kõrgem roboti jõudlus kui järgmine parim meetod |
| Fleet-DAgger (2022) | Süsteem eraldava tähelepanu laivastuse jooksul | Laivastuse õppimine hindatud Return on Human Effort põhjal | Kuni 8,8 korda kõrgem ROHE kui alustamine |
| Sirius-laivastus (2024) | Anomaaliate ennustajad isekohastuvate kriteeriumitega | Mitmeülesanneline õppimine visuaalse maailma mudeliga | Vähem sekkumispalveid kui autonoomia paraneb |

Neli mõõdikut on väärt logimist määra kõrval
- Üleandmised käigu kohta. Kakskümmend lühikest parandust ja üks pikk annavad sarnast määra ja kirjeldavad erinevaid poliitikaid - üks trebuient, üks pimepunkt.
- Keskmine sekkumise pikkus. Tõusev pikkus langenud arvule tähendab ülejäänud ebaõnnestumised on rasked, mis on mida viimaist progressi näeb välja.
- Aeg esimeseks sekkumiseks. Poliitika, mis saab kaugemale enne abi vajadust parandab isegi kui kokku määr on lamane.
- Kus sekkumised liituvad. Kastke lipp normaliseeritud episoodi progressiga; stabiilne tipp ringide kaupa osutab ühele kitsaskohale.
Ring protokoll saab tegelikult käitada
Mõõdetud ring on kuus etappi ja toodab ühe rea logis. Esimesed neli on silmus; viimased kaks teevad selle mõõtmiseks.
- 1Külmuta hindamise protokoll enne ring null
Kirjuta üles algasend, objekti paigutus, kaamerad, katste arv, aeg ja edukriteeriumi. Fotojoonis laud. Kui dokument peab muutuma, algab seeria uuesti.
- 2Mõõta algjoon
Käita protokoll ilma sekkumisteta ja salvestada edu; siis käita üks instrumenteeritud seanss käepigistuse lubatud ja salvestada määr. Need kaks numbrit on ring null.
- 3Kogu parandused ühes järjepidevuses stiilis
Üks sisendtüüp ringi kohta, üks operaator kui saad hallata. Võta üle kriteerium, mille saad öelda kõvasti - "grippa rohkem kui kaks sentimeetrit üleandmisel" - ja hoida seda ringi jaoks.
- 4Treieage iga episood sama päev
Parandus, hindamine või hülgamine. Ebaselged episoodid hüljatakse, mitte salvestatakse teooril et rohkem andmeid aitab - parandus, milles sa ise pöödud on halvem kui pole episoodi.
- 5Koostage segu selgesõnaliselt
Algne demonstratsioon pluss parandused, episoodi valik allikas. Salvestage alus loendus, paranduse loendus ja mis tahes kaalut - see on väli, mida tahad kolme nädala pärast.
- 6Jätkake eelnevast kontrollpunktist ja mõõta uuesti
Treenimata koostatud andmestik eelmise kontrollpunkti asemel baasi mudelist, käita külmutatud protokoll pluss üks instrumenteeritud seanss, lisa rida ja võrdle eelmiste kahe ringi vastu.
Kaks piiri muudavad kuidas lugeda nõrga ringi. Jätkamine kontrollpunktist lähtestab kaalud sellest - mitte optimisaatori jätk, seega ajakava algab värskelt ja lühike käik konvergeeritud kontrollpunktist võib liigutada väga vähe. Ja juhi-joonda liikumise algusel käepigistuse on kõige vähem miilide päris riistvara midagi paarist; kui parandused kõik algavad kummalise siirdemehaanika, vaata seal enne segurite süüd.
Mõõdetud silmus juba juhtmestik
ay-robots rakendab neid kuus etappi tootefunktsioone: võta juhi käest käigu ajal juhi käest, klaviatuurist või liuguritest, sekkumise kaadrite automaatselt lipuga; treieage iga episood paranduseks, hindamiseks või hüljamiseks; koostage järgmine andmestik algse demonstratsiooni pluss paranduste põhjal, episoodi valik selgesõnaliselt allikas; ja alusta järgmise treenimisjooksu eelmise kontrollpunktist baasi mudeli asemel.
Näe kuidas DAgger silmus töötabMida numbrid ei saa teile rääkida
Midagi sellest ei lahendata ja hästi kaardistatud kõver ei peaks sind muidu veenduma. Intervention määr mõõdab liigese süsteemi - poliitika, riistvara, operaator, ruum - ja omistab midagi omaette. See ei saa hinnata kas parandused olid head ja see langeb õnnelikult ülesandel, mis muutus kergemaks sest objekt triivid kaks sentimeetrit lähemale kolme nädala jooksul.
Mida ta teeb on pöörda vague muljet veeru, mille vastu saad vaielda. Alternatiiv ei ole parem mõõdik; see on kolme nädala kogumine parandused kõver oleks ütlenud teile pärast ringi kolm peatama. Küsitelu kirjandus määrab interaktiivse immitatsiooni õppimist inimese tagasisidet antud intermitently ajal roboti täitmise lubamine võrgutamiseks parandus käitumine; pere on lai ja pole paigutus sellest töötab ilma numbrita ringi kohta. Vt ka SO-100 immitatsiooni õppimise juhend baasi andmestiku kohta, mida segu vastu poliitika käitamine järeldusmise külg ja DAgger silmuse leht rakendatud torujuhti jaoks.
Kas intervention määr on vaid üks miinus eduprotsent?▾
Ei. Määr mõõdab kui palju käigust sa võtsid üle; eduprotsent mõõdab kas ülesanne sai tehtud ilma sinuta. Käik võib õnnestuda 30 protsendi sekkumise määraga ja käigust ilma sekkumiseta võib täielikult nurjuda. Nad erinevad ka mürast: määr liigub sujuvalt üle tuhandete korreleeritud kaadrite, eduprotsent hüppab binaarsete tulemuste käe vahel. Logimine mõlemat.
Kui palju hindamise katseid mul on vaja edukuse määra jaoks miski tähendada?▾
Rohkem kui tundub mõistlik. Normaalse ligikaudse alt on 20 katset tõel 60 protsendi edukuse määr kanab standardviga lähedal üksteist protsendipunkti, seega 10-punktiline liikumine ringide vahel on eristumatu mürist; 50 katset kannavad see arv ligikaudu seitse. Kui sa ei saa lubada 50, pidage katsetuste arv sama ringide kaupa ja käsitlets väikeste liikumiste inconclusive.
Milline segamise suhe demostratsioonidele parandusi peaks alustama?▾
Dokumenteeritud alguspunkt on IWR: jaotage andmed sekkumis- ja mittesekkertsiooni valimiteks ja tõmmake neid võrdses osades, seega parandused panustada pool gradiendi iga väike fraktsioon kaadrite. Kui teie seadistus ei saa kaalu valimit, ligikaudne selle episoodi arve kaudu andmestik koostamisel ja kirjutage suhe. Treenimine parandusele ainult on valik välistada.
Minu intervention määr tõusis pärast ringi. Kas ring on raisatud?▾
Mitte tingimata, kuid kontrolli igava selgitused esimesed: kas kontrollpunkt juhtisid maatsunud koolitatud, kas kaamera indeks või paigutus muutus, kas objekt paigutus triivid, oli paranduse stiil järjekindel. Kui kõik neli on puhas ja paaritud eduprotsent ka langes, kahtlusta segu - liiga vähe baas demonstratsioonid vastu parandused või parandused, mis vastuolus üksteisega. Tõeline regressioon kuulub logis mitte prügikasti.
Kas ma võin vahele jätta fikseeritud hindamise protokolli ja lihtsalt vaata intervention määr?▾
Ainult kui sa nõustud, et sa ei saa öelda parandus harjumusest. Määr sõltub oma reaalajas lävend astumiseks, ja see lävi langeb saate harjunud poliitika kummused. Külmutatud protokoll on mõõtmise osa oma lävi ei pääse - lindistatud märgid kirjutatud kodunurk, fikseeritud katse arv, kriteerium otsustatud enne ringi. See peab jäätama muutumine seeria kaupa.
Hoia logi hoidlas, mitte märkmikus: ringid on päevad eraldi, riistvara saab taastada ja isik lugemine kõvera oktoobris teie augustis mäluteta. dokumentatsioon FAQ katab tegevuslikul ükskikud välja jäetud siin.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started