
Stopa intervencije - okviri intervencije podeljeni sa okvirima trčanja - je najjeftiniji pošten signal napretka koji ima humano-gated DAgger petlja. Ovaj članak je definiše tako da dva čoveka izračuna istu vrednost, pokazuje kako ga da loguje, i radi kroz četiri načina na koja vas zavodi: navika operatora, drifting evaluacijskih postavki, trening samo na korekcijama, i čovek koji koriguje drugačije u utorak nego u ponedeljak.
DAgger kolo deluje produktivno dok ste u njemu. Vozite politiku, preuzimate je kada se zajeca za hvatač, čuvate korekcije, retrenirate, i sledeće trčanje izgleda - mogu da se zakunem - malo glađe. Dva kola kasnije ne možete da kažete da se nešto promenilo, jer "malo glađe" nije količina.
Petlja treba jedan broj po kolu, i u humano-gated petlji taj broj je skoro besplatan: udio trčanja tokom kojeg ste vi imali kontrolu umesto politike. Ovaj članak je definiše tako da dva čoveka izračuna istu vrednost, loguje je, čita rezultujuću krivu, i imenuje četiri načina na koja vas zavodi kada stoji sama. Za teoriju koju ovaj članak pretpostavlja, vidite DAgger objašnjenje i humano-gated varijantu; praktični parnjak je pokretanje DAgger petlje na SO-100.
Kratka verzija
- •Stopa intervencije = okviri intervencije / okviri trčanja. Okviri, ne episode, i imenilac uključuje okvire koje ste potrošili na korekcije.
- •Ravna kriva tokom tri kola znači da kola ne kupuju ništa - promenite mešavinu, checkpoint ili zadatak umesto prikupljanja četvrtog.
- •Padajuća stopa intervencije nije rastući stopa uspeha. Vaš prag za intervenciju se spušta prema dolje kako raste poverenje.
- •Bez zamrznutog protokola evaluacije - iste početne pozicije, objekti, kamere, broj pokušaja - mersite sobas.
- •Trening samo na korekcijama iskrivljuje raspodelu stanja. IWR odgovor: crtajte intervencijske i ne-intervencijske uzorke u jednakim proporcijama.
Zašto kolo treba broj uopšte
DAgger postoji zbog problema sa distribucijom, a problemi sa distribucijom su nevidljivi oku. Ross i Bagnell su pokazali da učenje imitacijom na fiksnom skupu demonstracija vodi do složenih grešaka i regret bound-a koji raste kvadratno sa vremenskim horizontom: čim učenik napusti stanja koja je demonstrator posjetio, ništa u podacima mu ne govori kako da se vrati. DAgger ovo ispravlja iteracijom - pokrenite politiku, označite stanja koja poseti, agregirajte, retrenirajte - što Ross, Gordon i Bagnell opisuju kao redukciju na no-regret online učenje.
Ta formulacija ima posledicu koju ljudi preskaču. Garancija se tiče sekvence politika kroz iteracije, ne bilo kojeg pojedinačnog trčanja. Ne kaže ništa o tome da li vaše kolo tri je pomoglo. Jedini način da znate je da merite svaku iteraciju. Kelly i kolege su predstavili HG-DAgger jer klasični DAgger pita eksperta za oznake akcija dok je početnik još u kontroli, što rad argumentuje može smanjiti bezbednost i, sa ljudskim stručnjacima, verovatno će degradirati kvalitet oznaka kroz percipiranu latenciju aktuatora. HG-DAgger takođe uči prag bezbednosti za metriku rizika zasnovanu na neizvesnosti modela i izveštava poboljšanu performansu kako nad DAgger tako i nad ponašajnim kloniranjem na zadatku vožnje. Ne objavljuje brojeve intervencija; te vi proizvodite sami.
Definisanje stope tako da dva čoveka dobiju isti broj
Definicija je jedan red: okviri intervencije podeljeni sa okvirima trčanja. Sve teško se skriva u onome što se računa kao okvir i šta se računa kao trčanje.
Okviri, ne episode
Brojanje episoda sa najmanje jednom intervencijom je beskorisno: deset episoda sa jednim pokretanjem i deset u kojima ste vozili osamdeset procenata obe daju "10/10". Broj okvira ih odvaja, i to je granularnost koju snimanje već ima - u LeRobot formatu skupa podataka svaki vremenski korak je red, tako da je zastavica intervencije jedna booleova kolona pored stanja i akcije. Ovde se piše po okvirou čim preuzimanje počne i briše se kada se kontrola vraća.
Imenilac uključuje korekcije
Dva imeoca su branljiva - ukupni okviri trčanja, ili okviri koje je politika vozila autonomno - i oni se drastično razilaze na visokim nivoima intervencije. Preuzmi za 400 od 1000 okvira i prvi daje 40 procenata, drugi 67 procenata. Poređenje jednog kola merenog na prvi način sa sledećim merenim na drugi način je kako pravi napredak nestaje. Uzmi ukupne okvire i nikada ne ponovi izbor mid-serije.
Odlučite jednom šta se dešava sa okvirima preuzimanja
Uvek postoji šav. Kada se kontrola prebaci, neki okviri pripadaju nijednoj strani: ruka je držana, lider se poravnava, snimanje je zamrznuto. U ovoj strukturi ti okviri preuzimanja ostaju u sirovu toku i nikada ne ulaze u kuriranog episodu - nisu ni ponašanje politike ni korekcija vredna treninga. Računajte šav na isti način svako kolo: na 30 Hz, šest preuzimanja sa dvosekunom šavom svaki je 360 okvira, dovoljno da pomeri točku procenta.
Okviri ili episode; ukupno trčanje ili samo autonomno; okviri preuzimanja unutar ili van. Bilo koji od tri promenjena tiho između kola čini krivu beznačajnom. Napišite sva tri.
Logovanje ga tako da broj preživi sesiju
Metrika u statusnoj paneli pokrenute procesa je čitanje: nestaje pri restartanju i ne može se crtati. Jedan append-only red po trčanju pokriva celu seriju - uključujući koji checkpoint ste vozili, jer se to menja svako kolo i miješanje ih poništava šta sledi.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Dva polja nose težinu. train_mix je ono što ste dali sledeće trenažne posle; bez toga ništa se ne može pripisati. eval_protocol imenuje fiksni test koji ste pokrenuli nakon, i je polje koje se najčešće ostavi prazno. U ay-robots kokpitu status preuzimanja izveštava broj intervencijskih okvira za tekuću sesiju, tako da je logovanje transkripcija umesto instrumentacije; dokumentacija skupa podataka pokriva gde per-frame kolone dopiru.

Čitanje krive: tri kola, jedan zaključak
Tri kola je minimum za čitanje, jer dve tačke su uvek linija. Tabela ispod je šablon za ažuriranje sa brojevima zamena, ne merenjima iz bilo kojeg trčanja. Tražite monotono smanjenje usklađeno sa povećanjem uspeha na fiksnom testu.
| Kolo | Checkpoint vožen | Okviri | Okviri intervencije | Stopa | Uspesi (od 20) |
|---|---|---|---|---|---|
| 0 (bazna) | bazna politika | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | iz kola 0 miješavine | 5 610 | 980 | 17,5 % | 10 |
| 2 | iz kola 1 miješavine | 5 412 | 611 | 11,3 % | 11 |
| 3 | iz kola 2 miješavine | 5 380 | 598 | 11,1 % | 12 |
Kola jedan i dva rade posao. Kolo tri nije: 11,3 naspram 11,1 procenata je unutar varijacije run-to-run svega što se meri na fizičkom ruku, i četvrto kolo istih korekcija provodi popodne za ništa. Ravni segment kaže promeni nešto strukturalno.
- Preostali neuspesi nisu ispravljivi teleoperacijom - objekat van domaćaja, geometrija hvatača, zglobovi na njegovoj granici. Nema podataka korekcije koji popravljaju kinematski zid.
- Korekcije su premalo naspram baznog skupa podataka da pomere gradijent, i ništa ih ne ponderira.
- Korekcije se međusobno protivreče, tako da politika usrednjava dve strategije i sliće između njih.
- Neuspeh je uzvodno: kamera se pomaknula, osvjetljenje se promenilo, pogled ručnog zgloba više ne odgovara treningu.
- Zadatak je na stropu ove klase politike na ovom hardveru, i sledeći korak je više osnovnih podataka.
Poslednjih dva nisu neuspesi petlje. U Sirius-Fleet opadajuća potreba za čovekom je dizajniran ishod: kako se robotska autonomija poboljšava, njene anomalije prediktor prilagođavaju svoje kriterijume predviđanja, što vodi manje zahteve za ljudskom intervencijom i postepeno smanjuje teško teško tokom vremena. Tamo je kriterijum namerno prilagođava. U ručnoj petlji vaša se takođe prilagođava, tiho - tako da stopa koja splošnava jer je zadatak na njegovoj granici izgleda tačno kao jedna koja je splošnala jer je operater prestao da primećuje. Što je sledeći problem.
Zamka 1: padajuća stopa nije rastući stopa uspeha
Stopa intervencije meri tačno jednu stvar: koliko ste bili od trčanja da se vlastitite. Ta odluka je vaša, doneta u realnom vremenu, i pomera se. U kolu nula vi preuzimate pri prvom lošem uglu pristupa; do kola tri ste pogledali kako politika oporavlja od tuceta njih i vi dozvolite da pokuša. Vaš prag se pomerio; politika verovatno ne. Stopa pada svakako.
Ljudsko poverenje je barem modelirana količina u literaturi umesto pretpostavljene konstante. Sirius prerenira uzorke treninga sa aproksimiranim ljudskim poverenjem i optimizuje politiku sa ponderiranim ponašajnim kloniranjem, izveštavajući 8 procenata povećanja u simulaciji i 27 procenata na realnom hardveru preko state of the art-a u stopi uspeha politike, na dvostruko bržoj konvergenciji. To tretira poverenje kao težina na podacima. Ne koriguje prag u vašoj glavi između kola nula i kola tri.
Ne možete ukloniti drift, tako da uparrite stopu sa nečim što vaš prag ne može dodirnuti: fiksni skup pokušaja u kojem se uopšte ne mešate, postignuti naspram kriterijuma napisanog pre kola. Stopa koja pada dok uparjena stopa uspeha ostaje je potpis habitacije - vredna hvatanja, jer sa unutar petlje deluje kao napredak.
| Stopa intervencije | Stopa uspeha na fiksnom protokolu | Najverovatnije čitanje |
|---|---|---|
| pada | raste | Kolo je radilo. Nastavite. |
| pada | ravno | Vaš prag je drifted, ili su korekcije uklonile trud bez uklanjanja neuspehima. |
| pada | pada | Korekcije degradiraju politiku. Proverite mešavinu i njihovu internu konzistenciju. |
| ravno | ravno | Kolo nije kupilo ništa. Mešavinu, checkpoint ili zadatak promenite pre prikupljanja više. |
| raste | pada | Regresija. Posumnjajte u miješavinu treninga, promenjenu kameru ili miješavinu checkpoint-a pre nego što posumnjajte u metodu. |
Zamka 2: bez fiksnog protokola, mersite sobas
Evaluacija realnog robota je skupna i teško se ponavlja. SIMPLER autori su motivirani simuliranom evaluacijom sa opažanjem da real-world evaluacija takvih politika nije skalabilna i suočava se sa problemima reproducibilnosti koji će verovatno biti gori kako politike šire njihov spektar zadatka. RoboArena ga napada sa druge strane, sa više od 600 pairwise real-robot evaluacijskih episoda tokom sedam generalistnih politika, koje vode evaluatori na sedam akademskih institucija na DROID platformi. Njegovi evaluatori biraju svoje vlastite zadatke i okoline ali moraju suditi parove politika duplo-slepi; rad izveštava da ova crowd-sourced rangiranja prate performansu generalistne-politike tačnije nego konvencionalne, centralizovane evaluacije.
Ne ćete pokrenuti 600 uparenih episoda na jednoj SO-100 u radionici. Šta možete da uradite je ukloniti varijansu koju kontrolirate - listu dosadnu dovoljno da se obično preskoči.
| Dimenzija | Zamrzni ovo | Šta drfts ako se ne |
|---|---|---|
| Početna pozicija | Pisana kućna pozicija, vozena pre svakog pokušaja | Trajektorija počinje van distribucije |
| Objekti | Označena žigom mesta, i isti fizički objekti rezervisani za evaluaciju | Bolja politika je zapravo bliži objekat |
| Kamere i svetlo | Ista montaža, indeksi, ekspozicija; žaluzine zatvorene; fotografuj postavku | Zamenjeni indeksi kamera sami mogu dominirati rezultatom |
| Pokušaji i pravilo zaustavljanja | Fiksni n, fiksni timeout, kriterijum napisan pre kola | Post-hoc kriterijumi pretvaraju blizu-promaše u sve što trebate |
| Ponašanje operatera | Nema intervencija tokom pokušaja evaluacije | Evaluacija postaje druga sesija korekcije |
Zatim aritmetika, nemilosrdna na brojeve pokušaja koje radionica može priuštiti. Pod normalnom aproksimacijom, 60 procenata uspeha tokom 20 pokušaja ima standardnu grešku blizu 11 procentnih poena - kvadratni koren od 0,6 puta 0,4 tokom 20 - i razlika između dva takva kola nosi oko 15. Skok sa 60 na 70 procenata je stoga konzistentan sa ništa što se desilo. Pedeset pokušaja donosi per-round broj na grubo 7 poena, i košta popodne.
Ova asimetrija je argument za stopu intervencije: izračunatu tokom hiljada okvira umesto dvadeset binarnih ishoda, ona se pomera ranije i glatko. Upozorenje je da su okviri unutar episode teško korelisani - jedan loš isceljenje daje stotinu uzastopnih okvira intervencije - tako da je efektivna veličina uzorka bliža broju preuzimanja. Tretirajte stopu kao rani indikator i stopu uspeha kao spora osnovna istina.
Evaluacijske episode nikada ne smeju ući u komponovani skup podataka treninga - inače je kolo n+1 postignuto na podacima koje je obučavano, i kriva meri memorizaciju.
Zamka 3: trening samo na korekcijama sviđa politiku
Korekcije su interesantni podaci, tako da instinkt je da trenirate na njima. Ne. Dolaze po konstrukciji iz uskog sloja prostora stanja gde je politika već bila neuspešna i kažu skoro ništa o većini trčanja koje je radilo. Fine-tune na том sloju samo i dobijate politiku dobru na oporavku od promašenog pristupa koja je zaboravila kako da napravi čistu.
Mandlekar i kolege su izgradili svoj sistem daljinske intervencije oko ovoga. Njihova formulacija: zadaci manipulacije sadrže grla regije koja zahtevaju sekvencu preciznih akcija - umešavanje kapsule u aparat za kavu je njihov primer - gde male devijacije vode u stanja koja demonstracije nikada nisu pokrivale. Njihov algoritam trenira iterativno na nove podatke tako da politika nauči da prelazi ta grla, i oni izveštavaju da ageniti obučeni na podacima intervencije pobeđuju agente obučene na ekvivalentnom broju uzoraka od non-intervencijskih demonstratora.
- Brzo: kratko trčanje tokom nekoliko deset episoda je dovoljno jeftino da se ponovi
- Ciljano: gradijent je dominiran stanjima koja vam je stalo
- Jeftino za testiranje da li je stil korekcije učljiv uopšte
- Distribucija fine-tune više ne naliči na distribuciju zadatka
- Nominalno ponašanje može degradirati vidljivo unutar jednog kola
- Stopa može pasti dok uspeh pada sa njom - čiste segmente zamenjene za oporavke
Omjer miješanja je hipeparametar i zaslužuje da bude napisan. Kompajliranje sledećeg skupa podataka je gde je odlučeno: originalne demonstracije plus skup korekcija, izbor episode po izvoru umesto pravila koja tiho vučevršavaju šta je dostupno. Tamo je jedan koraku u kokpitu, i rezultat je običan skup podataka - vidite dokumentaciju treninga. Šta nijedan alat ne radi za vas je snimanje koji omjer proizvodio koju krivu.
Zamka 4: čovek nije dosledan stručnjak
DAgger teorija pretpostavlja eksperta. Vi niste jedan u tehničkom smislu: vaše korekcije nisu uzorci iz fiksne uslovne distribucije preko akcija. ACT autori to nazivaju kada nabraja prepreke fini manipulaciji - greške se kompajliraju tokom vremena, i ljudske demonstracije mogu biti ne-stacionarne. Njihov sistem i dalje dostiže 80 do 90 procenata uspeha na šest pravih zadataka iz deset minuta demonstracija, tako da problem nije nerešavajući, nije odsutan.
Robomimic studija čini tačku sa strane podataka. Tokom šest offlajn algoritama na pet simulirane i tri real-world multi-stage zadatka, njegove lekcije uključuju osjetljivost na izbore dizajna, zavisnost od kvaliteta demonstracije, i - ona koja najviše boli ovdje - varijabilnost nastala iz kriterijuma zaustavljanja, jer se ciljevi treninga i evaluacije razlikuju. Checkpoint sa najnižim gubitkom nije pouzdano onaj sa najvećim stopa uspeha.
Postoji verzija hardvera ovoga: mod unosa oblikuje korekciju. Podmešavanje lidera-sledbenika lider-sledilac postavka proizvodi neprekidne, ljudski tempovane trajektorije. Tastaturne nudge-e su čvrsto stegnute serverom - dva stepena po pozivu na zglobovima ruke, četiri na hvatačima - tako da se ista namena stigne kao stepenice od malih koraka. Klizači šalju apsolutne ciljeve i server se pomera najviše šest stepeni prema njima po pozivu. Tri moda, tri akcione distribucije; miješanje sve tri u jedan skup korekcija i zatim se čudi zašto je pristup postao nervnozan je samooštetan. teleoperacijske dokumentacije pokriva šta svaki mod šalje.
Pondering intervencije: IWR i šta je doslo nakon
Ako su korekcije dragocena manjina, načelan popravak je težina umesto isključivosti. Intervencija sa težinama Regression je referentna implementacija: podaci se dele na intervencijske i ne-intervencijske uzorke, i dva odeljenjenji se uzorkuju u jednakom omeru tokom treninga. Skup korekcija koji je pet procenata okvira zatim doprinosi polovini gradijenta, bez nominalnog ponašanja nestaje iz distribucije.
Jeddnakog omere je početna tačka, nije zakon. Sirius je generalizuje zamenom binarnog particionisanja sa neprekidnom težinom iz aproksimiranog ljudskog poverenja; Sirius-Fleet poteza odluku uzvodno, koristeći vizuelni svetski model i anomalije prediktore da odluči kada se čovek zove uopšte. Zajednička nit: zastavica intervencije je signal treninga, ne samo kolona ažuriranja.
| Metoda | Ko odlučuje kada čovek deluje | Kako se koriste podaci intervencije | Izvešteni rezultat |
|---|---|---|---|
| DAgger (2011) | Fiksni raspored; stručnjak označava posećena stanja | Jedan rastuća skup podataka, neparametrisan | Okvašen kao redukcija na no-regret online učenje |
| HG-DAgger (2019) | Čovek, gating kontrolu na realnom sistemu | Agregirano; plus naučeno prag bezbednosti na neizvesnosti modela | Bolje od DAgger-a i BC na vožnji; nema intervencijskih brojeva dati |
| IWR (2020) | Čovek, preko daljinske teleoperacije | Intervencijski i ne-intervencijski uzorci izvlačeni u jednakim proporcijama | Udara ne-intervencijske demonstre na ekvivalentnog broja uzoraka |
| Sirius (2022) | Čovek, tokom raspoređivanja | Ponderirana BC, težine iz aproksimiranog ljudskog poverenja | 8 % dobitak u simulaciji, 27 % na realnom hardveru; 2x brža konvergencija |
| ThriftyDAgger (2021) | Sistem, gating na novelnost i rizik | Interaktivna kolekcija pod budžetom supervizije | Korisnička studija (N=10): 58 % veće čovečanskog i 80 % veće robusne performanse nego sledeća najbolja metoda |
| Fleet-DAgger (2022) | Sistem, dodeljivanja pažnje tokom flote | Fleet učenje postignuto sa Return on Human Effort | Dos do 8,8x veće ROHE od bazlina |
| Sirius-Fleet (2024) | Anomalije prediktore sa samo-prilagođavanjem kriterijuma | Multi-task učenje sa vizuelnim svetskim modelom | Manje zahteve intervencije kao autonomija poboljšava |

Četiri metrike vredne logovanja pored stope
- Preuzimanja po trčanju. Dvadeset kratkih korekcija i jedan dugi daju sličnu stopu i opisuju različite politike - jedna nervna, jedna sa jednom mrtvom zonom.
- Srednja dužina intervencije. Rastući dužina sa padajućim brojem znači da su preostali neuspesi teški, što je šta kasni napredak izgleda kao.
- Vreme do prve intervencije. Politika koja dobija dalje pre nego što joj treba pomoć se poboljšava čak i kada je ukupna stopa ravna.
- Gde se intervencije grupiraju. Bin zastavicu po normalizovanom napredku episode; stabilni vrh tokom kola pokazuje na jedno grlo.
Protokol kola koji zaista možete pokrenuti
Izmereno kolo ima šest koraka i proizvodi jedan red u dnevniku. Prva četiri su petlja; poslednja dva čine to merenja.
- 1Zamrzni protokol evaluacije pre kola nula
Zapišite početnu poziciju, smeštaj objekta, kamere, broj pokušaja, timeout i kriterijum uspeha. Fotografiraj stol. Ako se dokument mora promeniti, serija se restartuje.
- 2Izmeri baznu
Pokreni protokol bez intervencija i zabeleži uspehe; zatim pokreni jednu instrumentovanu sesiju sa preuzimanjem omogućenim i zabeleži stopu. Ona dva broja su kolo nula.
- 3Prikupljanja korekcije u jednom doslednom stilu
Jedan mod unosa po kolu, jedan operater ako možete. Preuzmi na kriterijumom koji možete da napišete - 'hvatač više od dva centimetra od pristupa' - i drži ga za kolo.
- 4Triage svaku episodu isti dan
Korekcija, evaluacija ili odbaci. Dvosistemske episode se odbacuju, ne čuvaju na teoriji da više podataka pomaže - korekcija u kojoj ste se vi sami prevario je gora nego bez episode.
- 5Komponuj miješavinu eksplicitno
Originalne demonstracije plus korekcije, izbor episode po izvoru. Zabeleži bazni broj, broj korekcija i bilo koje ponderisanje - ovo je polje koje ćete hteti za tri nedelje.
- 6Nastavi od checkpoint-a, zatim re-meri
Treniraj komponovani skup podataka od prethodnog checkpoint-a umesto baznog modela, pokreni zamrznut protokol plus jednu instrumentovanu sesiju, dodaj red, i poredi sa prethodna dva kola.
Dva ograničenja menjaju kako čitaš slabo kolo. Nastavak od checkpoint-a inicijalizuje težine od njega - ne optimizer resume, tako da se raspored počinje ispočetka i kratko trčanje od konvergiranog checkpoint-a može da se pomera veoma malo. I leader-align kretanje na početku preuzimanja ima najmanju kilometražu na realnom hardveru od svega u lancu; ako sve korekcije počinju sa čudan prolazak, pogledaj tamo pre nego što krivi miješavinu.
Izmerena petlja, već provodljiva
ay-robots primenjuje ova šest koraka kao karakteristike proizvoda: preuzimanja mid-run od lidera ruke, tastature ili klizača, sa zastavicama intervencije automatski flag-ane; triage svake episode kao korekcija, evaluacija ili odbaci; komponuj sledeći skup podataka od originalnih demonstracija plus korekcije, izbor episode eksplicitan po izvoru; i počni sledeći train trčanje od prethodnog checkpoint-a umesto baznog modela.
Vidite kako DAgger petlja radiŠta brojevi ne mogu reći
Ništa od ovoga nije rešeno, i uredna kriva ne bi trebala da vas ubedi inače. Stopa intervencije meri zajednički sistem - politika, hardver, operater, soba - i atribuira ništa sama. Ne može suditi da li su korekcije bile dobre, i biće pada srećno na zadatku koji je postao lakši jer se objekat pomakao dva centimetra bliže tokom tri nedelje.
Šta to radi je promeniti nejasan keš u kolonu preko koje možete da se prepirujete. Alternativa nije bolja metrika; to je tri nedelje prikupljanja korekcija koje bi kriva rekla, posle kola tri, da prestane prikupljanje. Anketa literatura definiše interaktivno učenje imitacijom kao ljudsku povratnu informaciju datu povremeno tokom izvršenja robota, dozvoljava onlajn poboljšanje ponašanja; porodica je široka, i nema aranžmana od toga radi bez broja po kolu. Vidite takođe SO-100 vodič za učenje imitacijom za bazni skup podataka koji mešate naspram, pokretanje politike za stranu zaključka, i DAgger petlja stranica za prvobitnu vodu.
Da li je stopa intervencije samo jedan minus stopa uspeha?▾
Ne. Stopa meri koliko od trčanja ste preuzeli; stopa uspeha meri da li je zadatak završen bez vas. Trčanje može da uspe sa 30 procenata stopom intervencije, i trčanje bez intervencija može da propadne sasvim. Oni takođe se razlikuju u buku: stopa se glatko pomera tokom hiljada korelisanih okvira, stopa uspeha skače između nekoliko binarnih ishoda. Zapišite oba.
Koliko evaluacijskih pokušaja trebam da stopa uspeha znači nešto?▾
Više nego što se čini razumno. Pod normalnom aproksimacijom, 20 pokušaja u pravoj 60 procenata stopi uspeha nose standardnu grešku blizu 11 procentnih poena, tako da je 10-točak kretanje između kola nerazlikuje od buke; 50 pokušaja donosi taj broj na grubo 7. Ako ne možete priuštiti 50, drž broj pokušaja identičan tokom kola i tretirajte male kretanje kao neodlučna.
Koji omjer miješanja demonstracija za korekcije trebam da počnem sa?▾
Dokumentovana početna tačka je IWR-ova: particionuj podatke u intervencijske i ne-intervencijske uzorke i crtaj ih u jednakim omjerima, tako da korekcije doprinose polovini gradijenta bez obzira kako mali deo okvira su. Ako vaša postavka ne može težiti uzorkovanje, aproksimiraj kroz brojeve episode kompajliranja skupa podataka i zabeleži omjer. Trening samo na korekcijama je opcija koju treba da isključite.
Moja stopa intervencije je pošla gore posle kola. Da li je kolo izgubljeno?▾
Ne nužno, ali preproverite dosadne objašnjenje prvo: da li je checkpoint koji ste vozili poklapao se sa onim koji ste obučavali, da li je indeks kamere ili montaža promenjena, da li je smeštaj objekta driftovao, bio li stil korekcije dosledan. Ako su svi četiri čisti i uparena stopa uspeha takođe pao, posumnjajte miješavinu - premalo bazne demonstracije naspram korekcija, ili korekcije koje se međusobno protivreče. Pravi regresija pripada dnevniku, ne korpi.
Mogu li preskok fiksnog protokola evaluacije i samo gledanja stope intervencije?▾
Samo ako prihvatiš da ne možeš reći poboljšanje od habitacije. Stopa zavisi od vašeg sopstvenog realnog vremena praga za intervenciju, i taj prag pada kako se navikavate na čudos politike. Zamrznuta protokol je deo merenja da vaš prag ne može dodirnuti - označena mesta, napisana kućna pozicija, fiksni broj pokušaja, kriterijum odlučen pre kola. Mora da ostane nepromenjena tokom serije.
Drži dnevnik u repozitorijumu, ne u beležnici: kola su dana razdvojena, hardver se pregrađuje, i osoba koja čita krivu oktobra je vi bez uspomena avgusta. dokumentacije FAQ pokriva operativne detalje koje sam preskočio ovdje.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started