
Stopa intervencije - okviri intervencije podijeljeni s okvirima pokretanja - je najjeftiniji iskren signal napretka koji humana gatera DAgger petlja ima. Ovaj članak je definiše tako da dvije osobe računaju istu vrijednost, pokazuje kako je logirati, i prolazi kroz četiri načina na koja vas zavodi: operatorska habituacija, pomjerena postavka evaluacije, treniranje samo na ispravkama, i čovjek koji ispravljač drugačije u utorak nego u ponedjeljak.
DAgger runda se čini produktivnom dok ste u njoj. Vozite politiku, preuzimate kontrolu kada kosa grasp, štedate ispravke, retrenirate, i sljedeca pokretanja izgleda - zagavrdili biste - malo glaće. Dvije runde kasnije ne možete reći da li se nešto promijenilo, jer "malo glaće" nije količina.
Petlja trebanju jedan broj po rundi, i u humana gaterie petlja taj broj je gotovo besplatan: frakcija pokretanja tijekom kojega ste imali kontrolu umjesto politike. Ovaj članak je definiše tako da dvije osobe računaju istu vrijednost, logira je, čita rezultirajuću krivulju, i imenuje četiri načina na koja vas zavodi kada stoji sama. Za teoriju koju ovaj dio pretpostavlja, vidi DAgger objašnjenju i varijanta s čovjekom u petlji; praktični pandan je pokretanje DAgger petlje na SO-100.
Kratka verzija
- •Stopa intervencije = okviri intervencije / okviri pokretanja. Okviri, ne epizode, i nazivnik uključuje okvire koje ste proveli ispravkom.
- •Ravna krivulja kroz tri runde znači da runde ne kupuju ništa - promijenite mješavinu, checkpoint ili zadatak umjesto prikupljanja četvrtog.
- •Padajuća stopa intervencije nije rastuća stopa uspjeha. Vaš prag za intervenciju pada prema dolje kako povjerenje raste.
- •Bez smrznute postavke evaluacije - iste početne pozicije, objekti, kamere, broj pokušaja - mjerite sobu.
- •Treniranje samo na ispravkama iskrivljuje raspodjelu stanja. IWR odgovor: nacrtajte intervencije i ne-intervencije uzorke u jednakom omjeru.
Zašto runda trebanju broj uopće
DAgger postoji zbog problema s raspodjelom, i problemi s raspodjelom su nevidljivi oku. Ross i Bagnell su pokazali da učenje iz opažanja na fiksnom skupu demonstracija vodi u sabirne greške i regret granica koja raste kvadratno u vremenskom hrijezdu: jednom kada se učenjak premjesti stanja koja je demonstrator posjetio, ništa u podatcima ne govori kako se vratiti. DAgger to ispravlja iteracijom - pokrenite politiku, označite stanja koja posjeti, agregira, retrenirajte - što Ross, Gordon i Bagnell uokviruju kao smanjenje na ne-regret online učenje.
Taj okvir ima posljedicu koju ljudi preskačju. Garancija se tiče niza politika kroz iteracije, ne bilo koje jedne pokretanja. Ne govori ništa o tome je li vaša runda tri pomogla. Jedini način da znate je mjeriti svaku iteraciju. Kelly i kolege su uveli HG-DAgger jer klasična DAgger pita stručnjaka za oznake akcija dok početnik još ima kontrolu, što članak tvrdi može smanjiti sigurnost i, s ljudskim stručnjacima, vjerovatno će degradirati kvalitetu oznake kroz shvatljive kašnjenja aktuatora. HG-DAgger također uči sigurnosni prag za model-neizvjesnnost-baziranu metrika rizika i izvještava poboljšanu izvedbu naspram DAgger-a i ponašajnog kloniranja na zadatku vožnje. Ne objavljuje brojeve intervencija; one proizvodite sami.
Definisanje stope tako da dva čovjeka dobiju isti broj
Definicija je jedan redak: okviri intervencije podijeljeni s okvirima pokretanja. Sve teško se skriva u onome što se računa kao okvir i što se računa kao pokretanje.
Okviri, ne epizode
Brojanje epizoda s barem jednom intervencijom je beskorisno: deset epizoda s jednom potiskanjem i deset u kojima ste vozili osamdeset posto oboje daju "10/10". Broj okvira ih razdvaja, i to je granularnost koju snimanje već ima - u LeRobot formatu dataset svaki vremenski korak je redak, tako da je zastavica intervencije jedan boolean stupac pored stanja i akcije. Ovdje se piše po okviru u trenutku preuzimanja kontrole i briše se kada se kontrola vraća.
Nazivnik uključuje ispravke
Dva nazivnika su branljiva - ukupno okviri pokretanja, ili okviri politike je autonomno vozila - i oni se divergiraju loše pri visokim nivoima intervencije. Preuzmi kontrolu za 400 od 1000 okvira i prvi daje 40 posto, drugi 67 posto. Uspoređivanje jedne runde mjerene prvim putem naspram sljedeće mjerene drugim putem je kako je pravi napredak nestao. Uzmite ukupno okvire i nikada ne ponavljajte izbor srednje serije.
Odlučite jednom što se dešava s okvirima prebacivanja
Uvijek postoji šav. Kada se kontrola prenese, neki okviri pripadaju niti jednoj strani: ruka se drži, vođa se poravnava, snimanje je smrznuto. U ovoj cjevovodnoj oni okvirima prebacivanja ostaju u sirovom toku i nikada ne ulaze u kuratiranu epizodu - nisu ponašanje politike niti ispravka koja vrijedi trenirati. Brojite šav na isti način svaku rundu: na 30 Hz, šest preuzimanja s dvosekundnim šavom svaka je 360 okvira, dovoljno da se pomakne postotna boda.
Okviri ili epizode; ukupno pokretanje ili samo autonomno; okvirima prebacivanja unutar ili vani. Bilo koji od tri promijenjena u tišini između rundi čini krivulju besmislenom. Napišite sve tri.
Logiranje tako da se broj preživi seansu
Metrika u statusnoj ploči pokrenuta procesa je čitanje: nestaje pri restartanju i ne može se nacrtati. Jedan samo-dostavljajući redak po pokretanju pokriva cijelu seriju - uključujući koji checkpoint ste vozili, jer se to mijenja svaku rundu i mješanje ih invalidira što slijedi.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Dva polja nose težinu. train_mix je ono što ste hranili sljedećim treninskom poslom; bez njega ništa se ne može pripisati. eval_protocol imenuje fiksni test koji ste pokrenuli nakon toga, i to je polje najčešće ostavljeno prazno. U ay-robots kabinama status preuzimanja izvještava broj okvira intervencije za pokrenuta sesiju, tako da je logiranje prepis umjesto instrumentacije; dokumentacija dataset pokriva gdje stupci po okviru slijeću.

Čitanje krivulje: tri runde, jedan sud
Tri runde su minimum za čitanje, jer dva boda su uvijek linija. Tablica ispod je šablona knjižničnog vođenja s rezervnim brojevima, ne mjerama iz bilo kojeg pokretanja. Tražite monoton pad prožet povećanjem u uspjehu fiksnog testa.
| Runda | Checkpoint vozio | Okviri | Okviri intervencije | Stopa | Uspjesi (od 20) |
|---|---|---|---|---|---|
| 0 (osnovna) | osnovna politika | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | iz runde 0 mješavine | 5 610 | 980 | 17,5 % | 10 |
| 2 | iz runde 1 mješavine | 5 412 | 611 | 11,3 % | 11 |
| 3 | iz runde 2 mješavine | 5 380 | 598 | 11,1 % | 12 |
Runde jedan i dva obavljaju posao. Runda tri nije: 11,3 nasuprot 11,1 posto je unutar pokretanja-do-pokretanja varijacije bilo čega mjereno na fizičkom rukom, i četvrta runda iste ispravke trošiti poslijepodne za ništa. Ravni segment kaže promijenite nešto strukturno.
- Preostali neuspjesi nisu ispravljivi teleoperacijom - objekt izvan dosega, geometrija grifera, zglob na svojoj granici. Nema boja podatcima ispravlja kinematičku zid.
- Ispravke su premalo nasuprot osnovnom dataset-u da pomakne gradijent, i ništa ih ne ponderira.
- Ispravke se međusobno kontradiraju, tako da politika prosječuje dvije strategije i slijeće između njih.
- Neuspjeh je uzvodnih: kamera se premjestila, osvjetljenje se promijenilo, prikaz na zglavu više ne odgovara treningu.
- Zadatak je na stropu te klase politike na ovoj hardveru, i sljedeći korak je više osnovnih podataka.
Posljednja dva nisu neuspjesi petlje. U Sirius-Fleet padajuća potreba čovjeka je dizajnirana ishod: kao robot autonomija poboljšava, njezina anomalija predviđači prilagođavaju svoje kriterije predviđanja, što vodi manjim zahtjevima za ljudsku intervenciju i postepeno smanjujući ljudsku opterećenje tijekom vremena. Tamo kriterij prilagođava namjerno. U ručnoj petlji tvoj se prilagođava isto, u tišini - tako da stopa koja se ravna jer je zadatak na stropu izgleda točno kao ona koja se ravna jer operator prestao primjećivati. Što je sljedeći problem.
Zamka 1: padajuća stopa nije rastuća stopa uspjeha
Stopa intervencije mjeri točno jednu stvar: koliko pokretanja ste odlučili posjedovati. Ta odluka je tvoja, donesena u realnom vremenu, i mijenja se. U rundi nula preuzimate kontrolu pri prvom lošem kutu pristupa; do runde tri ste gledali politiku oporaviti se od tuceta njih i puštate je da proba. Vaš prag se pomakao; politika možda nije. Stopa pada bilo kako.
Ljudsko povjerenje je barem modelirana količina u literaturi nego pretpostavljena konstanta. Sirius ponovno teži uzorcima treninga s približenim ljudskim povjerenjem i optimizira politiku s ponderirani ponašajnim klonom, izvještavajući 8 posto povećanja u simulaciji i 27 posto na stvarnom hardveru preko stanja tehnike u stopi uspjeha politike, pri dvostrukoj brzini konvergencije. To tretira povjerenje kao ponderiranje na podatcima. Ne ispravljuje prag u tvojoj glavi između runde nula i runde tri.
Ne možete ukloniti pomak, tako da uparujete stopu s nečim što vaš prag ne može dotaknuti: fiksni skup pokušaja u kojem ne intervenira uopće, bodovani naspram kriterija napisanog prije runde. Stopa koja pada dok uparena stopa uspjeha ostaje stavljanja je potpis habituacije - vrijedna hvatanja, jer s unutar petlje čini se kao napredak.
| Stopa intervencije | Stopa uspjeha na fiksnom protokolu | Najvjerojatnije čitanje |
|---|---|---|
| pada | raste | Runda je radila. Nastavi. |
| pada | ravna | Vaš prag se pomakao, ili ispravke su uklonile napor bez uklanjanja neuspjeha. |
| pada | pada | Ispravke degradiraju politiku. Provjerite mješavinu i njihovu internu konzistentnost. |
| ravna | ravna | Runda nije kupila ništa. Promijenite mješavinu, checkpoint ili zadatak prije prikupljanja više. |
| raste | pada | Regresija. Posumnjajte u mix treninga, promijenjenu kameru ili mix checkpoint-a prije nego što posumnjate metodu. |
Zamka 2: bez fiksnog protokola, mjerite sobu
Evaluacija pravog robota je skupna i teško se ponavlja. Autori SIMPLER-a motiviraju simuliranu evaluaciju s opažanjem da real-svijet evaluacija takvih politika nije skalabilna i suočava se s reproducibilitete izazovima vjerovatno da će se pogoršati kako politike proširiti njihov spektar zadataka. RoboArena ga napada s druge strane, s više od 600 parnih realnih-robot evaluacijskih epizoda preko sedam generalist politike, pokrenuti od strane evaluatorza na sedam akademskih institucija na DROID platformi. Njezini evaluatori biraju svoje vlastite zadatke i okoline ali moraju suditi parove politika u dvostrukoj sljepoći; članak izvještava da je ova skupna rangiranja prate generalist-politika izvedba točnije nego konvencionalnu, centraliziranu evaluaciju.
Nećete pokrenuti 600 parnih epizoda na jednom SO-100 u radionici. Ono što možete učiniti je ukloniti varijancu koju kontrolirate - popis toliko dosadan da se obično preskaču.
| Dimenzija | Smrznite to | Što se pomjera ako ne |
|---|---|---|
| Početna pozicija | Napisana početna pozicija, vozila prije svakog pokušaja | Putanja počinje izvan distribucije |
| Objekti | Zalijepljene oznake, i isti fizički objekti rezervirani za evaluaciju | "Bolja" politika je zapravo bliži objekt |
| Kamere i osvjetljenje | Ista montaža, indeksi, ekspozicija; sljepilice zatvorene; fotografirati postavu | Zamijenjeni indeksi kamere sami mogu dominirati rezultat |
| Pokušaji i pravilo zaustavljanja | Fiksni n, fiksni vremenski premac, kriterij napisan prije runde | Retroaktivni kriteriji pretvaraju skoro-uspjehe u bilo što trebate |
| Ponašanje operatora | Bez intervencija tijekom evaluacijskih pokušaja | Evaluacija postaje još jedna sesija ispravke |
Zatim aritmetika, bezmilosna na broj pokušaja koji radionica može priuštiti. Pod normalnom aproximacijom, 60 posto uspjeha kroz 20 pokušaja nosi standardnu grešku blizu 11 postotnih bodova - kvadratni korijen od 0,6 puta 0,4 preko 20 - i razlika između dva takva pokretanja nosi oko 15. Skok s 60 na 70 posto je zato konzistentan s ničim što se dogodilo. Pedeset pokušaja donesu po rundi broj na otprilike 7 bodova, i koštaju poslijepodne.
Ova asimetrija je argument za stopu intervencije: računata preko tisuća okvira umjesto dvadeset binarnih ishoda, ona se kreće ranije i glaće. Upozorenje je da su okviri unutar epizode teško korelirani - jedan loš grasp donosi stotinu uzastopnih okvira intervencije - tako da je efektivna veličina uzorka bliža broju preuzimanja. Trebati stopu kao rani pokazivač i stopa uspjeha kao spora istina o zemlji.
Epizode evaluacije nikada ne smiju ući u komponiranu dataset treninga - inače je runda n+1 bodovana na podatcima na kojima je trenirana, i krivulja mjeri memorizaciju.
Zamka 3: treniranje samo na ispravkama savija politiku
Ispravke su zanimljivi podaci, tako da je instinkt da se trenira na njima. Ne. Dolaze po konstrukciji iz uskog križa prostora stanja gdje je politika već bila neuspješna i govore skoro ništa o većini pokretanja koje je radilo. Fine-tuning na taj križ sam i dobijate politiku dobra na oporavku od zbrkane pristupa koja je zaboravila kako napraviti čistu.
Mandlekar i kolege su izgrađeni njihov sustav daljinskog intervencije oko toga. Njihov okvir: manipulacijski zadaci sadržavaju uska regije koja trebaju niza preciznih akcija - umetanje POD-a u kafijsku mašinu je njihov primjer - gdje mali odstupanja dovode u stanja demonstracije nikada nisu pokrivala. Njihov algoritam trenira iterativno na novim podatcima tako da politika uči da presiječe te uska mjesta, i izvještavaju da su agenti trenirani na podatcima intervencije porazili agente trepirane na ekvivalentnom broju uzoraka iz neinternventnih demonstrantora.
- Brzo: kratko pokretanje preko nekoliko tuceta epizoda je dovoljno jeftino da se ponovi
- Ciljano: gradijent dominira od strane stanja brinu se o
- Jeftino za testiranje je li stil ispravke učljiv uopće
- Distribucija fine-tune više ne nalikuje distribuciji zadatka
- Nominalno ponašanje može degradirati vidljivo unutar jedne runde
- Stopa može padati dok uspjeh pada s njom - čisti segmenti zamijenjeni za oporavke
Omjer miješanja je hiperparametar i zaslužuje biti napisan. Komponiranje sljedećeg dataset-a je gdje se odlučuje: originalni pokazi plus set ispravki, odabir epizode po izvoru umjesto pravila koja tiho vučete u sve što je dostupno. Tamo je jedan komponiran korak u kabini, i rezultat je obični dataset - vidi dokumentacija treninga. Ono što nema alat obavlja za vas je snimanje koji omjer производа koji krivulja.
Zamka 4: čovjek nije konzistentan stručnjak
DAgger teorija pretpostavlja stručnjaka. Niste jedan u tehnički smislu: vaše ispravke nisu uzorci iz fiksne uvjetne distribucije nad akcijama. Autori ACT nazivaju to kada nabrajanje prepreke fino manipulacije - greške se sabiraju tijekom vremena, i ljudske demonstracije mogu biti ne-stacionarni. Njihov sustav još dostiže 80 do 90 posto uspjeha na šest stvarnih zadataka od deset minuta demonstracija, tako da je problem razrješiv, ne odsutan.
Studija robomimic čini točku s podataka strane. Preko šest offline algoritama na pet simuliranih i tri stvarni-svijet multi-faza zadatke, njezine lekcije uključuju osjetljivost na izbore dizajna, ovisnost o kvaliteti demonstracije, i - ona koja boli najviše tu - varijabilnost nastaje od kriterija zaustavljanja, jer se ciljaju treninga i evaluacije razlikuju. Checkpoint s najniža gubitak nije pouzdano jedan s najviši stopa uspjeha.
Postoji verzija hardvera od toga: ulazni način oblikuje ispravku. A voditelj-sljedbenik postavka proizvodi kontinuirane, ljudski-tempirane putanje. Tipkovnica potiskuje su fiksna teško od strane servera - dva stupnja po pozivu na zglobove ruke, četiri na grifeру - tako da ista namjera stiže kao stepenice malih koraka. Klizači šalju apsolutne ciljeve i server se kreće maksimalno šest stupnja prema njima po pozovu. Tri reda, tri akcijske distribucije; miješanje svi tri u jedan set ispravki i zatim se pitam zašto pristup je postalo drhtavo je samonaneseni. dokumentacija teleoperacije pokriva što svaki način šalje.
Ponderiranje intervencije: IWR i što je došlo nakon
Ako su ispravke vrijedna manjina, principijarni fix je ponderiranje umjesto isključivosti. Intervencija Ponderirane Regresije je referenca implementacija: podatci su podijeljeni u intervenciju i ne-intervenciju uzorke, i dva particija su uzorkovani u jednakom omjeru tijekom treninga. Set ispravki koji je pet posto okvira zatim doprinose polovicu gradijenta, bez nominalne ponašanje iščezava iz distribucije.
Jednak omjer je početna točka, ne zakon. Sirius generalizira ga zamjenom binarnih particija s kontinuiranom težinom iz približene ljudske povjerenja; Sirius-Fleet premještava odluku uzvodnih, koristeći vizualni svjetski model i anomalija predviđači da se odluči kada je čovjek pozvan uopće. Zajedničko nit: zastavica intervencije je signal treninga, ne samo knjižničnom stupcem.
| Metoda | Tko odlučuje kad čovjek ponaša | Kako se podatci intervencije koriste | Izvješteni rezultat |
|---|---|---|---|
| DAgger (2011) | Fiksni raspored; stručnjak oznake posjetio stanja | Jedan rastući dataset, neponderiran | Okviren kao smanjenje za ne-regret online učenja |
| HG-DAgger (2019) | Čovjek, gatering kontrolu na stvarnom sustavu | Agregirani; plus naučeni sigurnosni prag na model neizvjesnosti | Bolje od DAgger-a i BC na vožnji; nema brojeva intervencije dani |
| IWR (2020) | Čovjek, preko daljinskog teleoperacije | Intervencija i ne-intervencija uzorci nacrtani u jednakom omjeru | Porazuje ne-interventne demo na ekvivalentnom broju uzoraka |
| Sirius (2022) | Čovjek, tijekom raspoređivanja | Ponderirani BC, težine iz približene ljudske povjerenja | 8% dobitak u simulaciji, 27% na stvarnom hardveru; 2x brža konvergencija |
| ThriftyDAgger (2021) | Sustav, gatering na novosti i rizik | Interaktivna kolekcija pod budžetom nadzora | Studija korisnika (N=10): 58% veći čovjek i 80% veći robot izvedba od sljedećeg najbolje metode |
| Fleet-DAgger (2022) | Sustav, dodjela pažnje preko flote | Fleet učenja bodovana po Povrat na Ljudski Napor | Do 8,8x viši ROHE od baselines |
| Sirius-Fleet (2024) | Anomalija predviđači s samo-prilagođavajućim kriterijima | Multi-task učenja s vizualnim svjetskim modelom | Manje zahtjeve intervencije kako autonomija poboljšava |

Četiri metrike vrijedne logiranja pored stope
- Preuzimanja po pokretanju. Dvadeset kratkih ispravki i jedan dugi daju sličnu stopu i opisuju različite politike - jedan drhtavo, jedan s jednim slijepim mjestom.
- Srednja dužina intervencije. Rastuća dužina s padajućim brojem znači preostali neuspjesi su težaki, što je kako spora napredak izgleda.
- Vrijeme do prve intervencije. Politika koja se ide dalje prije nego što trebanja pomoć poboljšava čak kada je ukupna stopa ravna.
- Gdje se intervencije skupljaju. Bin zastavicu po normaliziranom epizodu napretka; stabilna vrh preko rundi pokazuje na jedno usko mjesto.
Protokol runde koji možete zapravo pokrenuti
Izmjerena runda ima šest koraka i proizvodi jedan redak u knigu. Prva četiri su petlja; posljednje dvije čine je mjerenjem.
- 1Smrznite protokol evaluacije prije runde nula
Napišite početnu poziciju, položaj objekta, kamere, broj pokušaja, vremenski odmak i kriterij uspjeha. Fotografirati tablica. Ako se dokument mora promijeniti, serija počinje ispočetka.
- 2Izmjerite osnovu
Pokrenite protokol bez intervencija i zabilježite uspjehe; zatim pokrenite jedan instrumentirani sesiju s preuzimanjem omogućenim i zabilježite stopu. Ti su brojevi brojati runda nula.
- 3Prikupljajte ispravke u jednom konzistentnom stilu
Jedan ulazni način po rundi, jedan operater ako mogu to upravljati. Preuzmi kontrolu na kriterij možete izjaviti naglas - 'gripler više od dva centimetra od pristupa' - i držite je za rundu.
- 4Trijažirajte sve epizode isti dan
Ispravka, evaluacija ili odbaciti. Nejasne epizode dobivaju odbačen, ne spreman na teoriji koja više podataka pomoći - ispravka u koju ste sami zabrkali je lošija od bez epizode.
- 5Komponiranje mješavine eksplicitno
Originalni pokazi plus set ispravki, odabir epizode po izvoru. Zabilježite osnovni broj, broj ispravki i bilo koji ponderiranje - to je polje trebat će u tri sedmice.
- 6Nastaviti od checkpoint-a, zatim ponovno izmjerite
Trenira komponiranu dataset od prethodnog checkpoint-a umjesto osnovnog modela, pokrenite smrznuti protokol plus jedan instrumentirani sesiju, dodajte redak, i usporedite naspram prethodne dvije runde.
Dva ograničenja mijenjaju kako čitati slabu rundu. Nastavak od checkpoint inicijalizira težine od njega - ne optimizatora reume, tako da se raspored počinje svježe i kratko pokretanje iz konvergiran checkpoint može se premalo. I voditelj-poravnaj kretanje na početku preuzimanja ima najmanje mileage na stvarnom hardveru od bilo čega u lancu; ako ispravke sve počinju s čudnim prijelazom, gledaj tamo prije nego što krivi mješavinu.
Izmjerena petlja, već elektronski se radilo
ay-robots provodi ove šest koraka kao značajke proizvoda: preuzmi kontrolu srednje-pokretanja od strane voditelja ruke, tipkovnice ili klizača, s okvirima intervencije zastavičnim automatski; trijažirajte svaku epizodu kao ispravka, evaluacija ili odbaciti; komponirati sljedeći dataset od originalnih pokaza plus ispravke, odabir epizode eksplicitno po izvoru; i početi sljedeći trening pokretanja od prethodnog checkpoint-a umjesto osnovnog modela.
Vidi kako DAgger petlja radiŠto brojevi ne mogu reći vam
Ništa od toga nije riješeno, i uredno krivulja ne bi trebati vas persuadiro inače. Stopa intervencije mjeri zajedničkog sustava - politika, hardver, operater, soba - i pripisuje ništa po sebi. Ne može prosuditi je li ispravke bili dobri, i pada sretan na zadatku što je postao lakše jer se objekt pomakao dva centimetra bliži tijekom tri sedmice.
Ono što to čini je okrenuti nejasnu impresiju u stupac možete argumentirati s. Alternativa nije bolja metrika; to je tri sedmice prikupljanja ispravki krivulja bi vam rekla, nakon runde tri, da prestanu prikupljati. Literaturna pretraga definira interaktivno učenje iz opažanja kao ljudsku povratnu informaciju danu povremeno tijekom izvršavanja robota, što dozvoljava mrežu poboljšanja ponašanja; obitelj je široka, i nema rasporeda radi bez broja po rundi. Vidjeti isto SO-100 vođenje učenja iz opažanja za osnovni dataset koji miješate protiv, pokretanje politike za stranicu zaključivanja, i stranica DAgger petlje za primjenjenu cjevovodnju.
Je li stopa intervencije samo jedna minus stopa uspjeha?▾
Ne. Stopa mjeri koliko pokretanja ste preuzeli; stopa uspjeha mjeri je li zadatak gotov bez vas. Pokretanje može uspjeti s 30 posto stopa intervencije, i pokretanje bez intervencija može biti potpunog neuspješan. Oni se isto razlikuju u buku: stopa se glatko preko tisuća korelirani okviri, stopa uspjeha skače između rukohvat binarni ishodi. Logiranje oboje.
Koliko evaluacijskih pokušaja trebam da se stopa uspjeha znači bilo što?▾
Više nego što se čini razumno. Pod normalnom aproximacijom, 20 pokušaja na istinskom 60 posto stopa uspjeha nosi standardnu grešku blizu 11 postotnih bodova, tako da je 10-točka pokretanje između rundi je razlikovati od buke; 50 pokušaja donose taj broj na otprilike 7. Ako ne mogu priuštiti 50, čuvajte broj pokušaja identičan preko rundi i tretirati male kretanja kao neuspješni.
Koji omjer miješanja pokazima do ispravki trebam početi s?▾
Dokumentirana početa točka je IWR-eva: podijeliti podatci u intervenciju i ne-intervenciju uzorke i nacrtati ih u jednakom omjeru, tako da ispravke doprinose polovicu gradijenta koliko god mali dio okvira oni su. Ako vaša postavka ne može težiti uzorkovanju, približiti kroz epizode broji kada komponiranje dataset-a i zabilježiti omjer. Treniranje samo na ispravkama je opcija da se isključi.
Moja stopa intervencije je porasla nakon runde. Je runda gubljena?▾
Nije nužno, ali provjerite dosadnih pojašnjenja prvi: je li checkpoint vozio podudariti onaj trenirao, je li indeks kamere ili montaža promijenjena, je li položaj objekta pomaknut, je li stil ispravke konzistentan. Ako su svi četiri čisti i uparena stopa uspjeha isto padao, posumnjajte mješavinu - premalo osnovnih demonstracije naspram ispravki, ili ispravke što se međusobno kontradiraju. Pravi regresija pripada knjizi, ne smeću.
Mogu li preskočiti fiksnu postavku protokola i samo gledati stopu intervencije?▾
Samo ako prihvatite da ne možete reći napredak od habituacije. Stopa ovisi o vlastitoj stvarnom vremenu pragom za intervenciju, i taj prag pada kako navikli politike vrhunce. Smrznuta protokol je dio mjerenja vaš prag ne može dosegnuti - zalijepljene oznake, napisan početna pozicija, fiksni broj pokušaja, kriterij odlučio prije runde. Mora ostati nepromijenjena preko serije.
Čuvati dnevnik u repozitoriju, ne u bilježnici: runde su danima prema kraju, hardver se Gradi, i osoba čitanje krivulja u listopadu je ti s bez memorije Kolovoza. dokumentacija FAQ pokriva operativne detalje ostavljeni ovdje.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started