
Stopa intervencije - okviri intervencije podijeljeni s okvirima vožnje - najnegovanija je i najbrojnija mjera napretka koju ima ljudski kontrolirana DAgger petlja. Ovaj članak je definira tako da je dva čovjeka mogu izračunati istu vrijednost, pokazuje kako je zapisati, i prolazi kroz četiri načina na koja vas zavodi: navika operatora, pomicanja protokola evaluacije, treniranja samo na korekcijama i čovjeka koji korigira drugačije u utorak nego u ponedjeljak.
DAgger runda izgleda produktivna dok je u njoj. Vozite politiku, preuzimate kada fumla hvatanje, sprematе korekcije, ponovno trenirate, i sljedeća vožnja izgleda - zaklinjete se - malo glaća. Dvije runde kasnije ne možete reći je li se nešto promijenilo, jer "malo glaće" nije količina.
Petlja trebا jedan broj po rundi, i u ljudski kontroliranoj petlji taj broj je gotovo besplatan: udio vožnje tijekom kojeg ste imali kontrolu umjesto politike. Ovaj članak ga je definira tako da dva čovjeka mogu izračunati istu vrijednost, bilježi ga, čita rezultirajuću krivulju, i imenuje četiri načina na koja vas zavodi kada stoji sam. Za teoriju koju komad pretpostavlja, pogledajte objašnjenje DAgger-a i varijantu s ljudskom povratnom vezom; praktična parnjaka je pokretanje DAgger petlje na SO-100.
Kratka verzija
- •Stopa intervencije = okviri intervencije / okviri vožnje. Okviri, ne epizode, a nazivnik uključuje okvire koje ste potrošili na korekcije.
- •Ravna krivulja tijekom tri runde znači da runde ne kupuju ništa - umjesto toga promijenite smjesu, checkpoint ili zadatak.
- •Padajuća stopa intervencije nije rastući stopa uspješnosti. Vaša prag za ulazak se smanjuje jer se povjerenje raste.
- •Bez fiksnog protokola evaluacije - iste početne pozicije, objekti, kamere, broj pokusa - mjerite sobu.
- •Treniranje samo na korekcijama iskošava distribuciju stanja. Odgovor IWR-a: izvucite intervencije i ne-intervencije uzorke u jednakim proporcijama.
Zašto runda trebа broj uopće
DAgger postoji zbog problema distribucije, a problemi distribucije su nevidljivi oku. Ross i Bagnell su pokazali da učenje imitacijom na fiksnom skupu demonstracija vodi do složenih grešaka i granice regreta koja raste kvadratično s vremenskim horizontom: čim se učenik udalji od stanja koje je demonstrator posjetio, ništa u podacima mu ne govori kako se vratiti. DAgger to ispravlja iteracijom - pokrenite politiku, označite stanja koja posjeća, agregirajte, ponovno trenirajte - što Ross, Gordon i Bagnell uokviravaju kao smanjenje na no-regret online učenje.
Taj okvir ima posljedicu koju ljudi preskaču. Garancija se tiče niza politika tijekom iteracija, ne bilo koje pojedine vožnje. Ništa ne govori o tome je li vaša runda tri pomogla. Jedini način da znate je mjeriti svaku iteraciju. Kelly i kolege su predstavili HG-DAgger jer je klasični DAgger traži od stručnjaka etikete akcija dok je početnik još uvijek u kontroli, što članak argumentira može smanjiti sigurnost i, s ljudskim stručnjacima, vjerojatno će degradirati kvalitetu etikete kroz percipiranu zaostajanje aktuatora. HG-DAgger također uči prag sigurnosti za mjeru rizika temeljenu na nesigurnosti modela i izvještava o poboljšanoj performansi nad DAggerom i bihejvioralnim kloniranjem na zadatku vožnje. Ne objavljuje brojeve intervencija; te proizvodite sami.
Definiranje stope tako da dva čovjeka dobiju isti broj
Definicija je jedan redak: okviri intervencije podijeljeni s okvirima vožnje. Sve što je teško krije se u tome što se računa kao okvir i što se računa kao vožnja.
Okviri, ne epizode
Brojanje epizoda s najmanje jednom intervencijom je beskorisno: deset epizoda s jednim gurkanjem i deset gdje ste vozili osamdeset posto oboje daju "10/10". Broj okvira ih odvaja, i to je granularnost koju snimanje već ima - u formatu LeRobot skupa podataka svaki vremenski korak je redak, pa je zastavica intervencije jedan boolean stupac pored stanja i akcije. Ovdje je napisana po okviru u trenutku kada počne preuzimanje i očišćena kada se kontrola vrati.
Nazivnik uključuje korekcije
Dva nazivnika su obranljiva - ukupni okviri vožnje, ili okviri koje je politika vozila samostalno - i ozbiljno se razilaze pri visokim razinama intervencije. Preuzmi za 400 od 1000 okvira i prvi daje 40 posto, drugi 67 posto. Usporedba jedne runde izmjerene prvi put nasproti sljedeće izmjerene drugi način je kako se pravi napredak gubi. Uzmite ukupne okvire i nikad ne revidirajte izbor tijekom serije.
Odlučite jednom što se događa s okvirima predaje
Uvijek postoji šav. Kad se kontrola prosljeđuje, neki okviri pripadaju nitko: ruka je ponovno ostavljena, voditeljica se poravnava, snimanje je zamrznutu. U ovoj cjevovodu ti okviri predaje ostaju u sirovom strujanju i nikad ne ulaze u kuriranom epizodi - nisu ni ponašanje politike ni korekcija vrijedna treniranja. Brojite šav na isti način svaku rundu: pri 30 Hz, šest preuzimanja s dvosekundnim šavom svaki je 360 okvira, dovoljno za pomicanje točke postotka.
Okviri ili epizode; ukupna vožnja ili samo autonomna; okviri predaje u ili van. Bilo koji od tri promijenjeni tiho između rundi čine krivulju besmislenom. Napišite sva tri.
Zapisivanje ga kako bi broj preživio sesiju
Metrika u statusa panelu tekućeg procesa je očitanje: nestaje pri ponovno pokretanju i ne može biti iscrtana. Jedan samo-append redak po vožnji pokriva cijelu seriju - uključujući koji checkpoint ste vozili, budući da se to mijenja svakom rundom i miješanja ih invalidira što slijedi.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Dva polja nose težinu. train_mix je ono što ste hranili sljedećem poslu treniranja; bez toga ništa se ne može pripisati. eval_protocol imenuje fiksni test koji ste izvršili nakon, i je polje najčešće ostavljeno prazno. U cockpitu ay-robots status preuzimanja izvještava broj okvira intervencije za tekuću sesiju, pa je bilježenje transkripcija umjesto instrumentacije; dokumentacija skupa podataka pokriva gdje stupci po okviru slijeće.

Čitanje krivulje: tri runde, jedan zaključak
Tri runde je minimum za čitanje, jer su dvije točke uvijek linija. Donja tablica je predložak za prikaz s rezerviranim brojevima, ne mjerenjima iz bilo koje vožnje. Tražite monotono smanjenje koje se slaže s povećanjem uspjeha u fiksnom testu.
| Runda | Checkpoint vozen | Okviri | Okviri intervencije | Stopa | Uspjesi (od 20) |
|---|---|---|---|---|---|
| 0 (bazna) | bazna politika | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | iz smjese runde 0 | 5 610 | 980 | 17,5 % | 10 |
| 2 | iz smjese runde 1 | 5 412 | 611 | 11,3 % | 11 |
| 3 | iz smjese runde 2 | 5 380 | 598 | 11,1 % | 12 |
Runde jedan i dva rade posao. Runda tri ne: 11,3 nasuprot 11,1 posto je unutar varijacije od vožnje do vožnje bilo čega mjerenog na fizičkom ruku, i četvrta runda od iste korekcije troši popodne za ništa. Ravni segment kaže promijeniti nešto strukturno.
- Preostali neuspjesi nisu moguće ispraviti teleopilotnom - objekt nedostižan, geometrija grifera, zglob na granici. Korekcija podataka ne ispravlja kinematsku zid.
- Korekcije su premalo nasuprot baznom skupu podataka da pomaknu gradijent, i ništa ih ne ponderira.
- Korekcije se međusobno protivreče, pa politika prosječuje dvije strategije i slijeće između njih.
- Neuspjeh je nadolazak: kamera se premjestila, osvjetljenje je promijenjeno, pogled na zglob više ne odgovara treniranju.
- Zadatak je na stropu te klase politike na tom hardveru, i sljedeći korak su više baznih podataka.
Posljednja dva nisu neuspjesi petlje. U Sirius-Fleet opadajuća potreba za čovjekom je dizajnirana ishod: kako se autonomija robota poboljšava, njegovi anomalni predviđači prilagođavaju kriterije predviđanja, što vodi do manje zahtjeva za ljudskom intervencijom i postupno smanjuje ljudsku radnu opterećenja tijekom vremena. Tamo se kriterij prilagođava namjerno. U ruci petlje se vaš prilagođava tiho - pa stopa koja se poravnava jer je zadatak na stropu izgleda točno kao ona koja se poravnala jer je operator prestao primijetiti. Što je sljedeći problem.
Zamka 1: padajuća stopa nije rastući stopa uspješnosti
Stopa intervencije mjeri točno jednu stvar: koliko vožnje ste odlučili posjedovati. Ta odluka je vaša, donesena u realnom vremenu, i kreće se. U rundi nula preuzimate pri prvom lošem kutu pristupa; do runde tri ste gledali kako se politika oporavlja od tuceta njih i prepuštate joj da pokušа. Vaš prag se pomicao; politika se možda ne. Stopa pada bilo kako.
Ljudsko povjerenje je barem modelirana količina u literaturi umjesto pretpostavljene konstante. Sirius ponovno ponderira uzorke treniranja s približnim povjerenjem čovjeka i optimizira politiku s ponderirajućim bihejvioralnim kloniranjem, izvještavajući o 8 postotnom povečanju u simulaciji i 27 posto na stvarnom hardveru preko stanja tehnike u stopi uspješnosti politike, s dvostruko većom brzinom konvergencije. To tretira povjerenje kao težinu na podacima. Ne ispravlja prag u vašoj glavi između runde nula i runde tri.
Ne možete ukloniti pomicanje, pa uparite stopu s nečim što vaš prag ne može doseći: fiksni skup pokusa u kojima se ne miješate uopće, bodovani u kriterij napisan prije runde. Stopa koja pada dok parnjačka stopa uspješnosti stoji na mjestu je potpis navike - vrijedna hvatanja, jer iznutra petlje izgleda kao napredak.
| Stopa intervencije | Stopa uspješnosti na fiksnom protokolu | Najvjerojatnije čitanje |
|---|---|---|
| pada | raste | Runda je radila. Nastavite. |
| pada | ravna | Vaš prag se pomakao, ili su korekcije uklonile napor bez uklanjanja neuspjeha. |
| pada | pada | Korekcije degradiraju politiku. Provjerite smjesu i njihovu unutarnju konzistentnost. |
| ravna | ravna | Runda nije kupila ništa. Promijenite smjesu, checkpoint ili zadatak prije prikupljanja više. |
| raste | pada | Regresija. Sumnjajte na smjesu treniranja, promijenjenu kameru ili miješanje checkpointa prije sumnje metodi. |
Zamka 2: bez fiksnog protokola, mjerite sobu
Evaluacija stvarnog robota je skupna i teško se ponoviti. Autori SIMPLER motviraju simuliranu evaluaciju opazanjem da evaluacija stvarnog svijeta takvih politika nije skalabilna i suočava se s izazovima reproducibilnosti koji se vjerojatno će pogoršati kako politike prošire spektar zadataka. RoboArena napada ga s druge strane, s više od 600 parnih epizoda evaluacije stvarnog robota preko sedam generalistnih politika, izvršene evaluatorima na sedam akademskih institucija na DROID platformi. Njegovi evaluatori biraju svoje zadatke i okruženja ali moraju biti dvojako slijepi u procjeni parova politika; članak izvještava da je ovaj skupni ranking praćenja generalistnu politiku performansi točnije od konvencionalne, centralizirane evaluacije.
Nećete pokrenuti 600 parnih epizoda na jednom SO-100 u radionici. Ono što možete učiniti je ukloniti varijancu koju kontrolirate - popis dosadnu dovoljno da se obično preskaće.
| Dimenzija | Zamrznite ovo | Što se pomiče ako ne |
|---|---|---|
| Početna pozicija | Napisana početna pozicija, vozana prije svakog pokusa | Putanja počinje iz distribucije |
| Objekti | Označeni znakovi, i isti fizički objekti rezervirani za evaluaciju | "Bolja" politika je zapravo bliži objekt |
| Kamere i svjetlo | Ista prikupljanja, indeksi, izloženost; rolete zatvorene; fotografirajte postavku | Zamijenjeni samo indeksi kamera mogu dominirati rezultatom |
| Pokusi i pravilo zaustavljanja | Fiksno n, fiksni timeout, kriterij napisan prije runde | Post-hoc kriteriji pretvaraju blizu-promašaje u što god trebate |
| Ponašanje operatora | Bez intervencija tijekom pokusa evaluacije | Evaluacija postaje druga sesija korekcije |
Zatim aritmetika, nemilosrdna pri brojevima pokusa koju radionica može priuštiti. Prema normalnoj aproksimaciji, 60 posto uspjeha preko 20 pokusa nosi standardnu grešku blizu 11 postotnih točaka - kvadratni korijen 0,6 puta 0,4 nad 20 - i razlika između dviju takvih rundi nosi oko 15. Skok sa 60 na 70 posto je stoga u skladu s ničim što se dogodilo. Pedeset pokusa donose po-runda cifru na grubо 7 točaka, i koštaju popodne.
Ta asimetrija je argument za stopu intervencije: izračunatih preko tisuća okvira umjesto dvadeset binarnih ishoda, pomicа se ranije i glađe. Upozorenje je da su okviri unutar epizode teško korelirani - jedan loš hvat daje stotinu uzastopnih okvira intervencije - pa je učinkovita veličina uzorka bliža broju preuzimanja. Tretrajte stopu kao rani indikator i stopu uspješnosti kao sporu zemljanu istinu.
Epizode evaluacije nikad ne smiju ući u sastavljen skup podataka treniranja - inače je runda n+1 bodovana na podacima na kojima je trenirano, i krivulja mjeri memoripociju.
Zamka 3: treniranje samo na korekcijama savija politiku
Korekcije su zanimljivi podaci, pa je instinkt trenirati ih. Nemojte. Dolaze po konstrukciji iz uskog rezanja prostora stanja gdje je politika već bila neuspješna i govore gotovo ništa o većini vožnje koja je radila. Fino podešavanje samo na tom rezanju i dobijete politiku dobru za oporavak od zamršene pristupa koja je zaboravila kako učiniti čistim.
Mandlekar i kolege su izgradili svoj sustav udaljene intervencije oko toga. Njihov okvir: zadaci manipulacije sadržavaju uska mjesta koja zahtijevaju niz preciznih akcija - inseriranje pod u aparat za kavu je njihov primjer - gdje male devijacije vode u stanja koju demonstracije nisu pokrivale. Njihov algoritam treni iterativno na novim podacima kako bi se politika naučila prolaziti kroz ta uska mjesta, i oni izvještavaju da su agenti trenirani na podacima intervencije porazili agente trenirane na ekvivalentnom broju uzoraka od ne-intervencijalnih demonstratora.
- Brzo: kratka vožnja preko nekoliko tuceta epizoda je jeftina dovoljno za ponavljanje
- Ciljana: gradijent je dominiran od stanja koja vas zanimaju
- Jeftino za provjeru je li stil korekcije učljiv uopće
- Distribucija fino-podešavanja više ne oponaša distribuciju zadatka
- Nominalno ponašanje može degradirati vidljivo u jednoj rundu
- Stopa može padati dok padа uspjeh - čistos segmenti zamijenjeni za oporavke
Omjer miješanja je hiperparam etar i zaslužuje biti napisan. Sastavljanje sljedećeg skupa podataka je gdje se odlučuje: izvorne demonstracije plus skup korekcije, odabir epizode po izvoru umjesto pravila koja tiho vuče u što je dostupno. Ovdje je to jedan compose korak u cockpitu, i rezultat je običan skup podataka - pogledajte dokumentaciju treniranja. Što niti jedan alat ne radi za vas je bilježenje koji je omjer proizveo koju krivulju.
Zamka 4: čovjek nije konzistentan stručnjak
Teorija DAgger-a pretpostavlja stručnjaka. Vi niste u tehničkom smislu: vaše korekcije nisu uzorci iz fiksne uvjetne distribucije nad akcijama. Autori ACT to imenuju kada popisuju prepreke finom manipulaciji - greške se složuju tijekom vremena, i ljudske demonstracije mogu biti nestacionarne. Njihov sustav još uvijek dostiže 80 do 90 posto uspjeha na šest stvarnih zadataka iz deset minuta demonstracija, pa problem je traktabilan, ne odsutan.
Studija robomimic čini točku s strane podataka. Preko šest izvanmrežnih algoritama na pet simuliranih i tri stvarnih multistage zadataka, njene lekcije uključuju osjetljivost na izbore dizajna, ovisnost o kvaliteti demonstracije, i - ona koja najviše boli ovdje - varijabilnost koja proizlazi iz kriterija zaustavljanja, jer se ciljevi treniranja i evaluacije razlikuju. Checkpoint s najnižom gubitkom nije pouzdano onaj s najvećom stopom uspješnosti.
Postoji verzija hardvera toga: način unosa oblikuje korekciju. A vodilja-pratilac postavka proizvodi kontinuirane, ljudski tempira putanje. Tipkovnice nudge su teško zaključane serverom - dva stupnja po pozivu na zglobovima ramena, četiri na greifera - pa ista namera stigne kao stubište malih koraka. Klizači šalju apsolutne ciljeve i server se može pomicati najviše šest stupnjeva prema njima po pozivu. Tri moda, tri akcijske distribucije; miješanje sve tri u jedan skup korekcije i zatim pitanje zašto je pristup postao krznast je samo infligirano. dokumentacija teleopilotiranja pokriva što svaki način šalje.
Ponderiranje intervencija: IWR i što je došlo poslije
Ako su korekcije cijenjeni manjini, principizirani ispravka je težina umjesto isključivosti. Intervention Weighted Regression je referentna implementacija: podaci se dijele na intervencije i ne-intervencije uzorke, i dva particija se uzorkuju u jednakim proporcijama tijekom treniranja. Skup korekcije koji je pet posto okvira tada pridonosi polovici gradijenta, bez nominalne ponašanja nestajanja iz distribucije.
Jednaka proporcija je početna točka, ne zakon. Sirius ga generalizira zamjenom binarne particije s kontinuiranom težinom iz približnog povjerenja čovjeka; Sirius-Fleet pomiče odluku nadolazak, koristeći vizualni svjetski model i anomalne predviđače da odluče kad se čovjek traži uopće. Zajednička nit: zastavica intervencije je signala treniranja, ne samo stupca prikaza.
| Metoda | Tko odlučuje kad čovjek djeluje | Kako se koriste podaci intervencije | Izvješteni rezultat |
|---|---|---|---|
| DAgger (2011) | Fiksni raspored; stručnjak označava posjećena stanja | Jedan rastući skup podataka, neponderiran | Uokvirano kao smanjenje na no-regret online učenje |
| HG-DAgger (2019) | Čovjek, vrata kontrola na stvarnom sustavu | Agregirani; plus naučeni prag sigurnosti na nesigurnosti modela | Bolje od DAgger-a i BC na vožnji; broj intervencija nije dat |
| IWR (2020) | Čovjek, preko daljinskog teleopilotiranja | Intervencije i ne-intervencije uzorci izvučeni u jednakim proporcijama | Poražava ne-intervencijske demos pri jednakom broju uzoraka |
| Sirius (2022) | Čovjek, tijekom primjene | Ponderirana BC, težine iz približnog povjerenja čovjeka | 8% dobit u simulaciji, 27% na stvarnom hardveru; 2x brža konvergencija |
| ThriftyDAgger (2021) | Sustav, vrata na novosti i riziku | Interaktivno prikupljanje pod budžetom nadzora | Korisničko istraživanje (N=10): 58% viša čovjeka i 80% viša performansa robota od sljedećeg najboljeg načina |
| Fleet-DAgger (2022) | Sustav, dodjela pažnje preko flote | Učenje flote bodovano po povratku na ljudski napor | Do 8,8x viši ROHE od baznih linija |
| Sirius-Fleet (2024) | Anomalni predviđači s samoprilagođavajućim kriterijima | Učenje više zadataka s vizualnim svjetskim modelom | Manje zahtjeve za intervencijom kako se autonomija poboljšava |

Četiri metrike vrijedne zapisivanja pored stope
- Preuzimanja po vožnji. Dvadeset kratkih korekcija i jedan dugačak daju sličnu stopu i opisuju različite politike - jedna krznata, jedna s jednom slijepom točkom.
- Srednje intervencije duljina. Rastući duljina s padajućim brojem znači da preostali neuspjesi su teški, što je to što pozni napredak izgleda.
- Vrijeme do prve intervencije. Politika koja ide dalje prije nego što trebа pomoć se poboljšava čak i kada je ukupna stopa ravna.
- Gdje se intervencije skupljaju. Bin zastavicu normalnom epizode napretka; stabilni vršac kroz runde pokazuje na jedan uski dio.
Protokol runde koji zapravo možete pokrenuti
Mjerena runda ima šest koraka i proizvodi jedan redak u dnevniku. Prva četiri su petlja; zadnja dva je čine mjerenjem.
- 1Zamrznite protokol evaluacije prije runde nula
Napišite početnu poziciju, postavljanje objekta, kamere, broj pokusa, timeout i kriterij uspjeha. Fotografirajte stol. Ako se dokument mora promijeniti, serija se počinje iznova.
- 2Mjerenje bazne linije
Pokrenite protokol bez intervencija i snimite uspjehe; zatim pokrenite jednu instrumentiranu sesiju s omogućenim preuzimanjem i snimite stopu. Ta dva broja su runda nula.
- 3Prikupljanje korekcija u jednom konzistentnom stilu
Jedan način unosa po rundu, jedan operator ako možete upravljati. Preuzmi pod kriterijima koji možete izjasniti naglas - 'grifera više nego dva centimetra izvan pri pristupu' - i drži ga za rundu.
- 4Triage svaka epizoda istoga dana
Korekcija, evaluacija ili odbacivanje. Ambiguozne epizode se odbacuju, ne čuvaju na teoriji da više podataka pomaže - korekcija u kojoj ste se sami fumali je gora nego bez epizode.
- 5Sastavite smjesu eksplicitno
Izvorne demonstracije plus korekcije, odabir epizode po izvoru. Snimite bazni broj, broj korekcije i bilo koju ponderaciju - ovo je polje koje ćete htjeti za tri tjedna.
- 6Nastavite od checkpointa, zatim ponovno mjerenje
Trenirajte sastavljen skup podataka od prethodnog checkpointa umjesto baznog modela, pokrenite zamrznutu protokol plus jednu instrumentiranu sesiju, dodajte red, i usporedite nasuprot prethodnim dvjema rundama.
Dva ograničenja mijenjaju kako čitate slabu rundu. Nastavak od checkpointa inicijalizira težine od njega - ne rezime optimizera, pa se raspored počinje svježe i kratka vožnja od konvergiranog checkpointa može pomicati vrlo malo. I preusmjeravanje vodilja na početku preuzimanja ima najmanje milje na stvarnom hardveru od bilo čega u lancu; ako se sve korekcije počinju s čudnim tranzijentnom, pogledajte tamo prije nego što krive smjesu.
Mjerena petlja, već povezana
ay-robots primjenjuje ovih šest koraka kao značajke proizvoda: preuzimanje srednje-vožnje od vodilja, tipkovnice ili klizača, s okvirima intervencije označenim automatski; triage svaka epizoda kao korekcija, evaluacija ili odbacivanje; sastaviti sljedećeg skupa podataka iz izvornih demonstracija plus korekcije, odabir epizode eksplicitan po izvoru; i pokrenuti sljedećeg posla treniranja od prethodnog checkpointa umjesto baznog modela.
Vidjeti kako DAgger petlja radiŠto brojevi ne mogu vam reći
Nič od toga nije riješeno, i uredna krivulja vas ne bi trebala ubjediti drugačije. Stopa intervencije mjeri zajedničkog sustava - politiku, hardver, operatora, sobu - i ništa ne pripisuje samo. Ne može prosuditi bile li korekcije dobre, i padbit će sretno na zadatku koji je postao lakši jer se objekt pomakuo dva centimetra bliže tijekom tri tjedna.
Ono što radi je okrenuti nejasnu impresiju u stupac sa kojim možete raspravljati. Alternativa nije bolja metrika; to su tri tjedna prikupljanja korekcije koju bi vam krivulja rekla, nakon runde tri, da prestanete prikupljati. Studija literature definira interaktivno učenje imitacijom kao ljudsku povratnu vezu danom povremeno tijekom izvršavanja robota, omogućavajući internetsku poboljšanu ponašanja; obitelj je široka, i nikakav raspored toga ne radi bez broja po rundu. Pogledajte i vodič učenja imitacijom SO-100 za bazni skup podataka koji miješate, pokretanje politike za stranu zaključivanja, i stranica DAgger petlje za provedenu cjevovodu.
Je li stopa intervencije samo jedan minus stopa uspješnosti?▾
Ne. Stopa mjeri koliko vožnje ste preuzeli; stopa uspješnosti mjeri je li zadatak izvršen bez vas. Vožnja može uspjeti s 30 posto stopom intervencije, i vožnja bez intervencija može potpuno neuspješno. Razlikuju se i u bučnosti: stopa se glatko pomicа preko tisuća korelirane okvire, stopa uspješnosti skače između manje kosti binarnih ishoda. Bilježi oboje.
Koliko pokusa evaluacije trebam da stopa uspješnosti znači nešto?▾
Više nego što se čini razumno. Prema normalnoj aproksimaciji, 20 pokusa s pravom stopom uspjeha od 60 posto nosi standardnu grešku blizu 11 postotnih točaka, pa je 10-točkasti pokret između rundi neizbježan od buke; 50 pokusa donese tu cifru na grubо 7. Ako ne možete priuštiti 50, čuvajte broj pokusa identičan kroz runde i tretrajte male pokrete kao neodlučne.
Koji omjer miješanja demonstracija korekcijama trebam početi?▾
Dokumentirana početna točka je od IWR-a: particija podaci u intervencije i ne-intervencije uzorke i izvuci ih u jednakim proporcijama, pa korekcije doprinose polovici gradijenta bez obzira na mali dio okvira su. Ako vas postavka ne može ponderirati uzorkovanje, aproksimirajte je preko brojevima epizode tijekom sastavljanja skupa podataka i snimite omjer. Treniranje samo na korekcijama je opcija koju trebate otpisati.
Moja stopa intervencije je porasla nakon runde. Je li runda bačena?▾
Nije nužno, ali prvo provjerite dosadne objašnjenja: je li checkpoint koji ste vozili slagati onaj koji ste trenirani, je li indeks kamere ili montaža promijeniti, je li postavljanje objekta pomaklo, je li stil korekcije konzistentan. Ako su sva četiri čista i parnjačka stopa uspješnosti također je padala, sumnjajte na smjesu - premalo baznih demonstracija prema korekcijama, ili korekcije koje se međusobno protivreče. Pravi regresija pripada dnevniku, ne bin.
Mogu li preskočiti fiksni protokol evaluacije i samo gledati stopu intervencije?▾
Samo ako prihvatite da ne možete reći napredak od navike. Stopa ovisi o vašem vlastitom pragom realnog vremena za ulazak, i taj prag pada kako se navikavate na čudnoće politike. Zamrznuti protokol je dio mjerenja koji vaš prag ne može dosegnuti - označene oznake, napisana početna pozicija, fiksni broj pokusa, kriterij odlučen prije runde. Mora ostati nepromijenjen kroz seriju.
Čuvajte dnevnik u skladištu, ne u bilježnici: runde su dane razdvojene, hardver se ponovo gradi, i osoba koja čita krivulju u listopadu ste vi bez sjećanja na kolovoz. FAQ dokumentacija pokriva operacijske detalje ostavljene van ovdje.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started