Radni prostor robotske table kakav se koristi kao fiksna evaluacijska postavka za ponovljeno pokretanje politike
DAggerEvaluacijaUčenje ImitacijomRobusni PodaciSO-100

Merenje DAgger Petlje: Stopa Intervencije, Protokol Evaluacije i Zamke Između

AY-Robots ResearchAugust 27, 2026čitanje od 15 minuta

Stopa intervencije - okviri intervencije podeljeni sa okvirima trčanja - je najjeftiniji pošten signal napretka koji ima humano-gated DAgger petlja. Ovaj članak je definiše tako da dva čoveka izračuna istu vrednost, pokazuje kako ga da loguje, i radi kroz četiri načina na koja vas zavodi: navika operatora, drifting evaluacijskih postavki, trening samo na korekcijama, i čovek koji koriguje drugačije u utorak nego u ponedeljak.

DAgger kolo deluje produktivno dok ste u njemu. Vozite politiku, preuzimate je kada se zajeca za hvatač, čuvate korekcije, retrenirate, i sledeće trčanje izgleda - mogu da se zakunem - malo glađe. Dva kola kasnije ne možete da kažete da se nešto promenilo, jer "malo glađe" nije količina.

Petlja treba jedan broj po kolu, i u humano-gated petlji taj broj je skoro besplatan: udio trčanja tokom kojeg ste vi imali kontrolu umesto politike. Ovaj članak je definiše tako da dva čoveka izračuna istu vrednost, loguje je, čita rezultujuću krivu, i imenuje četiri načina na koja vas zavodi kada stoji sama. Za teoriju koju ovaj članak pretpostavlja, vidite DAgger objašnjenje i humano-gated varijantu; praktični parnjak je pokretanje DAgger petlje na SO-100.

Kratka verzija

  • Stopa intervencije = okviri intervencije / okviri trčanja. Okviri, ne episode, i imenilac uključuje okvire koje ste potrošili na korekcije.
  • Ravna kriva tokom tri kola znači da kola ne kupuju ništa - promenite mešavinu, checkpoint ili zadatak umesto prikupljanja četvrtog.
  • Padajuća stopa intervencije nije rastući stopa uspeha. Vaš prag za intervenciju se spušta prema dolje kako raste poverenje.
  • Bez zamrznutog protokola evaluacije - iste početne pozicije, objekti, kamere, broj pokušaja - mersite sobas.
  • Trening samo na korekcijama iskrivljuje raspodelu stanja. IWR odgovor: crtajte intervencijske i ne-intervencijske uzorke u jednakim proporcijama.

Zašto kolo treba broj uopšte

DAgger postoji zbog problema sa distribucijom, a problemi sa distribucijom su nevidljivi oku. Ross i Bagnell su pokazali da učenje imitacijom na fiksnom skupu demonstracija vodi do složenih grešaka i regret bound-a koji raste kvadratno sa vremenskim horizontom: čim učenik napusti stanja koja je demonstrator posjetio, ništa u podacima mu ne govori kako da se vrati. DAgger ovo ispravlja iteracijom - pokrenite politiku, označite stanja koja poseti, agregirajte, retrenirajte - što Ross, Gordon i Bagnell opisuju kao redukciju na no-regret online učenje.

Ta formulacija ima posledicu koju ljudi preskaču. Garancija se tiče sekvence politika kroz iteracije, ne bilo kojeg pojedinačnog trčanja. Ne kaže ništa o tome da li vaše kolo tri je pomoglo. Jedini način da znate je da merite svaku iteraciju. Kelly i kolege su predstavili HG-DAgger jer klasični DAgger pita eksperta za oznake akcija dok je početnik još u kontroli, što rad argumentuje može smanjiti bezbednost i, sa ljudskim stručnjacima, verovatno će degradirati kvalitet oznaka kroz percipiranu latenciju aktuatora. HG-DAgger takođe uči prag bezbednosti za metriku rizika zasnovanu na neizvesnosti modela i izveštava poboljšanu performansu kako nad DAgger tako i nad ponašajnim kloniranjem na zadatku vožnje. Ne objavljuje brojeve intervencija; te vi proizvodite sami.

Definisanje stope tako da dva čoveka dobiju isti broj

Definicija je jedan red: okviri intervencije podeljeni sa okvirima trčanja. Sve teško se skriva u onome što se računa kao okvir i šta se računa kao trčanje.

Okviri, ne episode

Brojanje episoda sa najmanje jednom intervencijom je beskorisno: deset episoda sa jednim pokretanjem i deset u kojima ste vozili osamdeset procenata obe daju "10/10". Broj okvira ih odvaja, i to je granularnost koju snimanje već ima - u LeRobot formatu skupa podataka svaki vremenski korak je red, tako da je zastavica intervencije jedna booleova kolona pored stanja i akcije. Ovde se piše po okvirou čim preuzimanje počne i briše se kada se kontrola vraća.

Imenilac uključuje korekcije

Dva imeoca su branljiva - ukupni okviri trčanja, ili okviri koje je politika vozila autonomno - i oni se drastično razilaze na visokim nivoima intervencije. Preuzmi za 400 od 1000 okvira i prvi daje 40 procenata, drugi 67 procenata. Poređenje jednog kola merenog na prvi način sa sledećim merenim na drugi način je kako pravi napredak nestaje. Uzmi ukupne okvire i nikada ne ponovi izbor mid-serije.

Odlučite jednom šta se dešava sa okvirima preuzimanja

Uvek postoji šav. Kada se kontrola prebaci, neki okviri pripadaju nijednoj strani: ruka je držana, lider se poravnava, snimanje je zamrznuto. U ovoj strukturi ti okviri preuzimanja ostaju u sirovu toku i nikada ne ulaze u kuriranog episodu - nisu ni ponašanje politike ni korekcija vredna treninga. Računajte šav na isti način svako kolo: na 30 Hz, šest preuzimanja sa dvosekunom šavom svaki je 360 okvira, dovoljno da pomeri točku procenta.

Tri odluke koje prekidaju poredivost

Okviri ili episode; ukupno trčanje ili samo autonomno; okviri preuzimanja unutar ili van. Bilo koji od tri promenjena tiho između kola čini krivu beznačajnom. Napišite sva tri.

Logovanje ga tako da broj preživi sesiju

Metrika u statusnoj paneli pokrenute procesa je čitanje: nestaje pri restartanju i ne može se crtati. Jedan append-only red po trčanju pokriva celu seriju - uključujući koji checkpoint ste vozili, jer se to menja svako kolo i miješanje ih poništava šta sledi.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Jedan red po trčanju. Evidentiranje imenioca i konvencije preuzimanja pored broja je važnije nego imena polja.

Dva polja nose težinu. train_mix je ono što ste dali sledeće trenažne posle; bez toga ništa se ne može pripisati. eval_protocol imenuje fiksni test koji ste pokrenuli nakon, i je polje koje se najčešće ostavi prazno. U ay-robots kokpitu status preuzimanja izveštava broj intervencijskih okvira za tekuću sesiju, tako da je logovanje transkripcija umesto instrumentacije; dokumentacija skupa podataka pokriva gde per-frame kolone dopiru.

Matrica konfiguracije treninga koja prikazuje politike, skupove podataka i checkpoint-e pored sebe
Svako kolo menja checkpoint i miješavinu skupa podataka. Broj čija kombinacija nije zabeležena ne može biti atribuirana.

Čitanje krive: tri kola, jedan zaključak

Tri kola je minimum za čitanje, jer dve tačke su uvek linija. Tabela ispod je šablon za ažuriranje sa brojevima zamena, ne merenjima iz bilo kojeg trčanja. Tražite monotono smanjenje usklađeno sa povećanjem uspeha na fiksnom testu.

KoloCheckpoint voženOkviriOkviri intervencijeStopaUspesi (od 20)
0 (bazna)bazna politika5 9001 38023,4 %7
1iz kola 0 miješavine5 61098017,5 %10
2iz kola 1 miješavine5 41261111,3 %11
3iz kola 2 miješavine5 38059811,1 %12

Kola jedan i dva rade posao. Kolo tri nije: 11,3 naspram 11,1 procenata je unutar varijacije run-to-run svega što se meri na fizičkom ruku, i četvrto kolo istih korekcija provodi popodne za ništa. Ravni segment kaže promeni nešto strukturalno.

  • Preostali neuspesi nisu ispravljivi teleoperacijom - objekat van domaćaja, geometrija hvatača, zglobovi na njegovoj granici. Nema podataka korekcije koji popravljaju kinematski zid.
  • Korekcije su premalo naspram baznog skupa podataka da pomere gradijent, i ništa ih ne ponderira.
  • Korekcije se međusobno protivreče, tako da politika usrednjava dve strategije i sliće između njih.
  • Neuspeh je uzvodno: kamera se pomaknula, osvjetljenje se promenilo, pogled ručnog zgloba više ne odgovara treningu.
  • Zadatak je na stropu ove klase politike na ovom hardveru, i sledeći korak je više osnovnih podataka.

Poslednjih dva nisu neuspesi petlje. U Sirius-Fleet opadajuća potreba za čovekom je dizajniran ishod: kako se robotska autonomija poboljšava, njene anomalije prediktor prilagođavaju svoje kriterijume predviđanja, što vodi manje zahteve za ljudskom intervencijom i postepeno smanjuje teško teško tokom vremena. Tamo je kriterijum namerno prilagođava. U ručnoj petlji vaša se takođe prilagođava, tiho - tako da stopa koja splošnava jer je zadatak na njegovoj granici izgleda tačno kao jedna koja je splošnala jer je operater prestao da primećuje. Što je sledeći problem.

Zamka 1: padajuća stopa nije rastući stopa uspeha

Stopa intervencije meri tačno jednu stvar: koliko ste bili od trčanja da se vlastitite. Ta odluka je vaša, doneta u realnom vremenu, i pomera se. U kolu nula vi preuzimate pri prvom lošem uglu pristupa; do kola tri ste pogledali kako politika oporavlja od tuceta njih i vi dozvolite da pokuša. Vaš prag se pomerio; politika verovatno ne. Stopa pada svakako.

Ljudsko poverenje je barem modelirana količina u literaturi umesto pretpostavljene konstante. Sirius prerenira uzorke treninga sa aproksimiranim ljudskim poverenjem i optimizuje politiku sa ponderiranim ponašajnim kloniranjem, izveštavajući 8 procenata povećanja u simulaciji i 27 procenata na realnom hardveru preko state of the art-a u stopi uspeha politike, na dvostruko bržoj konvergenciji. To tretira poverenje kao težina na podacima. Ne koriguje prag u vašoj glavi između kola nula i kola tri.

Ne možete ukloniti drift, tako da uparrite stopu sa nečim što vaš prag ne može dodirnuti: fiksni skup pokušaja u kojem se uopšte ne mešate, postignuti naspram kriterijuma napisanog pre kola. Stopa koja pada dok uparjena stopa uspeha ostaje je potpis habitacije - vredna hvatanja, jer sa unutar petlje deluje kao napredak.

Stopa intervencijeStopa uspeha na fiksnom protokoluNajverovatnije čitanje
padarasteKolo je radilo. Nastavite.
padaravnoVaš prag je drifted, ili su korekcije uklonile trud bez uklanjanja neuspehima.
padapadaKorekcije degradiraju politiku. Proverite mešavinu i njihovu internu konzistenciju.
ravnoravnoKolo nije kupilo ništa. Mešavinu, checkpoint ili zadatak promenite pre prikupljanja više.
rastepadaRegresija. Posumnjajte u miješavinu treninga, promenjenu kameru ili miješavinu checkpoint-a pre nego što posumnjajte u metodu.

Zamka 2: bez fiksnog protokola, mersite sobas

Evaluacija realnog robota je skupna i teško se ponavlja. SIMPLER autori su motivirani simuliranom evaluacijom sa opažanjem da real-world evaluacija takvih politika nije skalabilna i suočava se sa problemima reproducibilnosti koji će verovatno biti gori kako politike šire njihov spektar zadatka. RoboArena ga napada sa druge strane, sa više od 600 pairwise real-robot evaluacijskih episoda tokom sedam generalistnih politika, koje vode evaluatori na sedam akademskih institucija na DROID platformi. Njegovi evaluatori biraju svoje vlastite zadatke i okoline ali moraju suditi parove politika duplo-slepi; rad izveštava da ova crowd-sourced rangiranja prate performansu generalistne-politike tačnije nego konvencionalne, centralizovane evaluacije.

Ne ćete pokrenuti 600 uparenih episoda na jednoj SO-100 u radionici. Šta možete da uradite je ukloniti varijansu koju kontrolirate - listu dosadnu dovoljno da se obično preskoči.

DimenzijaZamrzni ovoŠta drfts ako se ne
Početna pozicijaPisana kućna pozicija, vozena pre svakog pokušajaTrajektorija počinje van distribucije
ObjektiOznačena žigom mesta, i isti fizički objekti rezervisani za evaluacijuBolja politika je zapravo bliži objekat
Kamere i svetloIsta montaža, indeksi, ekspozicija; žaluzine zatvorene; fotografuj postavkuZamenjeni indeksi kamera sami mogu dominirati rezultatom
Pokušaji i pravilo zaustavljanjaFiksni n, fiksni timeout, kriterijum napisan pre kolaPost-hoc kriterijumi pretvaraju blizu-promaše u sve što trebate
Ponašanje operateraNema intervencija tokom pokušaja evaluacijeEvaluacija postaje druga sesija korekcije

Zatim aritmetika, nemilosrdna na brojeve pokušaja koje radionica može priuštiti. Pod normalnom aproksimacijom, 60 procenata uspeha tokom 20 pokušaja ima standardnu grešku blizu 11 procentnih poena - kvadratni koren od 0,6 puta 0,4 tokom 20 - i razlika između dva takva kola nosi oko 15. Skok sa 60 na 70 procenata je stoga konzistentan sa ništa što se desilo. Pedeset pokušaja donosi per-round broj na grubo 7 poena, i košta popodne.

Ova asimetrija je argument za stopu intervencije: izračunatu tokom hiljada okvira umesto dvadeset binarnih ishoda, ona se pomera ranije i glatko. Upozorenje je da su okviri unutar episode teško korelisani - jedan loš isceljenje daje stotinu uzastopnih okvira intervencije - tako da je efektivna veličina uzorka bliža broju preuzimanja. Tretirajte stopu kao rani indikator i stopu uspeha kao spora osnovna istina.

Drži evaluacijske episode van trenažnog bazena

Evaluacijske episode nikada ne smeju ući u komponovani skup podataka treninga - inače je kolo n+1 postignuto na podacima koje je obučavano, i kriva meri memorizaciju.

Zamka 3: trening samo na korekcijama sviđa politiku

Korekcije su interesantni podaci, tako da instinkt je da trenirate na njima. Ne. Dolaze po konstrukciji iz uskog sloja prostora stanja gde je politika već bila neuspešna i kažu skoro ništa o većini trčanja koje je radilo. Fine-tune na том sloju samo i dobijate politiku dobru na oporavku od promašenog pristupa koja je zaboravila kako da napravi čistu.

Mandlekar i kolege su izgradili svoj sistem daljinske intervencije oko ovoga. Njihova formulacija: zadaci manipulacije sadrže grla regije koja zahtevaju sekvencu preciznih akcija - umešavanje kapsule u aparat za kavu je njihov primer - gde male devijacije vode u stanja koja demonstracije nikada nisu pokrivale. Njihov algoritam trenira iterativno na nove podatke tako da politika nauči da prelazi ta grla, i oni izveštavaju da ageniti obučeni na podacima intervencije pobeđuju agente obučene na ekvivalentnom broju uzoraka od non-intervencijskih demonstratora.

Samo korekcije fine-tuning nasuprot kompozitnoj miješavini
Šta korekcije-samo dobija
  • Brzo: kratko trčanje tokom nekoliko deset episoda je dovoljno jeftino da se ponovi
  • Ciljano: gradijent je dominiran stanjima koja vam je stalo
  • Jeftino za testiranje da li je stil korekcije učljiv uopšte
Šta ga košta
  • Distribucija fine-tune više ne naliči na distribuciju zadatka
  • Nominalno ponašanje može degradirati vidljivo unutar jednog kola
  • Stopa može pasti dok uspeh pada sa njom - čiste segmente zamenjene za oporavke

Omjer miješanja je hipeparametar i zaslužuje da bude napisan. Kompajliranje sledećeg skupa podataka je gde je odlučeno: originalne demonstracije plus skup korekcija, izbor episode po izvoru umesto pravila koja tiho vučevršavaju šta je dostupno. Tamo je jedan koraku u kokpitu, i rezultat je običan skup podataka - vidite dokumentaciju treninga. Šta nijedan alat ne radi za vas je snimanje koji omjer proizvodio koju krivu.

Zamka 4: čovek nije dosledan stručnjak

DAgger teorija pretpostavlja eksperta. Vi niste jedan u tehničkom smislu: vaše korekcije nisu uzorci iz fiksne uslovne distribucije preko akcija. ACT autori to nazivaju kada nabraja prepreke fini manipulaciji - greške se kompajliraju tokom vremena, i ljudske demonstracije mogu biti ne-stacionarne. Njihov sistem i dalje dostiže 80 do 90 procenata uspeha na šest pravih zadataka iz deset minuta demonstracija, tako da problem nije nerešavajući, nije odsutan.

Robomimic studija čini tačku sa strane podataka. Tokom šest offlajn algoritama na pet simulirane i tri real-world multi-stage zadatka, njegove lekcije uključuju osjetljivost na izbore dizajna, zavisnost od kvaliteta demonstracije, i - ona koja najviše boli ovdje - varijabilnost nastala iz kriterijuma zaustavljanja, jer se ciljevi treninga i evaluacije razlikuju. Checkpoint sa najnižim gubitkom nije pouzdano onaj sa najvećim stopa uspeha.

Postoji verzija hardvera ovoga: mod unosa oblikuje korekciju. Podmešavanje lidera-sledbenika lider-sledilac postavka proizvodi neprekidne, ljudski tempovane trajektorije. Tastaturne nudge-e su čvrsto stegnute serverom - dva stepena po pozivu na zglobovima ruke, četiri na hvatačima - tako da se ista namena stigne kao stepenice od malih koraka. Klizači šalju apsolutne ciljeve i server se pomera najviše šest stepeni prema njima po pozivu. Tri moda, tri akcione distribucije; miješanje sve tri u jedan skup korekcija i zatim se čudi zašto je pristup postao nervnozan je samooštetan. teleoperacijske dokumentacije pokriva šta svaki mod šalje.

Pondering intervencije: IWR i šta je doslo nakon

Ako su korekcije dragocena manjina, načelan popravak je težina umesto isključivosti. Intervencija sa težinama Regression je referentna implementacija: podaci se dele na intervencijske i ne-intervencijske uzorke, i dva odeljenjenji se uzorkuju u jednakom omeru tokom treninga. Skup korekcija koji je pet procenata okvira zatim doprinosi polovini gradijenta, bez nominalnog ponašanja nestaje iz distribucije.

Jeddnakog omere je početna tačka, nije zakon. Sirius je generalizuje zamenom binarnog particionisanja sa neprekidnom težinom iz aproksimiranog ljudskog poverenja; Sirius-Fleet poteza odluku uzvodno, koristeći vizuelni svetski model i anomalije prediktore da odluči kada se čovek zove uopšte. Zajednička nit: zastavica intervencije je signal treninga, ne samo kolona ažuriranja.

MetodaKo odlučuje kada čovek delujeKako se koriste podaci intervencijeIzvešteni rezultat
DAgger (2011)Fiksni raspored; stručnjak označava posećena stanjaJedan rastuća skup podataka, neparametrisanOkvašen kao redukcija na no-regret online učenje
HG-DAgger (2019)Čovek, gating kontrolu na realnom sistemuAgregirano; plus naučeno prag bezbednosti na neizvesnosti modelaBolje od DAgger-a i BC na vožnji; nema intervencijskih brojeva dati
IWR (2020)Čovek, preko daljinske teleoperacijeIntervencijski i ne-intervencijski uzorci izvlačeni u jednakim proporcijamaUdara ne-intervencijske demonstre na ekvivalentnog broja uzoraka
Sirius (2022)Čovek, tokom raspoređivanjaPonderirana BC, težine iz aproksimiranog ljudskog poverenja8 % dobitak u simulaciji, 27 % na realnom hardveru; 2x brža konvergencija
ThriftyDAgger (2021)Sistem, gating na novelnost i rizikInteraktivna kolekcija pod budžetom supervizijeKorisnička studija (N=10): 58 % veće čovečanskog i 80 % veće robusne performanse nego sledeća najbolja metoda
Fleet-DAgger (2022)Sistem, dodeljivanja pažnje tokom floteFleet učenje postignuto sa Return on Human EffortDos do 8,8x veće ROHE od bazlina
Sirius-Fleet (2024)Anomalije prediktore sa samo-prilagođavanjem kriterijumaMulti-task učenje sa vizuelnim svetskim modelomManje zahteve intervencije kao autonomija poboljšava
Leaderboard prikaz poređenja robusnih politika po merenom rezultatu
Rangiranje politika jednu naspram druge znači nešto samo kada je svaki unos pokrenuo isti protokol. To se primenjuje i na vaša tri kola.

Četiri metrike vredne logovanja pored stope

  • Preuzimanja po trčanju. Dvadeset kratkih korekcija i jedan dugi daju sličnu stopu i opisuju različite politike - jedna nervna, jedna sa jednom mrtvom zonom.
  • Srednja dužina intervencije. Rastući dužina sa padajućim brojem znači da su preostali neuspesi teški, što je šta kasni napredak izgleda kao.
  • Vreme do prve intervencije. Politika koja dobija dalje pre nego što joj treba pomoć se poboljšava čak i kada je ukupna stopa ravna.
  • Gde se intervencije grupiraju. Bin zastavicu po normalizovanom napredku episode; stabilni vrh tokom kola pokazuje na jedno grlo.

Protokol kola koji zaista možete pokrenuti

Izmereno kolo ima šest koraka i proizvodi jedan red u dnevniku. Prva četiri su petlja; poslednja dva čine to merenja.

  1. 1
    Zamrzni protokol evaluacije pre kola nula

    Zapišite početnu poziciju, smeštaj objekta, kamere, broj pokušaja, timeout i kriterijum uspeha. Fotografiraj stol. Ako se dokument mora promeniti, serija se restartuje.

  2. 2
    Izmeri baznu

    Pokreni protokol bez intervencija i zabeleži uspehe; zatim pokreni jednu instrumentovanu sesiju sa preuzimanjem omogućenim i zabeleži stopu. Ona dva broja su kolo nula.

  3. 3
    Prikupljanja korekcije u jednom doslednom stilu

    Jedan mod unosa po kolu, jedan operater ako možete. Preuzmi na kriterijumom koji možete da napišete - 'hvatač više od dva centimetra od pristupa' - i drži ga za kolo.

  4. 4
    Triage svaku episodu isti dan

    Korekcija, evaluacija ili odbaci. Dvosistemske episode se odbacuju, ne čuvaju na teoriji da više podataka pomaže - korekcija u kojoj ste se vi sami prevario je gora nego bez episode.

  5. 5
    Komponuj miješavinu eksplicitno

    Originalne demonstracije plus korekcije, izbor episode po izvoru. Zabeleži bazni broj, broj korekcija i bilo koje ponderisanje - ovo je polje koje ćete hteti za tri nedelje.

  6. 6
    Nastavi od checkpoint-a, zatim re-meri

    Treniraj komponovani skup podataka od prethodnog checkpoint-a umesto baznog modela, pokreni zamrznut protokol plus jednu instrumentovanu sesiju, dodaj red, i poredi sa prethodna dva kola.

Dva ograničenja menjaju kako čitaš slabo kolo. Nastavak od checkpoint-a inicijalizuje težine od njega - ne optimizer resume, tako da se raspored počinje ispočetka i kratko trčanje od konvergiranog checkpoint-a može da se pomera veoma malo. I leader-align kretanje na početku preuzimanja ima najmanju kilometražu na realnom hardveru od svega u lancu; ako sve korekcije počinju sa čudan prolazak, pogledaj tamo pre nego što krivi miješavinu.

Izmerena petlja, već provodljiva

ay-robots primenjuje ova šest koraka kao karakteristike proizvoda: preuzimanja mid-run od lidera ruke, tastature ili klizača, sa zastavicama intervencije automatski flag-ane; triage svake episode kao korekcija, evaluacija ili odbaci; komponuj sledeći skup podataka od originalnih demonstracija plus korekcije, izbor episode eksplicitan po izvoru; i počni sledeći train trčanje od prethodnog checkpoint-a umesto baznog modela.

Vidite kako DAgger petlja radi

Šta brojevi ne mogu reći

Ništa od ovoga nije rešeno, i uredna kriva ne bi trebala da vas ubedi inače. Stopa intervencije meri zajednički sistem - politika, hardver, operater, soba - i atribuira ništa sama. Ne može suditi da li su korekcije bile dobre, i biće pada srećno na zadatku koji je postao lakši jer se objekat pomakao dva centimetra bliže tokom tri nedelje.

Šta to radi je promeniti nejasan keš u kolonu preko koje možete da se prepirujete. Alternativa nije bolja metrika; to je tri nedelje prikupljanja korekcija koje bi kriva rekla, posle kola tri, da prestane prikupljanje. Anketa literatura definiše interaktivno učenje imitacijom kao ljudsku povratnu informaciju datu povremeno tokom izvršenja robota, dozvoljava onlajn poboljšanje ponašanja; porodica je široka, i nema aranžmana od toga radi bez broja po kolu. Vidite takođe SO-100 vodič za učenje imitacijom za bazni skup podataka koji mešate naspram, pokretanje politike za stranu zaključka, i DAgger petlja stranica za prvobitnu vodu.

Da li je stopa intervencije samo jedan minus stopa uspeha?

Ne. Stopa meri koliko od trčanja ste preuzeli; stopa uspeha meri da li je zadatak završen bez vas. Trčanje može da uspe sa 30 procenata stopom intervencije, i trčanje bez intervencija može da propadne sasvim. Oni takođe se razlikuju u buku: stopa se glatko pomera tokom hiljada korelisanih okvira, stopa uspeha skače između nekoliko binarnih ishoda. Zapišite oba.

Koliko evaluacijskih pokušaja trebam da stopa uspeha znači nešto?

Više nego što se čini razumno. Pod normalnom aproksimacijom, 20 pokušaja u pravoj 60 procenata stopi uspeha nose standardnu grešku blizu 11 procentnih poena, tako da je 10-točak kretanje između kola nerazlikuje od buke; 50 pokušaja donosi taj broj na grubo 7. Ako ne možete priuštiti 50, drž broj pokušaja identičan tokom kola i tretirajte male kretanje kao neodlučna.

Koji omjer miješanja demonstracija za korekcije trebam da počnem sa?

Dokumentovana početna tačka je IWR-ova: particionuj podatke u intervencijske i ne-intervencijske uzorke i crtaj ih u jednakim omjerima, tako da korekcije doprinose polovini gradijenta bez obzira kako mali deo okvira su. Ako vaša postavka ne može težiti uzorkovanje, aproksimiraj kroz brojeve episode kompajliranja skupa podataka i zabeleži omjer. Trening samo na korekcijama je opcija koju treba da isključite.

Moja stopa intervencije je pošla gore posle kola. Da li je kolo izgubljeno?

Ne nužno, ali preproverite dosadne objašnjenje prvo: da li je checkpoint koji ste vozili poklapao se sa onim koji ste obučavali, da li je indeks kamere ili montaža promenjena, da li je smeštaj objekta driftovao, bio li stil korekcije dosledan. Ako su svi četiri čisti i uparena stopa uspeha takođe pao, posumnjajte miješavinu - premalo bazne demonstracije naspram korekcija, ili korekcije koje se međusobno protivreče. Pravi regresija pripada dnevniku, ne korpi.

Mogu li preskok fiksnog protokola evaluacije i samo gledanja stope intervencije?

Samo ako prihvatiš da ne možeš reći poboljšanje od habitacije. Stopa zavisi od vašeg sopstvenog realnog vremena praga za intervenciju, i taj prag pada kako se navikavate na čudos politike. Zamrznuta protokol je deo merenja da vaš prag ne može dodirnuti - označena mesta, napisana kućna pozicija, fiksni broj pokušaja, kriterijum odlučen pre kola. Mora da ostane nepromenjena tokom serije.

Drži dnevnik u repozitorijumu, ne u beležnici: kola su dana razdvojena, hardver se pregrađuje, i osoba koja čita krivu oktobra je vi bez uspomena avgusta. dokumentacije FAQ pokriva operativne detalje koje sam preskočio ovdje.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started