Radna površina robotskog stola vrste koja se koristi kao fiksna postavka evaluacije za ponovljene vožnje politike
DAggerEvaluacijaUčenje imitacijomPodaci robotaSO-100

Mjerenje DAgger petlje: Stopa intervencije, Protokol evaluacije i zamke između

AY-Robots ResearchAugust 27, 202615 min čitanja

Stopa intervencije - okviri intervencije podijeljeni s okvirima vožnje - najnegovanija je i najbrojnija mjera napretka koju ima ljudski kontrolirana DAgger petlja. Ovaj članak je definira tako da je dva čovjeka mogu izračunati istu vrijednost, pokazuje kako je zapisati, i prolazi kroz četiri načina na koja vas zavodi: navika operatora, pomicanja protokola evaluacije, treniranja samo na korekcijama i čovjeka koji korigira drugačije u utorak nego u ponedjeljak.

DAgger runda izgleda produktivna dok je u njoj. Vozite politiku, preuzimate kada fumla hvatanje, sprematе korekcije, ponovno trenirate, i sljedeća vožnja izgleda - zaklinjete se - malo glaća. Dvije runde kasnije ne možete reći je li se nešto promijenilo, jer "malo glaće" nije količina.

Petlja trebا jedan broj po rundi, i u ljudski kontroliranoj petlji taj broj je gotovo besplatan: udio vožnje tijekom kojeg ste imali kontrolu umjesto politike. Ovaj članak ga je definira tako da dva čovjeka mogu izračunati istu vrijednost, bilježi ga, čita rezultirajuću krivulju, i imenuje četiri načina na koja vas zavodi kada stoji sam. Za teoriju koju komad pretpostavlja, pogledajte objašnjenje DAgger-a i varijantu s ljudskom povratnom vezom; praktična parnjaka je pokretanje DAgger petlje na SO-100.

Kratka verzija

  • Stopa intervencije = okviri intervencije / okviri vožnje. Okviri, ne epizode, a nazivnik uključuje okvire koje ste potrošili na korekcije.
  • Ravna krivulja tijekom tri runde znači da runde ne kupuju ništa - umjesto toga promijenite smjesu, checkpoint ili zadatak.
  • Padajuća stopa intervencije nije rastući stopa uspješnosti. Vaša prag za ulazak se smanjuje jer se povjerenje raste.
  • Bez fiksnog protokola evaluacije - iste početne pozicije, objekti, kamere, broj pokusa - mjerite sobu.
  • Treniranje samo na korekcijama iskošava distribuciju stanja. Odgovor IWR-a: izvucite intervencije i ne-intervencije uzorke u jednakim proporcijama.

Zašto runda trebа broj uopće

DAgger postoji zbog problema distribucije, a problemi distribucije su nevidljivi oku. Ross i Bagnell su pokazali da učenje imitacijom na fiksnom skupu demonstracija vodi do složenih grešaka i granice regreta koja raste kvadratično s vremenskim horizontom: čim se učenik udalji od stanja koje je demonstrator posjetio, ništa u podacima mu ne govori kako se vratiti. DAgger to ispravlja iteracijom - pokrenite politiku, označite stanja koja posjeća, agregirajte, ponovno trenirajte - što Ross, Gordon i Bagnell uokviravaju kao smanjenje na no-regret online učenje.

Taj okvir ima posljedicu koju ljudi preskaču. Garancija se tiče niza politika tijekom iteracija, ne bilo koje pojedine vožnje. Ništa ne govori o tome je li vaša runda tri pomogla. Jedini način da znate je mjeriti svaku iteraciju. Kelly i kolege su predstavili HG-DAgger jer je klasični DAgger traži od stručnjaka etikete akcija dok je početnik još uvijek u kontroli, što članak argumentira može smanjiti sigurnost i, s ljudskim stručnjacima, vjerojatno će degradirati kvalitetu etikete kroz percipiranu zaostajanje aktuatora. HG-DAgger također uči prag sigurnosti za mjeru rizika temeljenu na nesigurnosti modela i izvještava o poboljšanoj performansi nad DAggerom i bihejvioralnim kloniranjem na zadatku vožnje. Ne objavljuje brojeve intervencija; te proizvodite sami.

Definiranje stope tako da dva čovjeka dobiju isti broj

Definicija je jedan redak: okviri intervencije podijeljeni s okvirima vožnje. Sve što je teško krije se u tome što se računa kao okvir i što se računa kao vožnja.

Okviri, ne epizode

Brojanje epizoda s najmanje jednom intervencijom je beskorisno: deset epizoda s jednim gurkanjem i deset gdje ste vozili osamdeset posto oboje daju "10/10". Broj okvira ih odvaja, i to je granularnost koju snimanje već ima - u formatu LeRobot skupa podataka svaki vremenski korak je redak, pa je zastavica intervencije jedan boolean stupac pored stanja i akcije. Ovdje je napisana po okviru u trenutku kada počne preuzimanje i očišćena kada se kontrola vrati.

Nazivnik uključuje korekcije

Dva nazivnika su obranljiva - ukupni okviri vožnje, ili okviri koje je politika vozila samostalno - i ozbiljno se razilaze pri visokim razinama intervencije. Preuzmi za 400 od 1000 okvira i prvi daje 40 posto, drugi 67 posto. Usporedba jedne runde izmjerene prvi put nasproti sljedeće izmjerene drugi način je kako se pravi napredak gubi. Uzmite ukupne okvire i nikad ne revidirajte izbor tijekom serije.

Odlučite jednom što se događa s okvirima predaje

Uvijek postoji šav. Kad se kontrola prosljeđuje, neki okviri pripadaju nitko: ruka je ponovno ostavljena, voditeljica se poravnava, snimanje je zamrznutu. U ovoj cjevovodu ti okviri predaje ostaju u sirovom strujanju i nikad ne ulaze u kuriranom epizodi - nisu ni ponašanje politike ni korekcija vrijedna treniranja. Brojite šav na isti način svaku rundu: pri 30 Hz, šest preuzimanja s dvosekundnim šavom svaki je 360 okvira, dovoljno za pomicanje točke postotka.

Tri odluke koje razbijaju usporedivost

Okviri ili epizode; ukupna vožnja ili samo autonomna; okviri predaje u ili van. Bilo koji od tri promijenjeni tiho između rundi čine krivulju besmislenom. Napišite sva tri.

Zapisivanje ga kako bi broj preživio sesiju

Metrika u statusa panelu tekućeg procesa je očitanje: nestaje pri ponovno pokretanju i ne može biti iscrtana. Jedan samo-append redak po vožnji pokriva cijelu seriju - uključujući koji checkpoint ste vozili, budući da se to mijenja svakom rundom i miješanja ih invalidira što slijedi.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Jedan redak po vožnji. Snimanje nazivnika i dogovora predaje pored broja važnije je od nazivaja polja.

Dva polja nose težinu. train_mix je ono što ste hranili sljedećem poslu treniranja; bez toga ništa se ne može pripisati. eval_protocol imenuje fiksni test koji ste izvršili nakon, i je polje najčešće ostavljeno prazno. U cockpitu ay-robots status preuzimanja izvještava broj okvira intervencije za tekuću sesiju, pa je bilježenje transkripcija umjesto instrumentacije; dokumentacija skupa podataka pokriva gdje stupci po okviru slijeće.

Matrica konfiguracije treniranja koja pokazuje politike, skupove podataka i checkpointove jedan pored drugoga
Svaka runda mijenja checkpoint i smjesu skupa podataka. Broj čija kombinacija nije zapisana ne može biti pripisana.

Čitanje krivulje: tri runde, jedan zaključak

Tri runde je minimum za čitanje, jer su dvije točke uvijek linija. Donja tablica je predložak za prikaz s rezerviranim brojevima, ne mjerenjima iz bilo koje vožnje. Tražite monotono smanjenje koje se slaže s povećanjem uspjeha u fiksnom testu.

RundaCheckpoint vozenOkviriOkviri intervencijeStopaUspjesi (od 20)
0 (bazna)bazna politika5 9001 38023,4 %7
1iz smjese runde 05 61098017,5 %10
2iz smjese runde 15 41261111,3 %11
3iz smjese runde 25 38059811,1 %12

Runde jedan i dva rade posao. Runda tri ne: 11,3 nasuprot 11,1 posto je unutar varijacije od vožnje do vožnje bilo čega mjerenog na fizičkom ruku, i četvrta runda od iste korekcije troši popodne za ništa. Ravni segment kaže promijeniti nešto strukturno.

  • Preostali neuspjesi nisu moguće ispraviti teleopilotnom - objekt nedostižan, geometrija grifera, zglob na granici. Korekcija podataka ne ispravlja kinematsku zid.
  • Korekcije su premalo nasuprot baznom skupu podataka da pomaknu gradijent, i ništa ih ne ponderira.
  • Korekcije se međusobno protivreče, pa politika prosječuje dvije strategije i slijeće između njih.
  • Neuspjeh je nadolazak: kamera se premjestila, osvjetljenje je promijenjeno, pogled na zglob više ne odgovara treniranju.
  • Zadatak je na stropu te klase politike na tom hardveru, i sljedeći korak su više baznih podataka.

Posljednja dva nisu neuspjesi petlje. U Sirius-Fleet opadajuća potreba za čovjekom je dizajnirana ishod: kako se autonomija robota poboljšava, njegovi anomalni predviđači prilagođavaju kriterije predviđanja, što vodi do manje zahtjeva za ljudskom intervencijom i postupno smanjuje ljudsku radnu opterećenja tijekom vremena. Tamo se kriterij prilagođava namjerno. U ruci petlje se vaš prilagođava tiho - pa stopa koja se poravnava jer je zadatak na stropu izgleda točno kao ona koja se poravnala jer je operator prestao primijetiti. Što je sljedeći problem.

Zamka 1: padajuća stopa nije rastući stopa uspješnosti

Stopa intervencije mjeri točno jednu stvar: koliko vožnje ste odlučili posjedovati. Ta odluka je vaša, donesena u realnom vremenu, i kreće se. U rundi nula preuzimate pri prvom lošem kutu pristupa; do runde tri ste gledali kako se politika oporavlja od tuceta njih i prepuštate joj da pokušа. Vaš prag se pomicao; politika se možda ne. Stopa pada bilo kako.

Ljudsko povjerenje je barem modelirana količina u literaturi umjesto pretpostavljene konstante. Sirius ponovno ponderira uzorke treniranja s približnim povjerenjem čovjeka i optimizira politiku s ponderirajućim bihejvioralnim kloniranjem, izvještavajući o 8 postotnom povečanju u simulaciji i 27 posto na stvarnom hardveru preko stanja tehnike u stopi uspješnosti politike, s dvostruko većom brzinom konvergencije. To tretira povjerenje kao težinu na podacima. Ne ispravlja prag u vašoj glavi između runde nula i runde tri.

Ne možete ukloniti pomicanje, pa uparite stopu s nečim što vaš prag ne može doseći: fiksni skup pokusa u kojima se ne miješate uopće, bodovani u kriterij napisan prije runde. Stopa koja pada dok parnjačka stopa uspješnosti stoji na mjestu je potpis navike - vrijedna hvatanja, jer iznutra petlje izgleda kao napredak.

Stopa intervencijeStopa uspješnosti na fiksnom protokoluNajvjerojatnije čitanje
padarasteRunda je radila. Nastavite.
padaravnaVaš prag se pomakao, ili su korekcije uklonile napor bez uklanjanja neuspjeha.
padapadaKorekcije degradiraju politiku. Provjerite smjesu i njihovu unutarnju konzistentnost.
ravnaravnaRunda nije kupila ništa. Promijenite smjesu, checkpoint ili zadatak prije prikupljanja više.
rastepadaRegresija. Sumnjajte na smjesu treniranja, promijenjenu kameru ili miješanje checkpointa prije sumnje metodi.

Zamka 2: bez fiksnog protokola, mjerite sobu

Evaluacija stvarnog robota je skupna i teško se ponoviti. Autori SIMPLER motviraju simuliranu evaluaciju opazanjem da evaluacija stvarnog svijeta takvih politika nije skalabilna i suočava se s izazovima reproducibilnosti koji se vjerojatno će pogoršati kako politike prošire spektar zadataka. RoboArena napada ga s druge strane, s više od 600 parnih epizoda evaluacije stvarnog robota preko sedam generalistnih politika, izvršene evaluatorima na sedam akademskih institucija na DROID platformi. Njegovi evaluatori biraju svoje zadatke i okruženja ali moraju biti dvojako slijepi u procjeni parova politika; članak izvještava da je ovaj skupni ranking praćenja generalistnu politiku performansi točnije od konvencionalne, centralizirane evaluacije.

Nećete pokrenuti 600 parnih epizoda na jednom SO-100 u radionici. Ono što možete učiniti je ukloniti varijancu koju kontrolirate - popis dosadnu dovoljno da se obično preskaće.

DimenzijaZamrznite ovoŠto se pomiče ako ne
Početna pozicijaNapisana početna pozicija, vozana prije svakog pokusaPutanja počinje iz distribucije
ObjektiOznačeni znakovi, i isti fizički objekti rezervirani za evaluaciju"Bolja" politika je zapravo bliži objekt
Kamere i svjetloIsta prikupljanja, indeksi, izloženost; rolete zatvorene; fotografirajte postavkuZamijenjeni samo indeksi kamera mogu dominirati rezultatom
Pokusi i pravilo zaustavljanjaFiksno n, fiksni timeout, kriterij napisan prije rundePost-hoc kriteriji pretvaraju blizu-promašaje u što god trebate
Ponašanje operatoraBez intervencija tijekom pokusa evaluacijeEvaluacija postaje druga sesija korekcije

Zatim aritmetika, nemilosrdna pri brojevima pokusa koju radionica može priuštiti. Prema normalnoj aproksimaciji, 60 posto uspjeha preko 20 pokusa nosi standardnu grešku blizu 11 postotnih točaka - kvadratni korijen 0,6 puta 0,4 nad 20 - i razlika između dviju takvih rundi nosi oko 15. Skok sa 60 na 70 posto je stoga u skladu s ničim što se dogodilo. Pedeset pokusa donose po-runda cifru na grubо 7 točaka, i koštaju popodne.

Ta asimetrija je argument za stopu intervencije: izračunatih preko tisuća okvira umjesto dvadeset binarnih ishoda, pomicа se ranije i glađe. Upozorenje je da su okviri unutar epizode teško korelirani - jedan loš hvat daje stotinu uzastopnih okvira intervencije - pa je učinkovita veličina uzorka bliža broju preuzimanja. Tretrajte stopu kao rani indikator i stopu uspješnosti kao sporu zemljanu istinu.

Izdvojite epizode evaluacije iz bazena za treniranje

Epizode evaluacije nikad ne smiju ući u sastavljen skup podataka treniranja - inače je runda n+1 bodovana na podacima na kojima je trenirano, i krivulja mjeri memoripociju.

Zamka 3: treniranje samo na korekcijama savija politiku

Korekcije su zanimljivi podaci, pa je instinkt trenirati ih. Nemojte. Dolaze po konstrukciji iz uskog rezanja prostora stanja gdje je politika već bila neuspješna i govore gotovo ništa o većini vožnje koja je radila. Fino podešavanje samo na tom rezanju i dobijete politiku dobru za oporavak od zamršene pristupa koja je zaboravila kako učiniti čistim.

Mandlekar i kolege su izgradili svoj sustav udaljene intervencije oko toga. Njihov okvir: zadaci manipulacije sadržavaju uska mjesta koja zahtijevaju niz preciznih akcija - inseriranje pod u aparat za kavu je njihov primjer - gdje male devijacije vode u stanja koju demonstracije nisu pokrivale. Njihov algoritam treni iterativno na novim podacima kako bi se politika naučila prolaziti kroz ta uska mjesta, i oni izvještavaju da su agenti trenirani na podacima intervencije porazili agente trenirane na ekvivalentnom broju uzoraka od ne-intervencijalnih demonstratora.

Samo-korekcije fino podešavanje nasuprot sastavljenom smjesi
Što samo-korekcije dobijete
  • Brzo: kratka vožnja preko nekoliko tuceta epizoda je jeftina dovoljno za ponavljanje
  • Ciljana: gradijent je dominiran od stanja koja vas zanimaju
  • Jeftino za provjeru je li stil korekcije učljiv uopće
Što to košta
  • Distribucija fino-podešavanja više ne oponaša distribuciju zadatka
  • Nominalno ponašanje može degradirati vidljivo u jednoj rundu
  • Stopa može padati dok padа uspjeh - čistos segmenti zamijenjeni za oporavke

Omjer miješanja je hiperparam etar i zaslužuje biti napisan. Sastavljanje sljedećeg skupa podataka je gdje se odlučuje: izvorne demonstracije plus skup korekcije, odabir epizode po izvoru umjesto pravila koja tiho vuče u što je dostupno. Ovdje je to jedan compose korak u cockpitu, i rezultat je običan skup podataka - pogledajte dokumentaciju treniranja. Što niti jedan alat ne radi za vas je bilježenje koji je omjer proizveo koju krivulju.

Zamka 4: čovjek nije konzistentan stručnjak

Teorija DAgger-a pretpostavlja stručnjaka. Vi niste u tehničkom smislu: vaše korekcije nisu uzorci iz fiksne uvjetne distribucije nad akcijama. Autori ACT to imenuju kada popisuju prepreke finom manipulaciji - greške se složuju tijekom vremena, i ljudske demonstracije mogu biti nestacionarne. Njihov sustav još uvijek dostiže 80 do 90 posto uspjeha na šest stvarnih zadataka iz deset minuta demonstracija, pa problem je traktabilan, ne odsutan.

Studija robomimic čini točku s strane podataka. Preko šest izvanmrežnih algoritama na pet simuliranih i tri stvarnih multistage zadataka, njene lekcije uključuju osjetljivost na izbore dizajna, ovisnost o kvaliteti demonstracije, i - ona koja najviše boli ovdje - varijabilnost koja proizlazi iz kriterija zaustavljanja, jer se ciljevi treniranja i evaluacije razlikuju. Checkpoint s najnižom gubitkom nije pouzdano onaj s najvećom stopom uspješnosti.

Postoji verzija hardvera toga: način unosa oblikuje korekciju. A vodilja-pratilac postavka proizvodi kontinuirane, ljudski tempira putanje. Tipkovnice nudge su teško zaključane serverom - dva stupnja po pozivu na zglobovima ramena, četiri na greifera - pa ista namera stigne kao stubište malih koraka. Klizači šalju apsolutne ciljeve i server se može pomicati najviše šest stupnjeva prema njima po pozivu. Tri moda, tri akcijske distribucije; miješanje sve tri u jedan skup korekcije i zatim pitanje zašto je pristup postao krznast je samo infligirano. dokumentacija teleopilotiranja pokriva što svaki način šalje.

Ponderiranje intervencija: IWR i što je došlo poslije

Ako su korekcije cijenjeni manjini, principizirani ispravka je težina umjesto isključivosti. Intervention Weighted Regression je referentna implementacija: podaci se dijele na intervencije i ne-intervencije uzorke, i dva particija se uzorkuju u jednakim proporcijama tijekom treniranja. Skup korekcije koji je pet posto okvira tada pridonosi polovici gradijenta, bez nominalne ponašanja nestajanja iz distribucije.

Jednaka proporcija je početna točka, ne zakon. Sirius ga generalizira zamjenom binarne particije s kontinuiranom težinom iz približnog povjerenja čovjeka; Sirius-Fleet pomiče odluku nadolazak, koristeći vizualni svjetski model i anomalne predviđače da odluče kad se čovjek traži uopće. Zajednička nit: zastavica intervencije je signala treniranja, ne samo stupca prikaza.

MetodaTko odlučuje kad čovjek djelujeKako se koriste podaci intervencijeIzvješteni rezultat
DAgger (2011)Fiksni raspored; stručnjak označava posjećena stanjaJedan rastući skup podataka, neponderiranUokvirano kao smanjenje na no-regret online učenje
HG-DAgger (2019)Čovjek, vrata kontrola na stvarnom sustavuAgregirani; plus naučeni prag sigurnosti na nesigurnosti modelaBolje od DAgger-a i BC na vožnji; broj intervencija nije dat
IWR (2020)Čovjek, preko daljinskog teleopilotiranjaIntervencije i ne-intervencije uzorci izvučeni u jednakim proporcijamaPoražava ne-intervencijske demos pri jednakom broju uzoraka
Sirius (2022)Čovjek, tijekom primjenePonderirana BC, težine iz približnog povjerenja čovjeka8% dobit u simulaciji, 27% na stvarnom hardveru; 2x brža konvergencija
ThriftyDAgger (2021)Sustav, vrata na novosti i rizikuInteraktivno prikupljanje pod budžetom nadzoraKorisničko istraživanje (N=10): 58% viša čovjeka i 80% viša performansa robota od sljedećeg najboljeg načina
Fleet-DAgger (2022)Sustav, dodjela pažnje preko floteUčenje flote bodovano po povratku na ljudski naporDo 8,8x viši ROHE od baznih linija
Sirius-Fleet (2024)Anomalni predviđači s samoprilagođavajućim kriterijimaUčenje više zadataka s vizualnim svjetskim modelomManje zahtjeve za intervencijom kako se autonomija poboljšava
Prikaz rang-liste koji uspoređuje robote politike po mjerenom rezultatu
Rang-lista politika jedna nasuprot drugoj znači nešto samo kad je svaki unos pokrenuo isti protokol. To se primjenjuje na vaše vlastite tri runde također.

Četiri metrike vrijedne zapisivanja pored stope

  • Preuzimanja po vožnji. Dvadeset kratkih korekcija i jedan dugačak daju sličnu stopu i opisuju različite politike - jedna krznata, jedna s jednom slijepom točkom.
  • Srednje intervencije duljina. Rastući duljina s padajućim brojem znači da preostali neuspjesi su teški, što je to što pozni napredak izgleda.
  • Vrijeme do prve intervencije. Politika koja ide dalje prije nego što trebа pomoć se poboljšava čak i kada je ukupna stopa ravna.
  • Gdje se intervencije skupljaju. Bin zastavicu normalnom epizode napretka; stabilni vršac kroz runde pokazuje na jedan uski dio.

Protokol runde koji zapravo možete pokrenuti

Mjerena runda ima šest koraka i proizvodi jedan redak u dnevniku. Prva četiri su petlja; zadnja dva je čine mjerenjem.

  1. 1
    Zamrznite protokol evaluacije prije runde nula

    Napišite početnu poziciju, postavljanje objekta, kamere, broj pokusa, timeout i kriterij uspjeha. Fotografirajte stol. Ako se dokument mora promijeniti, serija se počinje iznova.

  2. 2
    Mjerenje bazne linije

    Pokrenite protokol bez intervencija i snimite uspjehe; zatim pokrenite jednu instrumentiranu sesiju s omogućenim preuzimanjem i snimite stopu. Ta dva broja su runda nula.

  3. 3
    Prikupljanje korekcija u jednom konzistentnom stilu

    Jedan način unosa po rundu, jedan operator ako možete upravljati. Preuzmi pod kriterijima koji možete izjasniti naglas - 'grifera više nego dva centimetra izvan pri pristupu' - i drži ga za rundu.

  4. 4
    Triage svaka epizoda istoga dana

    Korekcija, evaluacija ili odbacivanje. Ambiguozne epizode se odbacuju, ne čuvaju na teoriji da više podataka pomaže - korekcija u kojoj ste se sami fumali je gora nego bez epizode.

  5. 5
    Sastavite smjesu eksplicitno

    Izvorne demonstracije plus korekcije, odabir epizode po izvoru. Snimite bazni broj, broj korekcije i bilo koju ponderaciju - ovo je polje koje ćete htjeti za tri tjedna.

  6. 6
    Nastavite od checkpointa, zatim ponovno mjerenje

    Trenirajte sastavljen skup podataka od prethodnog checkpointa umjesto baznog modela, pokrenite zamrznutu protokol plus jednu instrumentiranu sesiju, dodajte red, i usporedite nasuprot prethodnim dvjema rundama.

Dva ograničenja mijenjaju kako čitate slabu rundu. Nastavak od checkpointa inicijalizira težine od njega - ne rezime optimizera, pa se raspored počinje svježe i kratka vožnja od konvergiranog checkpointa može pomicati vrlo malo. I preusmjeravanje vodilja na početku preuzimanja ima najmanje milje na stvarnom hardveru od bilo čega u lancu; ako se sve korekcije počinju s čudnim tranzijentnom, pogledajte tamo prije nego što krive smjesu.

Mjerena petlja, već povezana

ay-robots primjenjuje ovih šest koraka kao značajke proizvoda: preuzimanje srednje-vožnje od vodilja, tipkovnice ili klizača, s okvirima intervencije označenim automatski; triage svaka epizoda kao korekcija, evaluacija ili odbacivanje; sastaviti sljedećeg skupa podataka iz izvornih demonstracija plus korekcije, odabir epizode eksplicitan po izvoru; i pokrenuti sljedećeg posla treniranja od prethodnog checkpointa umjesto baznog modela.

Vidjeti kako DAgger petlja radi

Što brojevi ne mogu vam reći

Nič od toga nije riješeno, i uredna krivulja vas ne bi trebala ubjediti drugačije. Stopa intervencije mjeri zajedničkog sustava - politiku, hardver, operatora, sobu - i ništa ne pripisuje samo. Ne može prosuditi bile li korekcije dobre, i padbit će sretno na zadatku koji je postao lakši jer se objekt pomakuo dva centimetra bliže tijekom tri tjedna.

Ono što radi je okrenuti nejasnu impresiju u stupac sa kojim možete raspravljati. Alternativa nije bolja metrika; to su tri tjedna prikupljanja korekcije koju bi vam krivulja rekla, nakon runde tri, da prestanete prikupljati. Studija literature definira interaktivno učenje imitacijom kao ljudsku povratnu vezu danom povremeno tijekom izvršavanja robota, omogućavajući internetsku poboljšanu ponašanja; obitelj je široka, i nikakav raspored toga ne radi bez broja po rundu. Pogledajte i vodič učenja imitacijom SO-100 za bazni skup podataka koji miješate, pokretanje politike za stranu zaključivanja, i stranica DAgger petlje za provedenu cjevovodu.

Je li stopa intervencije samo jedan minus stopa uspješnosti?

Ne. Stopa mjeri koliko vožnje ste preuzeli; stopa uspješnosti mjeri je li zadatak izvršen bez vas. Vožnja može uspjeti s 30 posto stopom intervencije, i vožnja bez intervencija može potpuno neuspješno. Razlikuju se i u bučnosti: stopa se glatko pomicа preko tisuća korelirane okvire, stopa uspješnosti skače između manje kosti binarnih ishoda. Bilježi oboje.

Koliko pokusa evaluacije trebam da stopa uspješnosti znači nešto?

Više nego što se čini razumno. Prema normalnoj aproksimaciji, 20 pokusa s pravom stopom uspjeha od 60 posto nosi standardnu grešku blizu 11 postotnih točaka, pa je 10-točkasti pokret između rundi neizbježan od buke; 50 pokusa donese tu cifru na grubо 7. Ako ne možete priuštiti 50, čuvajte broj pokusa identičan kroz runde i tretrajte male pokrete kao neodlučne.

Koji omjer miješanja demonstracija korekcijama trebam početi?

Dokumentirana početna točka je od IWR-a: particija podaci u intervencije i ne-intervencije uzorke i izvuci ih u jednakim proporcijama, pa korekcije doprinose polovici gradijenta bez obzira na mali dio okvira su. Ako vas postavka ne može ponderirati uzorkovanje, aproksimirajte je preko brojevima epizode tijekom sastavljanja skupa podataka i snimite omjer. Treniranje samo na korekcijama je opcija koju trebate otpisati.

Moja stopa intervencije je porasla nakon runde. Je li runda bačena?

Nije nužno, ali prvo provjerite dosadne objašnjenja: je li checkpoint koji ste vozili slagati onaj koji ste trenirani, je li indeks kamere ili montaža promijeniti, je li postavljanje objekta pomaklo, je li stil korekcije konzistentan. Ako su sva četiri čista i parnjačka stopa uspješnosti također je padala, sumnjajte na smjesu - premalo baznih demonstracija prema korekcijama, ili korekcije koje se međusobno protivreče. Pravi regresija pripada dnevniku, ne bin.

Mogu li preskočiti fiksni protokol evaluacije i samo gledati stopu intervencije?

Samo ako prihvatite da ne možete reći napredak od navike. Stopa ovisi o vašem vlastitom pragom realnog vremena za ulazak, i taj prag pada kako se navikavate na čudnoće politike. Zamrznuti protokol je dio mjerenja koji vaš prag ne može dosegnuti - označene oznake, napisana početna pozicija, fiksni broj pokusa, kriterij odlučen prije runde. Mora ostati nepromijenjen kroz seriju.

Čuvajte dnevnik u skladištu, ne u bilježnici: runde su dane razdvojene, hardver se ponovo gradi, i osoba koja čita krivulju u listopadu ste vi bez sjećanja na kolovoz. FAQ dokumentacija pokriva operacijske detalje ostavljene van ovdje.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started