Delovni prostor namiznega robota, ki se uporablja kot fiksna postavitev vrednotenja za ponovljene tekalne politike
DAggerVrednotenjeUčenje z posnemovanjemPodatki robotaSO-100

Merjenje DAgger zanke: stopnja intervencije, protokol vrednotenja in pasti med njimi

AY-Robots ResearchAugust 27, 202615 min branja

Stopnja intervencije - intervencijske slike deljene s slikami teka - je najcenejši pošten signal napredka, ki ga ima DAgger zanka s človeškim vhodom. Ta članek jo definira tako, da dva človeka izračunata isto vrednost, prikaže, kako jo beležiti, in se spopade s štirimi načini, kako te zavaja: prilagajanje operaterja, premikajočega se postavitve vrednotenja, usposabljanja samo na popravkih in človeka, ki popravlja drugače v torek kot v ponedeljek.

Runda DAgger se zdi produktivna, medtem ko ste v njej. Vozite politiko, prevzamete, ko fumla prijeme, shranite popravke, ponovno usposobite, in naslednji tek izgleda - zagotavljam vam - malo gladkeje. Dve rundi pozneje ne morete reči, ali se je kaj spremenilo, ker "malo gladkeje" ni količina.

Zanka potrebuje eno število na rundo, in v zanki s človeškim vhodom je to število skoraj zastonj: delež teka, v katerem ste imeli kontrolo namesto politike. Ta članek jo definira tako, da dva človeka izračunata isto vrednost, jo beleži, prebere nastalo krivuljo in našteje štiri načine, kako te zavaja, ko stoji sama. Za teorijo, ki si jo ta članek predstavlja, glej razlago DAgger in različico s človeškim vhodom; praktični vzporedek je zagon DAgger zanke na SO-100.

Kratka različica

  • Stopnja intervencije = intervencijske slike / slike teka. Slike, ne epizode, in imenovalec vključuje slike, ki ste jih porabili za popravke.
  • Ravna krivulja čez tri runde pomeni, da runde nič ne kupijo - spremenite mešanico, kontrolno točko ali nalogo namesto zbieranja četrte.
  • Padajoča stopnja intervencije ni naraščajoča stopnja uspeha. Vaš prag za poseganje se seli navzdol, ko se zaupanje povečuje.
  • Brez zamrznjene protokola vrednotenja - enake začetne drže, predmeti, kamere, število poskusov - merite sobo.
  • Usposabljanje samo na popravkih nagiba porazdelitev stanja. Odgovor IWR: črpaj intervencijske in ne-intervencijske vzorce v enaki proporci.

Zakaj runda sploh potrebuje število

DAgger obstaja zaradi problema porazdelitve, in problemi porazdelitve so nevidni očem. Ross in Bagnell sta pokazala, da učenje z posnemovanjem na fiksnem nizu demonstracij vodi do sestavljenih napak in meje obžalovanja, ki raste kvadratično v časovnem obzorju: čim se učenec oddalji od stanj, ki jih je demonstrator obiskal, nič v podatkih mu ne pove, kako se vrniti. DAgger to popravi z iteracijo - tečaj politike, označi stanja, ki jih obišče, zbira, ponovno usposobi - kar Ross, Gordon in Bagnell okvirijo kot redukcijo na učenje brez obžalovanja na spletu.

Ta okviritev ima posledico, ki jo ljudje preskočijo. Garancija se nanaša na zaporedje politik preko iteracij, ne na kateri koli posamezni tek. Ne pove ničesar o tem, ali je vaša runda tri pomagala. Edini način, da to veste, je meriti vsako iteracijo. Kelly in njegovi sodelavci so predstavili HG-DAgger, ker klasični DAgger od strokovnjaka zahteva oznake dejanj, medtem ko je novak še v kontroli, kar članek trdi, da lahko zmanjša varnost in pri človeških strokovnjakih verjetno poslabša kakovost oznake zaradi zaznane zakasnitve aktuatorja. HG-DAgger se tudi nauči praga varnosti za metriko tveganja na osnovi negotovosti modela in poroča o izboljšani zmogljivosti tako DAgger kot behavioral cloning na vozni nalogi. Ne objavi podatkov o intervencijah; te proizvedete sami.

Opredelitev stopnje, da dva človeka dobita isto število

Definicija je ena vrstica: intervencijske slike deljene s slikami teka. Vse težko se skriva v tem, kaj šteje kot slika in kaj šteje kot tek.

Slike, ne epizode

Štetje epizod z vsaj eno intervencijo je neuporabno: deset epizod z enim nežnim potiskom in deset, v katerih ste vozili osemdeset odstotkov, oba dajeta "10/10". Številka slik jih loči in to je granularnost, ki jo ima že snemanje - v formatu LeRobot dataset je vsak časovni korak vrstica, tako da je zastavica intervencije ena logična stolpec ob stanju in dejanju. Tu je napisana za sliko v trenutku, ko se prevzem začne in se počisti, ko se kontrola vrne.

Imenovalec vključuje popravke

Dva imenovalca sta branljiva - skupne slike teka ali slike, ki jih je politika vozila samostojno - in se slabo razlikujeta pri visokih ravneh intervencije. Prevzemite 400 od 1000 slik in prvi da 40 odstotkov, drugi 67 odstotkov. Primerjava ene runde, izmerjene na prvi način, s to, izmerjeno na drugi, je način, kako resnično izboljšanje izgine. Vzemite skupne slike in nikoli ne preispitujte izbire sredi serije.

Odločite se enkrat, kaj se zgodi s slikami prevzema

Vedno je kaj, kar se stiče. Ko se kontrola preda, nekatere slike niso lastne nobenemu: roka je držana, voditelj se poravnava, snemanje je zamrznjeno. V tej cevi ostanejo te slike prevzema v surovem toku in nikoli ne vstopijo v kuriran epizodo - niso niti vedenje politike niti popravek vreden usposabljanja. Štejte šiv na enak način vsako rundo: pri 30 Hz je šest prevzemov z dvosekundnim šivom vsakih 360 slik, dovolj za premik točke odstotka.

Tri odločitve, ki prekinejo primerljivost

Slike ali epizode; skupni tek ali samo avtonomni; slike prevzema v ali ven. Katera koli od treh, ki se tiho spremeni med rundami, naredi krivuljo nesmiselno. Zapišite vse tri.

Beleženje, da število preživi sejo

Metrika v stanju plošči tekajoče postopka je odčitek: na ponovnem zagonu izgine in je ne moremo narisati. Ena samo dodatna vrstica na tek pokriva celotno serijo - vključno s tem, kaj je kontrolna točka ste vozili, ker se to spreminja z vsako rundo in zmešana jih poenostavi to, kar sledi.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Ena vrstica na tek. Beleženje imenovalca in dogovora o prevzemu ob številu je bolj važno kot imena polj.

Dve polji nosita težo. train_mix je tisto, kar ste napajali naslednji delovni misel usposabljanja; brez tega se ničesar ne da pripisati. eval_protocol poimenuje fiksni test, ki ste ga nato izvedli, in je polje, ki je najpogosteje prazno. V kokpitu ay-robots status prevzema poroča o štetju intervencijskih slik za tekajočo sejo, zato je beleženje prepis namesto instrumentacije; dokumentacija nabora podatkov pokriva, kjer se pristanejo stolpci na sliko.

Matrika konfiguracije usposabljanja, ki prikazuje politike, nabore podatkov in kontrolne točke druga ob drugi
Vsaka runda spremeni mešanico kontrolne točke in nabora podatkov. Številka, katere kombinacija ni bila zabeležena, je ne moremo pripisati.

Branje krivulje: tri runde, en zaključek

Tri runde so najmanj za branje, ker sta dve točki vedno črta. Spodnja tabela je predloga za knjižnico s pripisom števil, ne meritve iz katerega koli teka. Gledate monotono zmanjšanje, ki se ujema z povečanjem uspeha pri fiksnem testu.

RundaKontrolna točkaSlikeIntervencijske slikeStopnjaUspehi (od 20)
0 (osnovna vrednost)osnovna politika5 9001 38023,4 %7
1iz mešanice runde 05 61098017,5 %10
2iz mešanice runde 15 41261111,3 %11
3iz mešanice runde 25 38059811,1 %12

Rundi ena in dve delata. Runda tri ne: 11,3 proti 11,1 odstotka je v teku in spremenljivosti česar koli, merjenega na fizični roki, in četrta runda istih popravkov preživi popoldne za nič. Ravna segment pravi spremembi nečesa strukturnega.

  • Preostale napake se ne dajo popraviti s teleopracijo - predmet izven dosega, geometrija prijemala, sklepa na meji. Noben nabor popravkov ne popravi kinematske stene.
  • Popravkov je premalo proti naboru osnovnih podatkov, da bi premaknili gradient, in nič jih ne utež.
  • Popravki se medsebojno nasprotujejo, zato politika povrni dve strategiji in se prizemli med njima.
  • Napaka je viš: kamera se je premakla, osvetlitev se je spremenila, pogled na zapestje se ne ujema več s treningom.
  • Naloga je na stropu tega razreda politike na tej strojni opremi, in naslednji korak je več osnovnih podatkov.

Zadnja dva nista napaki zanke. V Sirius-Fleet je upadajoča potreba po človeku zasnovan rezultat: ko se avtonomija robota izboljšuje, njegovi napovedovalci anomalij prilagodijo svoje merila napovedovanja, kar vodi do manj zahtevkov za človeško intervencijo in postopoma zmanjšuje človeško delovno obremenitev skozi čas. Tam se merilo prilagaja namerno. V ročni zanki se vašo tudi prilagaja, tiho - zato stopnja, ki se poravna, ker je naloga na stropu, izgleda popolnoma enaka kot ena, ki se je poravnala, ker operater ni več opazil. To je naslednja napaka.

Pasti 1: padajoča stopnja ni naraščajoča stopnja uspeha

Stopnja intervencije meri točno eno stvar: koliko teka ste se odločili lastiti. To odločitev je vaša, sprejeta v realnem času, in se premika. V rundi nič prevzamete pri prvem slabem kotu pristopa; do runde tri ste opazovali politiko, kako se opomore od ducat njihovih in ji dovolite, da poskusi. Vaš prag se je premaknil; politika se morda ni. Stopnja pade v vsakem primeru.

Človeško zaupanje je vsaj modelirana količina v literaturi namesto predpostavljene konstante. Sirius ponovno utež vzorce usposabljanja s približanim človeško zaupanjem in optimizira politiko z uteženim behavioral cloning, pri čemer poroča o 8-odstotnem povečanju v simulaciji in 27 odstotkih na resnični strojni opremi nad stanjem umetnosti pri stopnji uspeha politike, dvakrat hitrejšo hitrostjo konvergence. To obravnava zaupanje kot težo podatkov. Ne popravi praga v vaši glavi med rundo nič in rundo tri.

Ne morete odstraniti premika, zato povežite stopnjo s čim, kar vaš prag ne more doseči: fiksni niz poskusov, v katere se ne vmešavate, ocenjeni glede na merilo, napisano pred rundo. Stopnja, ki pada, medtem ko ostane seznanjena stopnja uspeha na mestu, je podpis priprave - vredno je ujeti, ker se z notranje strani zanke zdi napredek.

Stopnja intervencijeStopnja uspeha na fiksnem protokoluNajbolj verjetna branja
padanarasteRunda je delala. Nadaljujte.
padaravnoVaš prag se je premaknil ali popravki so odstranili napor brez odstranjevanja napak.
padapadaPopravki poslabšavajo politiko. Preverite mešanico in njihovo notranjo doslednost.
ravnoravnoRunda ni kupila ničesar. Spremenite mešanico, kontrolno točko ali nalogo pred zbiranjem več.
narastepadaRegresija. Sumite usposabljačnega mešanice, spremenjene kamere ali zmešanosti kontrolne točke pred sumjenjem metode.

Pasti 2: brez fiksnega protokola merite sobo

Vrednotenje realno-robot je drago in težko ponoviti. Avtorji SIMPLER motivirajo simulirano vrednotenje z opazko, da vrednotenje takih politik v realnem svetu ni razširljivo in se sooča z izzivi ponovljivosti, ki se bodo verjetno poslabšali, ko politike razširijo njihov spekter nalog. RoboArena ga napada z druge strani, z več kot 600 pairwise realno-robot vrednotenja episod čez sedem generalistskih politik, ki jih vodijo vrednotovalci na sedmih akademskih institucijah na platformi DROID. Njegovi vrednotovalci izberejo svoje lastne naloge in okolja, vendar morajo soditi pare politik slepo; članek poroča, da ta prispevek od množice rangiranja bolje sledi zmogljivosti generalistske politike kot običajno, centralizirana vrednotenja.

Ne boste tekli 600 povezanih epizod na enem SO-100 v delavnici. Kar lahko naredite je odstraniti različnost, ki jo nadzorujete - seznam dovolj dolgočasen, da ga običajno preskočijo.

DimenzijaZamrzni toKaj se premika, če ne
Začetna držaNapisana domača položaja, vozila pred vsakim poskusomTrajektorija se začne izven porazdelitve
PredmetiOznake z trakom in isti fizični predmeti, rezervirani za vrednotenje"Boljša" politika je res bližji predmet
Kamere in lučEnake namestitve, indeksi, osvetlitev; zaslonke zaprte; fotografija postavitveZgolj zamenjani indeksi kamer lahko dominirajo rezultat
Poskusi in pravilo zaustavitveFiksno n, fiksni čas čakanja, merilo napisano pred rundoKriteriji post-hoc spremenijo skoraj zmanjki v kar koli potrebujete
Vedenje operaterjaNi intervencij med poskusi vrednotenjaVrednotenje postane druga sejsa popravkov

Nato aritmetika, nepopustljiva pri štetjih poskusov, ki si jih stisnete v delavnici. Pod normalno aproksimacijo je 60-odstotni uspeh čez 20 poskusov s standardno napako blizu 11 odstotnih točk - kvadratni koren od 0,6 krat 0,4 čez 20 - in razlika med dvema takima rundama je približno 15. Skok od 60 do 70 odstotkov je zato skladen z nič, kar se je zgodilo. Petdeset poskusov prinese na-rundo številko na približno 7 točk in stane popoldne.

Ta asimetrija je argument za stopnjo intervencije: izračunana čez tisoče slik namesto dvajsetih binarnih rezultatov, se pomika prej in gladkeje. Opomka je, da so slike v epizodi močno korelirane - en slab prijem prinese sto zaporednih slik intervencije - zato je učinkovita velikost vzorca bližja številu prevzemov. Obravnavajte stopnjo kot zgodnji indikator in stopnjo uspeha kot počasno talno resnico.

Ohranite epizode vrednotenja zunaj nabora usposabljanja

Epizode vrednotenja nikoli ne smejo vstopiti v sestavljeni nabor usposabljanja - sicer je runda n+1 ocenjena na podatkih, na katerih je bila usposobljena, in krivulja meri memoriko.

Pasti 3: usposabljanje samo na popravkih upogiba politiko

Popravki so zanimivi podatki, zato je instinkt usposabljati se na njih. Ne. Prihajajo s konstrukcijo iz ozke rezine prostora stanja, kjer je bila politika že propadala in skoraj nič ne povejo o večini teka, ki je delala. Fino nastavite samo to rezino in dobite politiko dobro za opomoč iz popravljenega pristopa, ki je pozabila, kako narediti čistega.

Mandlekar in njegovi sodelavci so gradili svoj sistem daljinskega posredovanja okrog tega. Njihov okvir: naloge manipulacije vsebujejo regije ozke grla, ki zahtevajo zaporedje natančnih dejanj - vstavitev kapsule v kavni aparat je njihov primer - kjer majhna odstopanja vodijo v stanja, ki jih demonstracije nikoli niso pokrivale. Njihov algoritem iterativno usposobi na nove podatke, tako da politika nauči prečkati tiste grlat ozka mesta, in poročajo, da agenti usposobljeni na podatkih intervencije premagajo agente usposobljene na enakovrednem številu vzorcev od ne-intervencijskih demonstratorjev.

Samo popravki fino nastavljanje proti sestavljeni mešanici
Kaj samo popravki dobite
  • Hitro: kratek tek čez nekaj ducat epizod je poceni dovolj, da se ponovi
  • Ciljano: gradient je dominiran s stanjem, ki se vam zdi
  • Poceni za testiranje, ali je slog popravka sploh učljiv
Koliko stane
  • Porazdelitev fino nastavljanja ne spominja več na porazdelitev naloge
  • Nominalno vedenje se lahko vidno poslabša v eni sami rundi
  • Stopnja se lahko zmanjša, medtem ko uspeh pade z njo - čiste segmente zamenjane za opomore

Razmerje mešanice je hiperparameter in si zasluži biti napisan. Sestavljanje naslednjem nabora podatkov je tam, kar se odloči: originalne demonstracije plus nabor popravkov, izbira epizode jasno po viru namesto pravila, ki tiho vleče kar je na voljo. Tu je to en korak sestavljanja v kokpitu, rezultat pa je navaden nabor podatkov - glej dokumentacijo usposabljanja. Noben instrument ne naredi za vas beleženja, kaj razmerje je proizvajalo katero krivuljo.

Pasti 4: človek ni konsistenten strokovnjak

Teorija DAgger predpostavlja strokovnjaka. V tehnističnem smislu niste: vaši popravki niso vzorci iz fiksne pogojne porazdelitve nad dejanji. Avtorji ACT to poimenovali, ko so našteli ovire za fino manipulacijo - napake se sestavljajo skozi čas, in človeške demonstracije so lahko nestacionarne. Njihov sistem vseeno doseže 80 do 90 odstotkov uspeha na šestih resničnih nalogah z desetih minut demonstracij, zato je problem rešljiv, ne odsoten.

Študija robomimic to dokazuje z strani podatkov. Čez šest algoritmov brez interneta na petih simuliranih in treh resničnih multi-stopnjskih nalogah, se v njenih poukih pojavljajo občutljivost na izbiro zasnove, odvisnost od kakovosti demonstracij in - tista, ki najbolj boli tu - spremenljivost, ki nastane iz kriterijev zaustavitve, ker se cilja usposabljanja in vrednotenja razlikujeta. Kontrolna točka z najmanjšo izgubo ni zanesljivo tista z najvišjo stopnjo uspeha.

To je strojno različica: vhodna način oblikuje popravek. voditelj-sledilec nastavka proizvaja neprekinjene, ljudskim tempom vodene tirnice. Tipkovni potisni so togi stisnjeni s strani strežnika - dve stopinji na klic na sklepih roke, štiri na prijemalu - zato ista namena prispejo kot stopnice majhnih korakov. Drsniki pošiljajo absolutne cilje in strežnik se premakne največ šest stopin proti njim na klic. Tri modes, tri porazdelitve dejanj; mešanje vseh treh v en nabor popravkov in nato vprašanje, zakaj je pristop postal trepetal, je samouporabnašajočo se. dokumentacija teleopracijske pokriva, kaj vsak način pošilja.

Uteženje intervencij: IWR in kaj je prišlo nato

Če so popravki dragoceni manjšina, je načelni popravek utež namesto izključnosti. Intervention Weighted Regression je referenčna implementacija: podatki se razdele na intervencijske in ne-intervencijske vzorce in oba razdelka se vzorčujeta v enaki proporci med usposabljanjem. Nabor popravkov, ki je pet odstotkov slik, nato prispeva polovico gradientu, brez da bi nominalno vedenje izginjalo iz porazdelitve.

Enaka proporc je začetna točka, ne zakon. Sirius jo posploši z zamenjavo binarnega razdelka s kontinualno težo iz približanega človeško zaupanja; Sirius-Fleet premakne odločitev navzgor, z uporabo vizualnega svetovnega modela in napovedovalcev anomalij, da se odloči, kdaj je človek sploh prosjen. Skupna nit: zastavica intervencije je signal usposabljanja, ne samo stolpec knjižnice.

MetodaKdo se odloči, kdaj deluje človekKako se uporabijo podatki intervencijePoročani rezultat
DAgger (2011)Fiksni razpored; strokovnjak oznake obiskane stanjaEn rastoči nabor podatkov, neuteženOkvirjeno kot zmanjšanje na učenje brez obžalovanja na spletu
HG-DAgger (2019)Človek, gating kontrolo na realnem sistemuZbrano; plus naučena prag varnosti na negotovosti modelaBolje kot DAgger in BC v voznji; podana ne intervencijska štetja
IWR (2020)Človek, preko daljinske teleopracijskeIntervencija in ne-intervencijske vzorce narisane v enaki proporciPremaguje ne-intervencijske demone pri enakem štetju vzorcev
Sirius (2022)Človek, med uvedboUteženi BC, uteženi iz približanega človeško zaupanja8 % dobitek v simulaciji, 27 % na resnični strojni opremi; 2x hitrejša konvergenca
ThriftyDAgger (2021)Sistem, gating na novost in tveganjeInteraktivna zbirka pod nadzorom proračunaUporabniška študija (N=10): 58 % višja človeškemu in 80 % višja robota zmogljivost od naslednje najboljše metode
Fleet-DAgger (2022)Sistem, dodeljevanje pozornosti čez flotoFleet učenje ocenjena s Povratkom za ponovno Človeško NalogoDo 8,8 krat višja ROHE kot osnove
Sirius-Fleet (2024)Napovedovalci anomalij s samoadaptivnimi meriliMultitasking učenja z vizualnim svetovnim modelomManj zahtevkov intervencije, ko se avtonomija izboljšuje
Pogled lestvice primerjave politik robotov po izmerjeni oceni
Rangiranje politik drug proti drugemu pomeni nekaj le, kadar je vsak vnos pognal isti protokol. To velja tudi za vaše lastne tri runde.

Štiri metrike, vredno beleženja ob stopnji

  • Prevzemi na tek. Dvajset kratkih popravkov in en dolg dajo podobne stopnje in opisujejo različne politike - ena trebljiva, ena z enim slepim psom.
  • Povprečna dolžina intervencije. Naraščajoča dolžina s padajočim štetjem pomeni, da preostale napake so težke, kar je to, kako izgleda pozni napredek.
  • Čas do prve intervencije. Politika, ki se napreduje pred potrebo pomoči, se izboljšuje tudi, kadar je skupna stopnja ravna.
  • Mesto grozda intervencij. Raven zastavico po normaliziranem napredku epizode; stabilni vrh čez runde kaže na eno grlo.

Protokol runde, ki ga lahko dejansko tekete

Izmerjena runda ima šest korakov in proizvaja eno vrstico v dnevniku. Prva štiri so zanka; zadnja dva jo naredita meritev.

  1. 1
    Zamrzni protokol vrednotenja pred rundo nič

    Zapišite začetno drži, umestitev predmeta, kamere, štetje poskusov, čas čakanja in kriterij uspeha. Fotografirajte mizo. Če se mora dokument spremeniti, se serija ponovno preuči.

  2. 2
    Izmeri osnovno vrednost

    Tekite protokol brez intervencij in zapišite uspehi; nato tekite eno instrumentirano sejo s prevzemom omogočenim in zapišite stopnjo. Ti dve števili sta runda nič.

  3. 3
    Zberite popravke v enem samem doslednem slogu

    Ena vhodna način na rundo, en operater, če se lahko spopadate z njo. Prevzemite na merilu, ki ga lahko navedete na glas - "prijemal bolj kot dve centimetra stran pri pristopu" - in ga držite za rundo.

  4. 4
    Razvrsti vsako epizodo istega dne

    Popravek, vrednotenje ali zavrženje. Dvomljive epizode se zavržejo, ne shranjene po teoriji, da več podatkov pomaga - popravek, v katerem ste sami fumla, je slabši kot nobena epizoda.

  5. 5
    Sestavi mešanico jasno

    Originalne demonstracije plus popravki, izbira epizode jasno po viru. Zapišite osnovno štetje, popravečno štetje in katero koli utež - to je polje, ki ga boste hoteli čez tri tedne.

  6. 6
    Nadaljujte od kontrolne točke, nato ponovno merite

    Usposobite sestavljeni nabor podatkov od prejšnje kontrolne točke namesto osnovnega modela, tekite zamrznjeni protokol plus eno instrumentirano sejo, dodajte vrstico in primerjajte z prejšnjima dvema rundama.

Dve meji spremenita, kako berete šibko rundo. Nadaljevanje od kontrolne točke inicijalizira uteži iz nje - ne povzetek optimizatorja, zato se razpored znova začne in kratek tek od konvergentne kontrolne točke se malo premakne. In gibanje poravnave vodje na začetku prevzema ima najmanj prevozenih kilometrov na resnični opremi vsega v verigi; če se popravki vsi začnejo z čudnim prehodnim, glejte tam pred krivljenjem mešanice.

Izmerjena zanka, že preslicana

ay-robots implementira te šest korakov kot funkcionalnosti izdelka: prevzamete sredo-tek od vodje roke, tipkovnice ali drsnikov, z intervencijskimi slikami označeni avtomatično; razvrstite vsako epizodo kot popravek, vrednotenje ali zavrženje; sestavi naslednji nabor podatkov iz originalnih demonstracij plus popravkov, izbira epizode jasno po viru; in začni naslednji potek usposabljanja od prejšnje kontrolne točke namesto osnovnega modela.

Poglejte, kako DAgger zanka deluje

Kaj števila ne morejo povedati

Nič od tega ni rešeno in urejena krivulja vas ne bi smela drugače prepričati. Stopnja intervencije meri skupni sistem - politika, strojno opremo, operaterja, sobo - in ne pripisuje ničesar same. Ne more soditi, ali so bili popravki dobri, in bo padala z veseljem na nalogo, ki je postala lažja, ker se je predmet premaknil dva centimetra bližje čez tri tedne.

To naredi je spremeniti nejasno vtis v stolpec, s katerim se lahko prepričate. Alternativa ni boljša metrika; to so tri tedne zbieranja popravkov, ki bi vam krivulja po rundi tri povedala, da prenehate zbieranja. Pregledno literaturo definirajte interaktivno učenje z posnemovanjem kot človeško povratko, ki se daje občasno med izvajanjem robota, ki dovoljuje spletno izboljšavo vedenja; družina je široka, nobena razporeditev tega ne deluje brez številke na rundo. Poglejte tudi vodnika SO-100 učenja z posnemovanjem za osnovni nabor podatkov, ki ga mesite proti, tekanje politike za stran sklepanja in stran DAgger zanke za implementirano cev.

Ali je stopnja intervencije samo ena minus stopnja uspeha?

Ne. Stopnja meri, koliko od teka ste prevzeli; stopnja uspeha meri, ali je bila naloga opravljena brez vas. Tek se lahko pojavi s 30 odstotno stopnjo intervencije in tek brez intervencij se lahko popolnoma ne pojavi. Se tudi razlikujeta v šumu: stopnja se gladko premika čez tisoče povezanih slik, stopnja uspeha skoči med graščo binarnih rezultatov. Beležiti oba.

Koliko poskusov vrednotenja potrebujem, da ima stopnja uspeha kaj pomena?

Več kot se zdi razumno. Pod normalno aproksimacijo, 20 poskusov pri pravi 60 odstotni stopnji uspeha nosijo standardno napako blizu 11 odstotnih točk, zato je 10-točkovni premik med rundami neločljiv od šuma; 50 poskusov prinesejo to številko na približno 7. Če si ne morete privoščiti 50, ohranite štetje poskusov enako čez runde in majhne premike obravnavajte kot neodločne.

Kakšno razmerje mešanice demonstracij do popravkov bi moral začeti?

Dokumentirani začetna točka je IWR: razdeliš podatke na intervencije in ne-intervencijske vzorce in jih črpaš v enaki proporci, zato popravki prispevajo polovico gradientu ne glede na to, kako majhen delež slik so. Če vaša postavka ne more utežiti vzorčenja, jo približajte skozi štetje epizod pri sestavljanju nabora podatkov in zapišite razmerje. Usposabljanje samo na popravkih je možnost, ki jo je treba izključiti.

Moja stopnja intervencije se je povečala po rundi. Ali je runda zavržena?

Ni nujno, ampak najprej preverite dolgočasne razlage: ali se je kontrolna točka, ki ste jo vozili, ujemala s tisto, ki ste jo usposabljali, je indeks kamere ali namestitve spremenjen, je umestitev predmeta premikala, je bil slog popravka skladen. Če so vsi štirje čisti in je stopnja uspeha seznanjena tudi padla, sumite mešanico - premalo osnovnih demonstracij zoper popravke ali popravki, ki se medsebojno nasprotujejo. Prava regresija sodi v dnevnik, ne v koš.

Ali lahko preskoči fiksni protokol vrednotenja in samo gledam stopnjo intervencije?

Samo če sprejmete, da ne morete ločiti napredka od priprave. Stopnja je odvisna od vaše lastne časovne proge za poseganje, in ta prag pada, ko se privadite posebnostim politike. Zamrznjeni protokol je del meritve, ki ga vaš prag ne more doseči - oznake z trakom, napisana domača drža, fiksno štetje poskusov, merilo odločeno pred rundo. Mora ostati nespremenjena čez serijo.

Ohranite dnevnik v spremiščišču, ne v zvezku: runde so dni narazen, strojno opremo se ponovno gradi, in oseba, ki bere krivuljo v oktobru, ste vi brez spomina na avgust. pogosto zastavljena vprašanja dokumentacije pokriva operacijske podrobnosti, ki so tukaj izpuščene.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started