
Stopnja intervencije - intervencijske slike deljene s slikami teka - je najcenejši pošten signal napredka, ki ga ima DAgger zanka s človeškim vhodom. Ta članek jo definira tako, da dva človeka izračunata isto vrednost, prikaže, kako jo beležiti, in se spopade s štirimi načini, kako te zavaja: prilagajanje operaterja, premikajočega se postavitve vrednotenja, usposabljanja samo na popravkih in človeka, ki popravlja drugače v torek kot v ponedeljek.
Runda DAgger se zdi produktivna, medtem ko ste v njej. Vozite politiko, prevzamete, ko fumla prijeme, shranite popravke, ponovno usposobite, in naslednji tek izgleda - zagotavljam vam - malo gladkeje. Dve rundi pozneje ne morete reči, ali se je kaj spremenilo, ker "malo gladkeje" ni količina.
Zanka potrebuje eno število na rundo, in v zanki s človeškim vhodom je to število skoraj zastonj: delež teka, v katerem ste imeli kontrolo namesto politike. Ta članek jo definira tako, da dva človeka izračunata isto vrednost, jo beleži, prebere nastalo krivuljo in našteje štiri načine, kako te zavaja, ko stoji sama. Za teorijo, ki si jo ta članek predstavlja, glej razlago DAgger in različico s človeškim vhodom; praktični vzporedek je zagon DAgger zanke na SO-100.
Kratka različica
- •Stopnja intervencije = intervencijske slike / slike teka. Slike, ne epizode, in imenovalec vključuje slike, ki ste jih porabili za popravke.
- •Ravna krivulja čez tri runde pomeni, da runde nič ne kupijo - spremenite mešanico, kontrolno točko ali nalogo namesto zbieranja četrte.
- •Padajoča stopnja intervencije ni naraščajoča stopnja uspeha. Vaš prag za poseganje se seli navzdol, ko se zaupanje povečuje.
- •Brez zamrznjene protokola vrednotenja - enake začetne drže, predmeti, kamere, število poskusov - merite sobo.
- •Usposabljanje samo na popravkih nagiba porazdelitev stanja. Odgovor IWR: črpaj intervencijske in ne-intervencijske vzorce v enaki proporci.
Zakaj runda sploh potrebuje število
DAgger obstaja zaradi problema porazdelitve, in problemi porazdelitve so nevidni očem. Ross in Bagnell sta pokazala, da učenje z posnemovanjem na fiksnem nizu demonstracij vodi do sestavljenih napak in meje obžalovanja, ki raste kvadratično v časovnem obzorju: čim se učenec oddalji od stanj, ki jih je demonstrator obiskal, nič v podatkih mu ne pove, kako se vrniti. DAgger to popravi z iteracijo - tečaj politike, označi stanja, ki jih obišče, zbira, ponovno usposobi - kar Ross, Gordon in Bagnell okvirijo kot redukcijo na učenje brez obžalovanja na spletu.
Ta okviritev ima posledico, ki jo ljudje preskočijo. Garancija se nanaša na zaporedje politik preko iteracij, ne na kateri koli posamezni tek. Ne pove ničesar o tem, ali je vaša runda tri pomagala. Edini način, da to veste, je meriti vsako iteracijo. Kelly in njegovi sodelavci so predstavili HG-DAgger, ker klasični DAgger od strokovnjaka zahteva oznake dejanj, medtem ko je novak še v kontroli, kar članek trdi, da lahko zmanjša varnost in pri človeških strokovnjakih verjetno poslabša kakovost oznake zaradi zaznane zakasnitve aktuatorja. HG-DAgger se tudi nauči praga varnosti za metriko tveganja na osnovi negotovosti modela in poroča o izboljšani zmogljivosti tako DAgger kot behavioral cloning na vozni nalogi. Ne objavi podatkov o intervencijah; te proizvedete sami.
Opredelitev stopnje, da dva človeka dobita isto število
Definicija je ena vrstica: intervencijske slike deljene s slikami teka. Vse težko se skriva v tem, kaj šteje kot slika in kaj šteje kot tek.
Slike, ne epizode
Štetje epizod z vsaj eno intervencijo je neuporabno: deset epizod z enim nežnim potiskom in deset, v katerih ste vozili osemdeset odstotkov, oba dajeta "10/10". Številka slik jih loči in to je granularnost, ki jo ima že snemanje - v formatu LeRobot dataset je vsak časovni korak vrstica, tako da je zastavica intervencije ena logična stolpec ob stanju in dejanju. Tu je napisana za sliko v trenutku, ko se prevzem začne in se počisti, ko se kontrola vrne.
Imenovalec vključuje popravke
Dva imenovalca sta branljiva - skupne slike teka ali slike, ki jih je politika vozila samostojno - in se slabo razlikujeta pri visokih ravneh intervencije. Prevzemite 400 od 1000 slik in prvi da 40 odstotkov, drugi 67 odstotkov. Primerjava ene runde, izmerjene na prvi način, s to, izmerjeno na drugi, je način, kako resnično izboljšanje izgine. Vzemite skupne slike in nikoli ne preispitujte izbire sredi serije.
Odločite se enkrat, kaj se zgodi s slikami prevzema
Vedno je kaj, kar se stiče. Ko se kontrola preda, nekatere slike niso lastne nobenemu: roka je držana, voditelj se poravnava, snemanje je zamrznjeno. V tej cevi ostanejo te slike prevzema v surovem toku in nikoli ne vstopijo v kuriran epizodo - niso niti vedenje politike niti popravek vreden usposabljanja. Štejte šiv na enak način vsako rundo: pri 30 Hz je šest prevzemov z dvosekundnim šivom vsakih 360 slik, dovolj za premik točke odstotka.
Slike ali epizode; skupni tek ali samo avtonomni; slike prevzema v ali ven. Katera koli od treh, ki se tiho spremeni med rundami, naredi krivuljo nesmiselno. Zapišite vse tri.
Beleženje, da število preživi sejo
Metrika v stanju plošči tekajoče postopka je odčitek: na ponovnem zagonu izgine in je ne moremo narisati. Ena samo dodatna vrstica na tek pokriva celotno serijo - vključno s tem, kaj je kontrolna točka ste vozili, ker se to spreminja z vsako rundo in zmešana jih poenostavi to, kar sledi.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Dve polji nosita težo. train_mix je tisto, kar ste napajali naslednji delovni misel usposabljanja; brez tega se ničesar ne da pripisati. eval_protocol poimenuje fiksni test, ki ste ga nato izvedli, in je polje, ki je najpogosteje prazno. V kokpitu ay-robots status prevzema poroča o štetju intervencijskih slik za tekajočo sejo, zato je beleženje prepis namesto instrumentacije; dokumentacija nabora podatkov pokriva, kjer se pristanejo stolpci na sliko.

Branje krivulje: tri runde, en zaključek
Tri runde so najmanj za branje, ker sta dve točki vedno črta. Spodnja tabela je predloga za knjižnico s pripisom števil, ne meritve iz katerega koli teka. Gledate monotono zmanjšanje, ki se ujema z povečanjem uspeha pri fiksnem testu.
| Runda | Kontrolna točka | Slike | Intervencijske slike | Stopnja | Uspehi (od 20) |
|---|---|---|---|---|---|
| 0 (osnovna vrednost) | osnovna politika | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | iz mešanice runde 0 | 5 610 | 980 | 17,5 % | 10 |
| 2 | iz mešanice runde 1 | 5 412 | 611 | 11,3 % | 11 |
| 3 | iz mešanice runde 2 | 5 380 | 598 | 11,1 % | 12 |
Rundi ena in dve delata. Runda tri ne: 11,3 proti 11,1 odstotka je v teku in spremenljivosti česar koli, merjenega na fizični roki, in četrta runda istih popravkov preživi popoldne za nič. Ravna segment pravi spremembi nečesa strukturnega.
- Preostale napake se ne dajo popraviti s teleopracijo - predmet izven dosega, geometrija prijemala, sklepa na meji. Noben nabor popravkov ne popravi kinematske stene.
- Popravkov je premalo proti naboru osnovnih podatkov, da bi premaknili gradient, in nič jih ne utež.
- Popravki se medsebojno nasprotujejo, zato politika povrni dve strategiji in se prizemli med njima.
- Napaka je viš: kamera se je premakla, osvetlitev se je spremenila, pogled na zapestje se ne ujema več s treningom.
- Naloga je na stropu tega razreda politike na tej strojni opremi, in naslednji korak je več osnovnih podatkov.
Zadnja dva nista napaki zanke. V Sirius-Fleet je upadajoča potreba po človeku zasnovan rezultat: ko se avtonomija robota izboljšuje, njegovi napovedovalci anomalij prilagodijo svoje merila napovedovanja, kar vodi do manj zahtevkov za človeško intervencijo in postopoma zmanjšuje človeško delovno obremenitev skozi čas. Tam se merilo prilagaja namerno. V ročni zanki se vašo tudi prilagaja, tiho - zato stopnja, ki se poravna, ker je naloga na stropu, izgleda popolnoma enaka kot ena, ki se je poravnala, ker operater ni več opazil. To je naslednja napaka.
Pasti 1: padajoča stopnja ni naraščajoča stopnja uspeha
Stopnja intervencije meri točno eno stvar: koliko teka ste se odločili lastiti. To odločitev je vaša, sprejeta v realnem času, in se premika. V rundi nič prevzamete pri prvem slabem kotu pristopa; do runde tri ste opazovali politiko, kako se opomore od ducat njihovih in ji dovolite, da poskusi. Vaš prag se je premaknil; politika se morda ni. Stopnja pade v vsakem primeru.
Človeško zaupanje je vsaj modelirana količina v literaturi namesto predpostavljene konstante. Sirius ponovno utež vzorce usposabljanja s približanim človeško zaupanjem in optimizira politiko z uteženim behavioral cloning, pri čemer poroča o 8-odstotnem povečanju v simulaciji in 27 odstotkih na resnični strojni opremi nad stanjem umetnosti pri stopnji uspeha politike, dvakrat hitrejšo hitrostjo konvergence. To obravnava zaupanje kot težo podatkov. Ne popravi praga v vaši glavi med rundo nič in rundo tri.
Ne morete odstraniti premika, zato povežite stopnjo s čim, kar vaš prag ne more doseči: fiksni niz poskusov, v katere se ne vmešavate, ocenjeni glede na merilo, napisano pred rundo. Stopnja, ki pada, medtem ko ostane seznanjena stopnja uspeha na mestu, je podpis priprave - vredno je ujeti, ker se z notranje strani zanke zdi napredek.
| Stopnja intervencije | Stopnja uspeha na fiksnem protokolu | Najbolj verjetna branja |
|---|---|---|
| pada | naraste | Runda je delala. Nadaljujte. |
| pada | ravno | Vaš prag se je premaknil ali popravki so odstranili napor brez odstranjevanja napak. |
| pada | pada | Popravki poslabšavajo politiko. Preverite mešanico in njihovo notranjo doslednost. |
| ravno | ravno | Runda ni kupila ničesar. Spremenite mešanico, kontrolno točko ali nalogo pred zbiranjem več. |
| naraste | pada | Regresija. Sumite usposabljačnega mešanice, spremenjene kamere ali zmešanosti kontrolne točke pred sumjenjem metode. |
Pasti 2: brez fiksnega protokola merite sobo
Vrednotenje realno-robot je drago in težko ponoviti. Avtorji SIMPLER motivirajo simulirano vrednotenje z opazko, da vrednotenje takih politik v realnem svetu ni razširljivo in se sooča z izzivi ponovljivosti, ki se bodo verjetno poslabšali, ko politike razširijo njihov spekter nalog. RoboArena ga napada z druge strani, z več kot 600 pairwise realno-robot vrednotenja episod čez sedem generalistskih politik, ki jih vodijo vrednotovalci na sedmih akademskih institucijah na platformi DROID. Njegovi vrednotovalci izberejo svoje lastne naloge in okolja, vendar morajo soditi pare politik slepo; članek poroča, da ta prispevek od množice rangiranja bolje sledi zmogljivosti generalistske politike kot običajno, centralizirana vrednotenja.
Ne boste tekli 600 povezanih epizod na enem SO-100 v delavnici. Kar lahko naredite je odstraniti različnost, ki jo nadzorujete - seznam dovolj dolgočasen, da ga običajno preskočijo.
| Dimenzija | Zamrzni to | Kaj se premika, če ne |
|---|---|---|
| Začetna drža | Napisana domača položaja, vozila pred vsakim poskusom | Trajektorija se začne izven porazdelitve |
| Predmeti | Oznake z trakom in isti fizični predmeti, rezervirani za vrednotenje | "Boljša" politika je res bližji predmet |
| Kamere in luč | Enake namestitve, indeksi, osvetlitev; zaslonke zaprte; fotografija postavitve | Zgolj zamenjani indeksi kamer lahko dominirajo rezultat |
| Poskusi in pravilo zaustavitve | Fiksno n, fiksni čas čakanja, merilo napisano pred rundo | Kriteriji post-hoc spremenijo skoraj zmanjki v kar koli potrebujete |
| Vedenje operaterja | Ni intervencij med poskusi vrednotenja | Vrednotenje postane druga sejsa popravkov |
Nato aritmetika, nepopustljiva pri štetjih poskusov, ki si jih stisnete v delavnici. Pod normalno aproksimacijo je 60-odstotni uspeh čez 20 poskusov s standardno napako blizu 11 odstotnih točk - kvadratni koren od 0,6 krat 0,4 čez 20 - in razlika med dvema takima rundama je približno 15. Skok od 60 do 70 odstotkov je zato skladen z nič, kar se je zgodilo. Petdeset poskusov prinese na-rundo številko na približno 7 točk in stane popoldne.
Ta asimetrija je argument za stopnjo intervencije: izračunana čez tisoče slik namesto dvajsetih binarnih rezultatov, se pomika prej in gladkeje. Opomka je, da so slike v epizodi močno korelirane - en slab prijem prinese sto zaporednih slik intervencije - zato je učinkovita velikost vzorca bližja številu prevzemov. Obravnavajte stopnjo kot zgodnji indikator in stopnjo uspeha kot počasno talno resnico.
Epizode vrednotenja nikoli ne smejo vstopiti v sestavljeni nabor usposabljanja - sicer je runda n+1 ocenjena na podatkih, na katerih je bila usposobljena, in krivulja meri memoriko.
Pasti 3: usposabljanje samo na popravkih upogiba politiko
Popravki so zanimivi podatki, zato je instinkt usposabljati se na njih. Ne. Prihajajo s konstrukcijo iz ozke rezine prostora stanja, kjer je bila politika že propadala in skoraj nič ne povejo o večini teka, ki je delala. Fino nastavite samo to rezino in dobite politiko dobro za opomoč iz popravljenega pristopa, ki je pozabila, kako narediti čistega.
Mandlekar in njegovi sodelavci so gradili svoj sistem daljinskega posredovanja okrog tega. Njihov okvir: naloge manipulacije vsebujejo regije ozke grla, ki zahtevajo zaporedje natančnih dejanj - vstavitev kapsule v kavni aparat je njihov primer - kjer majhna odstopanja vodijo v stanja, ki jih demonstracije nikoli niso pokrivale. Njihov algoritem iterativno usposobi na nove podatke, tako da politika nauči prečkati tiste grlat ozka mesta, in poročajo, da agenti usposobljeni na podatkih intervencije premagajo agente usposobljene na enakovrednem številu vzorcev od ne-intervencijskih demonstratorjev.
- Hitro: kratek tek čez nekaj ducat epizod je poceni dovolj, da se ponovi
- Ciljano: gradient je dominiran s stanjem, ki se vam zdi
- Poceni za testiranje, ali je slog popravka sploh učljiv
- Porazdelitev fino nastavljanja ne spominja več na porazdelitev naloge
- Nominalno vedenje se lahko vidno poslabša v eni sami rundi
- Stopnja se lahko zmanjša, medtem ko uspeh pade z njo - čiste segmente zamenjane za opomore
Razmerje mešanice je hiperparameter in si zasluži biti napisan. Sestavljanje naslednjem nabora podatkov je tam, kar se odloči: originalne demonstracije plus nabor popravkov, izbira epizode jasno po viru namesto pravila, ki tiho vleče kar je na voljo. Tu je to en korak sestavljanja v kokpitu, rezultat pa je navaden nabor podatkov - glej dokumentacijo usposabljanja. Noben instrument ne naredi za vas beleženja, kaj razmerje je proizvajalo katero krivuljo.
Pasti 4: človek ni konsistenten strokovnjak
Teorija DAgger predpostavlja strokovnjaka. V tehnističnem smislu niste: vaši popravki niso vzorci iz fiksne pogojne porazdelitve nad dejanji. Avtorji ACT to poimenovali, ko so našteli ovire za fino manipulacijo - napake se sestavljajo skozi čas, in človeške demonstracije so lahko nestacionarne. Njihov sistem vseeno doseže 80 do 90 odstotkov uspeha na šestih resničnih nalogah z desetih minut demonstracij, zato je problem rešljiv, ne odsoten.
Študija robomimic to dokazuje z strani podatkov. Čez šest algoritmov brez interneta na petih simuliranih in treh resničnih multi-stopnjskih nalogah, se v njenih poukih pojavljajo občutljivost na izbiro zasnove, odvisnost od kakovosti demonstracij in - tista, ki najbolj boli tu - spremenljivost, ki nastane iz kriterijev zaustavitve, ker se cilja usposabljanja in vrednotenja razlikujeta. Kontrolna točka z najmanjšo izgubo ni zanesljivo tista z najvišjo stopnjo uspeha.
To je strojno različica: vhodna način oblikuje popravek. voditelj-sledilec nastavka proizvaja neprekinjene, ljudskim tempom vodene tirnice. Tipkovni potisni so togi stisnjeni s strani strežnika - dve stopinji na klic na sklepih roke, štiri na prijemalu - zato ista namena prispejo kot stopnice majhnih korakov. Drsniki pošiljajo absolutne cilje in strežnik se premakne največ šest stopin proti njim na klic. Tri modes, tri porazdelitve dejanj; mešanje vseh treh v en nabor popravkov in nato vprašanje, zakaj je pristop postal trepetal, je samouporabnašajočo se. dokumentacija teleopracijske pokriva, kaj vsak način pošilja.
Uteženje intervencij: IWR in kaj je prišlo nato
Če so popravki dragoceni manjšina, je načelni popravek utež namesto izključnosti. Intervention Weighted Regression je referenčna implementacija: podatki se razdele na intervencijske in ne-intervencijske vzorce in oba razdelka se vzorčujeta v enaki proporci med usposabljanjem. Nabor popravkov, ki je pet odstotkov slik, nato prispeva polovico gradientu, brez da bi nominalno vedenje izginjalo iz porazdelitve.
Enaka proporc je začetna točka, ne zakon. Sirius jo posploši z zamenjavo binarnega razdelka s kontinualno težo iz približanega človeško zaupanja; Sirius-Fleet premakne odločitev navzgor, z uporabo vizualnega svetovnega modela in napovedovalcev anomalij, da se odloči, kdaj je človek sploh prosjen. Skupna nit: zastavica intervencije je signal usposabljanja, ne samo stolpec knjižnice.
| Metoda | Kdo se odloči, kdaj deluje človek | Kako se uporabijo podatki intervencije | Poročani rezultat |
|---|---|---|---|
| DAgger (2011) | Fiksni razpored; strokovnjak oznake obiskane stanja | En rastoči nabor podatkov, neutežen | Okvirjeno kot zmanjšanje na učenje brez obžalovanja na spletu |
| HG-DAgger (2019) | Človek, gating kontrolo na realnem sistemu | Zbrano; plus naučena prag varnosti na negotovosti modela | Bolje kot DAgger in BC v voznji; podana ne intervencijska štetja |
| IWR (2020) | Človek, preko daljinske teleopracijske | Intervencija in ne-intervencijske vzorce narisane v enaki proporci | Premaguje ne-intervencijske demone pri enakem štetju vzorcev |
| Sirius (2022) | Človek, med uvedbo | Uteženi BC, uteženi iz približanega človeško zaupanja | 8 % dobitek v simulaciji, 27 % na resnični strojni opremi; 2x hitrejša konvergenca |
| ThriftyDAgger (2021) | Sistem, gating na novost in tveganje | Interaktivna zbirka pod nadzorom proračuna | Uporabniška študija (N=10): 58 % višja človeškemu in 80 % višja robota zmogljivost od naslednje najboljše metode |
| Fleet-DAgger (2022) | Sistem, dodeljevanje pozornosti čez floto | Fleet učenje ocenjena s Povratkom za ponovno Človeško Nalogo | Do 8,8 krat višja ROHE kot osnove |
| Sirius-Fleet (2024) | Napovedovalci anomalij s samoadaptivnimi merili | Multitasking učenja z vizualnim svetovnim modelom | Manj zahtevkov intervencije, ko se avtonomija izboljšuje |

Štiri metrike, vredno beleženja ob stopnji
- Prevzemi na tek. Dvajset kratkih popravkov in en dolg dajo podobne stopnje in opisujejo različne politike - ena trebljiva, ena z enim slepim psom.
- Povprečna dolžina intervencije. Naraščajoča dolžina s padajočim štetjem pomeni, da preostale napake so težke, kar je to, kako izgleda pozni napredek.
- Čas do prve intervencije. Politika, ki se napreduje pred potrebo pomoči, se izboljšuje tudi, kadar je skupna stopnja ravna.
- Mesto grozda intervencij. Raven zastavico po normaliziranem napredku epizode; stabilni vrh čez runde kaže na eno grlo.
Protokol runde, ki ga lahko dejansko tekete
Izmerjena runda ima šest korakov in proizvaja eno vrstico v dnevniku. Prva štiri so zanka; zadnja dva jo naredita meritev.
- 1Zamrzni protokol vrednotenja pred rundo nič
Zapišite začetno drži, umestitev predmeta, kamere, štetje poskusov, čas čakanja in kriterij uspeha. Fotografirajte mizo. Če se mora dokument spremeniti, se serija ponovno preuči.
- 2Izmeri osnovno vrednost
Tekite protokol brez intervencij in zapišite uspehi; nato tekite eno instrumentirano sejo s prevzemom omogočenim in zapišite stopnjo. Ti dve števili sta runda nič.
- 3Zberite popravke v enem samem doslednem slogu
Ena vhodna način na rundo, en operater, če se lahko spopadate z njo. Prevzemite na merilu, ki ga lahko navedete na glas - "prijemal bolj kot dve centimetra stran pri pristopu" - in ga držite za rundo.
- 4Razvrsti vsako epizodo istega dne
Popravek, vrednotenje ali zavrženje. Dvomljive epizode se zavržejo, ne shranjene po teoriji, da več podatkov pomaga - popravek, v katerem ste sami fumla, je slabši kot nobena epizoda.
- 5Sestavi mešanico jasno
Originalne demonstracije plus popravki, izbira epizode jasno po viru. Zapišite osnovno štetje, popravečno štetje in katero koli utež - to je polje, ki ga boste hoteli čez tri tedne.
- 6Nadaljujte od kontrolne točke, nato ponovno merite
Usposobite sestavljeni nabor podatkov od prejšnje kontrolne točke namesto osnovnega modela, tekite zamrznjeni protokol plus eno instrumentirano sejo, dodajte vrstico in primerjajte z prejšnjima dvema rundama.
Dve meji spremenita, kako berete šibko rundo. Nadaljevanje od kontrolne točke inicijalizira uteži iz nje - ne povzetek optimizatorja, zato se razpored znova začne in kratek tek od konvergentne kontrolne točke se malo premakne. In gibanje poravnave vodje na začetku prevzema ima najmanj prevozenih kilometrov na resnični opremi vsega v verigi; če se popravki vsi začnejo z čudnim prehodnim, glejte tam pred krivljenjem mešanice.
Izmerjena zanka, že preslicana
ay-robots implementira te šest korakov kot funkcionalnosti izdelka: prevzamete sredo-tek od vodje roke, tipkovnice ali drsnikov, z intervencijskimi slikami označeni avtomatično; razvrstite vsako epizodo kot popravek, vrednotenje ali zavrženje; sestavi naslednji nabor podatkov iz originalnih demonstracij plus popravkov, izbira epizode jasno po viru; in začni naslednji potek usposabljanja od prejšnje kontrolne točke namesto osnovnega modela.
Poglejte, kako DAgger zanka delujeKaj števila ne morejo povedati
Nič od tega ni rešeno in urejena krivulja vas ne bi smela drugače prepričati. Stopnja intervencije meri skupni sistem - politika, strojno opremo, operaterja, sobo - in ne pripisuje ničesar same. Ne more soditi, ali so bili popravki dobri, in bo padala z veseljem na nalogo, ki je postala lažja, ker se je predmet premaknil dva centimetra bližje čez tri tedne.
To naredi je spremeniti nejasno vtis v stolpec, s katerim se lahko prepričate. Alternativa ni boljša metrika; to so tri tedne zbieranja popravkov, ki bi vam krivulja po rundi tri povedala, da prenehate zbieranja. Pregledno literaturo definirajte interaktivno učenje z posnemovanjem kot človeško povratko, ki se daje občasno med izvajanjem robota, ki dovoljuje spletno izboljšavo vedenja; družina je široka, nobena razporeditev tega ne deluje brez številke na rundo. Poglejte tudi vodnika SO-100 učenja z posnemovanjem za osnovni nabor podatkov, ki ga mesite proti, tekanje politike za stran sklepanja in stran DAgger zanke za implementirano cev.
Ali je stopnja intervencije samo ena minus stopnja uspeha?▾
Ne. Stopnja meri, koliko od teka ste prevzeli; stopnja uspeha meri, ali je bila naloga opravljena brez vas. Tek se lahko pojavi s 30 odstotno stopnjo intervencije in tek brez intervencij se lahko popolnoma ne pojavi. Se tudi razlikujeta v šumu: stopnja se gladko premika čez tisoče povezanih slik, stopnja uspeha skoči med graščo binarnih rezultatov. Beležiti oba.
Koliko poskusov vrednotenja potrebujem, da ima stopnja uspeha kaj pomena?▾
Več kot se zdi razumno. Pod normalno aproksimacijo, 20 poskusov pri pravi 60 odstotni stopnji uspeha nosijo standardno napako blizu 11 odstotnih točk, zato je 10-točkovni premik med rundami neločljiv od šuma; 50 poskusov prinesejo to številko na približno 7. Če si ne morete privoščiti 50, ohranite štetje poskusov enako čez runde in majhne premike obravnavajte kot neodločne.
Kakšno razmerje mešanice demonstracij do popravkov bi moral začeti?▾
Dokumentirani začetna točka je IWR: razdeliš podatke na intervencije in ne-intervencijske vzorce in jih črpaš v enaki proporci, zato popravki prispevajo polovico gradientu ne glede na to, kako majhen delež slik so. Če vaša postavka ne more utežiti vzorčenja, jo približajte skozi štetje epizod pri sestavljanju nabora podatkov in zapišite razmerje. Usposabljanje samo na popravkih je možnost, ki jo je treba izključiti.
Moja stopnja intervencije se je povečala po rundi. Ali je runda zavržena?▾
Ni nujno, ampak najprej preverite dolgočasne razlage: ali se je kontrolna točka, ki ste jo vozili, ujemala s tisto, ki ste jo usposabljali, je indeks kamere ali namestitve spremenjen, je umestitev predmeta premikala, je bil slog popravka skladen. Če so vsi štirje čisti in je stopnja uspeha seznanjena tudi padla, sumite mešanico - premalo osnovnih demonstracij zoper popravke ali popravki, ki se medsebojno nasprotujejo. Prava regresija sodi v dnevnik, ne v koš.
Ali lahko preskoči fiksni protokol vrednotenja in samo gledam stopnjo intervencije?▾
Samo če sprejmete, da ne morete ločiti napredka od priprave. Stopnja je odvisna od vaše lastne časovne proge za poseganje, in ta prag pada, ko se privadite posebnostim politike. Zamrznjeni protokol je del meritve, ki ga vaš prag ne more doseči - oznake z trakom, napisana domača drža, fiksno štetje poskusov, merilo odločeno pred rundo. Mora ostati nespremenjena čez serijo.
Ohranite dnevnik v spremiščišču, ne v zvezku: runde so dni narazen, strojno opremo se ponovno gradi, in oseba, ki bere krivuljo v oktobru, ste vi brez spomina na avgust. pogosto zastavljena vprašanja dokumentacije pokriva operacijske podrobnosti, ki so tukaj izpuščene.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started