
Običajni DAgger od človeka zahteva, da označi stanja medtem ko se robot še vedno premika. Na pravi strojni opremi je to nevarno in daje slabe oznake. Varovane variante slepega označevanja zamenjajo s poljem ki ga mora držati nekdo: človek pri HG-DAgger, varnostni klasifikator pri SafeDAgger, nestrinjanje skupne množice pri EnsembleDAgger, ocenjena novost in tveganje v proračunu pri ThriftyDAgger. Ta članek jih primerja po tem, kdo ima polje, kaj ga odpre in kaj vsaka stane — ter zakaj je oblika s človeško kontrolo tista, ki preživi stik s pravim ramenom.
Klonirana politika odpove tam, kjer se izurjevalni podatki iztečejo. Popravka je, da bi nadaljevali s prikupljanjem podatkov pod lastno porazdelitvijo stanj politike namesto demonstratorja, kar počne DAgger in kaj uvod v zbiranje nabora podatkov pokriva od samih osnov. Pusti odprto neprijetno lastnost prvotnega algoritma: medtem ko se učenec premika, je strokovnjak domnevno rekel, kaj bi naredil, za vsako stanje, brez da bi imel nadzor.
V simulatorju s skriptiranim strokovnjakom, ki je prost. Na mizi s pravim ramenom zraven, ni niti brezplačno niti varno. Avtorji HG-DAgger precizno navedejo ugovor: takšne sheme vzorčenja "zahtevajo od strokovnjaka, da zagotovi oznake dejanj brez polnega nadzora sistema", kar "lahko zmanjša varnost in, kadar se uporabljajo ljudje kot strokovnjaki, verjetno poslabša kakovost zbranih oznak zaradi zaznane zakasnitve aktuatorja" (Kelly et al., 2019). V tej poveški se skrivata dve napaki: politika se ve naprej premika v stanja v katera je nihče ne želi, in oznake kupljene s tem tveganjem so slabše od tistih, ki jih proizvede človek medtem ko drži nadzore. Vsaka varianta spodaj odgovarja na isto vprašanje — postaviti polje na nadzor in nekoga pustiti, da se odloči kdaj se odpre. Razlikujejo se v tem, kdo je ta nekdo.
Kratka različica
- •Varovane variante nadomestijo slepo označevanje s stikalom med politiko kontrolo in strokovnim nadzorom. Kar jih loči je, kdo ima stikalo.
- •HG-DAgger daje stikalo človeku in zbira le podatke, snemane medtem ko je imel človek neprekinjen nadzor.
- •SafeDAgger ji daje binarni klasifikator, ki predvideva odklon od referenčne politike; EnsembleDAgger zahteva nizko varianco skupne množice in majhno razdaljo do strokovnega dejanja hkrati.
- •LazyDAgger dodaja histerez, da se nadzor ne premika sem ter tja; ThriftyDAgger postavlja polje na novost ali ocenjeno tveganje s eksplicitnim proračunom intervencije.
- •Signali nadzora na robotu potrebujejo nekaj kar je popravljeno VLA na ramenu razreda hobi ponavadi pomanjka: referenčno politiko, poceni skupno množico, ali kalibrirano epistemično negotovost.
- •Polje je pol metode. Kaj se zgodi s segmenti intervencije pozneje — mešanje, uteženje, agregacija — se odloči ali je krog izboljšal kaj.
Človeško in robotsko: razdelitev ki je važna
Interaktivno učenje z posnemovanjem ima lastno anketo; Celemin in kolegi ga katalogizirajo skupaj s povratno informacijo, vmesnikom, modelom učenja, izkušnjami uporabnika, aplikacijo in primerjavo. Razdelitev ki odloči o vašem inženirstvu je enostavnejša kot kateri koli od teh osi, in nedavno delo jo neposredno poimenuje: metoda je človeško-vratna kadar se nadzornik odloči za intervencijo, in robotsko-vratna kadar se agent odloči za prošnjo za pomoč (Cai et al., 2025). Vse ostalo je mehanizem ki служи eni od teh dveh izbir. Trgovina je vidna od začetka: človeško polje stane neprekinjeno pozornost, in robotsko polje obljublja vrniti to pozornost — vendar le če je signal ki ga drži zaslužen, in zgraditi ta signal je njegova lastna raziskovalna težava.
SafeDAgger: klasifikator ki predvideva svoje odstopanje
SafeDAgger Zhanga in Cha (2016) je najzgodnjši od teh polj. Poizvedovanje referenčne politike je drag del, zato majhna mreža — varnostna politika — predvideva ali je poizvedovanje sploh vredno. Vrne "binarni oznako, ki nakazuje ali je primarno politika verjetno odstopila od referenčne politike brez poizvedovanja". Oznaka je определена proti kvadrirani razdalji L2 med dejanji obeh politik s pragom tau, in klasifikator je prilegajoč s prečnim entropijo. V času izvajanja se odloči na stanje ali se učenec ve naprej premika ali se referenca prevzame. Povzetek poroča o manjšem poizvedovanju referenčne v simulator dirke avtomobila plus pospešitvi konvergence, ki jo avtorji pripišejo učinku avtomatskega učnega načrta, brez podajanja številke za eno ali drugo.
Ulov je v definiciji, ne v rezultatih. Usposabljanje klasifikatorja zahteva dejanje referenčne politike na vsakem stanju uporabljeno za prilagoditev, kar se domneva da je referenca drug program. Če je vaša referenca oseba z vodilnim ramenom, ta niz oznak ni poceni in metoda izgubi lastnost za katero je bila zasnovana.
EnsembleDAgger: dvom in nesoglasje, oboje
Menda, Driggs-Campbell in Kochenderfer (2019) obravnavajo polje kot verjetnostno vprašanje. EnsembleDAgger "približa Gaussov proces z naborom nevronskih mrež" in bere varianco skupne množice kot posrednika zaupanja: visoka varianca pomeni območje za razliko od izurjevalnih podatkov, kar — ob predpostavki da strokovnjak izogiba stanjem neuspeha — se ujema z bližino neuspehu. Pravilo je združenje. Učenec ima lahko le dejanja kadar razdalja L2 med njegovim povprečnim dejanjem in strovno dejanji ostane pod enim pragom (nesoglasje) in varianca njegovega napovedanega dejanja ostane pod drugim (dvom). Če katerikoli ne uspe, strokovnjak prevzame nadzor. Cilj je povečati delež dejanj učenca medtem ko se omejuje verjetnost neuspeha; članek poroča o izboljšani varnosti in učenju proti drugim DAgger variantam na obrnjenem nihalu in MuJoCo HalfCheetah.
To tiho diskvalificira polno pravilo za nadzor brez rok. Razdalja med dejanji učenca in strokovnjaka zahteva dejanje strokovnjaka na tem stanju, v tem trenutku. S skriptiranim strokovnjakom je dobro. S človekom mora človek nenehno proizvajati dejanja — točno breme ki so ga varovane variante imele za namenom odstraniti. Besedilo dvoma je samo brez rok; združenje ne.
LazyDAgger: ustavi stikalo pred treskanjem
Hoque in kolegi (2021) so napali stroške katere prejšnja dela niso merila: stikalo sebe. Vsaka intervencija "prekine drugo delo ki ga operater počne, ima zakasnitev z vsako spremembo konteksta med nadzorom in samoiniciativnim nadzorom, in zahteva čas za izvedbo". Polje ki se odpira in zapira desetkrat na minuto je slabše kot tisto ki se odpira enkrat za deset sekund, ob enaki samoiniciativni delitvi. LazyDAgger razširja SafeDAgger z asimetričnimi pragami — težje vstopiti v nadzor nadzorovane kot ostati vanj — tako da se sistem ne nihanja na meji. V simulaciji "zmanjša zamenjave konteksta za povprečno 60% nad SafeDAgger na 3 nalogah zveznega nadzora medtem ko ohranja napredne zmogljivosti politike"; pri manipulaciji tkanine z ABB YuMi "zmanjša zamenjave konteksta za 60% medtem ko doseže 60% višjo uspešnost kot SafeDAgger ob času izvajanja".
ThriftyDAgger: novost ali tveganje, v proračunu
ThriftyDAgger (Hoque et al., CoRL 2021) se začne od proračuna nadzornika namesto politike. "Uporablja naučeno politiko stikala za prošnjo intervencij le na stanjih ki so dovolj (1) novosti, kjer politika robota nima vedenja za posnemovanje, ali (2) tveganja, kjer ima robot nizko zaupanje v izvedbo naloge", s novo metriko za oceno tega tveganja. Proračun je vnos, ne rezultat: navedete koliko časa človeka boste porabili. Uporabljen ob času izvajanja metoda "doseže 100% uspešnost na simulaciji in fizičnih nalogah", in študija uporabnika z desetimi sodelavci ki upravljajo floto treh robotov ob strani naloge koncentracije poroča da "povečuje zmogljivosti človeka in robota za 58% in 80% v primerjavi s naslednjo najboljšo algoritmo medtem ko zmanjšuje breme nadzornika". Postavka flote je naravni dom za to delo; Fleet-DAgger je pozneje formaliziral interaktivno učenje flote z več roboti in nadzorniki, predlagajući povratek na človeško napor kot količino optimizacije.
HG-DAgger: človek drži polje
Kelly et al. (2019) gredo drugače. Ni politike stikala. Učenec je roliran "dokler strokovnjak opazi da je novinec vstopil v nevarno območje prostora stanja", ob katerem točki strokovnjak prevzame nadzor in vodijo sistem nazaj. Pravilo agregacije je strogi del: "Oznake dejanj strokovnjaka se zbirajoio in dodajajo naboru podatkov le med temi obnavljalnimi trajektorijami, med katerimi je imel strokovnjak neprekinjen nadzor sistema." Nič se ne označi medtem ko je človek gledalec.
Se ne ustavi na stikalu. HG-DAgger tudi "se uči varnostni prag za metriko tveganja osnovano na negotovosti modela, ki se lahko uporabi za napovedovanje zmogljivosti v celoti usposobljenega novinceа v različnih področjih prostora stanja": zapisuje kako negotov je bil učenec ob trenutkih ko je intervencija človeka in povpreči zadnjo četrtino teh zapisov, kjer se novinec najbolj spreminja v svojo končno obliko. To ni polje ki ga robot deluje vendar diagnoza ki ti pove kam je pričakovanja da je končana politika drži. Ocena zajema simulirano in pravo nalogo vožnje in poroča o izboljšanih zmogljivostih pred DAgger in posnemovanjem vedenja.
Ena sorodno linija spreminja kaj se šteje kot oznaka. Spencerjev Expert Intervention Learning in kolegi poimenuje da "kateri koli znesek povratne informacije strokovnjaka, bodisi z intervencijo ali ne-intervencijo, zagotavlja informacije o kakovosti trenutnega stanja, optimalnosti dejanja, ali oboje", formaliziran kot omejitev na funkcijo vrednosti učenca in rešen s ne-obžalobljenim spletnim učenjem. Pod tem branjem so raztegi kjer je človek gledal in nič ne počne šibka pozitivna napora namesto prazno. EIL se uči izogibanju trkom od približno ene minute strokovnega nadzora.

Variante skupaj
| Metoda | Kdo odpira polje | Signal | Potrebno | Poročano |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Nihče — učenec vedno vozi | Nič; strokovnjak označi vsako obiskano stanje | Strokovnjak zmožen oznak čez politiko medtem ko nima nadzora | Zmanjšanje brez obžalovanja z zagotovili pod porazdelitvijo stanja učenca |
| HG-DAgger (Kelly et al., 2019) | Ljudski nadzornik | Nadzornikova presoja da je stanje nevarno | Nekdo ki gleda, in čist prenos nadzora | Pobeči DAgger in posnemovanje vedenja na simulirani in pravi nalogi vožnje; tudi se uči pragа tveganja |
| SafeDAgger (Zhang & Cho, 2016) | Robot | Binarni klasifikator za odklon L2 od referenčne zgoraj tau | Poizvedljiva referenčna politika za oznake klasifikatorja | Manj poizvedb referenčne v dirkalnem simulatorju, hitrejša konvergenca (ni podane številke) |
| EnsembleDAgger (Menda et al., 2019) | Robot | Varianca skupne množice in razdalja do strokovnega dejanja, oboje pod pragom | Nabor mrež plus dejanje strokovnjaka na vsakem koraku | Izboljšana varnost in učenje na nihalu in HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Robot, s histerez | Signal SafeDAgger s ločenimi pragami vstopa in izhoda | Kaj SafeDAgger potrebuje, plus drugi prag za nastavko | ~60% manj zamenjav konteksta na 3 nalogah; 60% višja uspešnost na YuMi tkanini |
| ThriftyDAgger (Hoque et al., 2021) | Robot, v proračunu | Novost, ali ocenjeno tveganje neizvedbe naloge | Naučena ocenjevalka tveganja in navedeni proračun intervencije | 100% uspešnost ob času izvajanja; študija uporabnika (N=10): 58% in 80% povečanja nad naslednjo najboljšo |
| EIL (Spencer et al., 2020) | Človek — ne-intervencija šteje tudi | Intervencija in njena odsotnost kot omejitvi na funkcijo vrednosti | Spletno učenje brez obžalovanja nad vrednostno omejitvijo | Izogibanje trkom od približno ene minute strokovnega nadzora |
Kaj vsako polje kupuje in kaj zaračuna
Berite navzdol stolpec "potrebno" in vzorec pada ven: vsak robotsko-vratni signal tam je posrednik ki se mora narediti, in vsak posrednik ima svoj račun.
- Signali nesoglasja (SafeDAgger, LazyDAgger, pol EnsembleDAgger pravila) potrebujejo referenčno politiko. Ali ste skriptiran strokovnjak, v katerem primeru je že rešeno zanimivo vprašanje, ali človek nenehno proizvaja dejanja v ozadju tako da se razdalja izračuna.
- Signali dvoma potrebujejo umerjeno epistemično negotovost. Nabor majhnih mrež nadzora jo približa; nabor tri-milijard-parametra viziji-jeziku-dejanju modela je problem prvi spomin in zakasnitev.
- Signali novosti in tveganja potrebujejo naučeni ocenjevalko naloge dokončanja, prilagojeno na dovolj uspešne in neuspešne roluje. Na nalogi ki jo še počakate da dela, ti podatki ne obstajajo v prvem krogu.
- Človeško polje potrebuje pozornost in nič drugega — edini signal na voljo na prvi dan, na katerikoli politiki arhitekturi, brez dodatnega modela za učenje.
- Brez robotskega polja se človek iz sobe ne izvleče. Zmanjšajo kako pogosto se mora človek pojaviti, ne pa da mora biti prisoten.
Je tiho razlika v kaj polje proizvede. Robotsko polje streljanj sredi trajektorije rokuje osebo premičnim ramenom na poljubnem stališču. Človeško polje dopušča operaterju izbrati trenutek — po dohvatanju, pred stiskanjem, ne sredi nihanja. Obnavljalni segmenti dveh niso enako čisti in ti segmenti so celoten proizvod kroga.
Zakaj človeško-vratna oblika zmaga na pravi opremi
To je inženirski argument, ne rezultat primerjave — ni papirja ki smo ga našli teče vse pet polj na istega manipulatorja z isto razredom politike. Počiva na štirih točkah.
Prvo, nadzornik je tam vsekakor. Nihče ne pusti SO-100 roka teči brez nadzora ob objektih ki jih lahko prevali. Enkrat ko je nekdo gledalec je obrobni stroški dajanja prejima gumb za prevzem zelo blizu nič; zgraditi umerjeno ocenjevalko tveganja je projekt.
Drugo, negotovost ki jo pravzaprav lahko merite na sodobni politiki je pogosto napačna količina. Difuzijsko ali tok-ujemanje glava proizvaja varianco čez vzorčene koščke dejanja in ta varianca odraža multimodalnost ki jo je glava učena predstavljati, ne epistemično negotovost o stanju. EnsembleDAgger dvom izraz uporablja nabor natanko za zajemanje slednjega. Dva izgledajo kot ista številka in nista; delitev akcije in tok ujemanja vnosi pokrivajo kako te glave oddajajo dejanja najprej.
Tretje, neuspehi ki so važni v manipulaciji so pogosto semantični namesto statistično nenavadni. Politika ki zapira gripper dva centimetra zgaj ali doseže zanesljivo za napačno od dveh enakih kock ni v stanju visoke variance — je zanesljiva in napačna. Brez praga variance to ulov; oseba ki opazuje ga ujame takoj.
Četrte, kakovost oznake — prvotna HG-DAgger točka, in ena ki se najbolj pogosto preskoči. Oznake zbrane medtem ko je imel človek neprekinjen nadzor premagajo oznake narralizirane nad gibajočim sistemom. Če je cilj korekcijski podatki vredni agregacije, je breme dokazovanja leži z avtomatskim poljem.
Slika se obrne ko je en nadzornik odgovoren za več robotov — režim ThriftyDAgger študija uporabnika in Fleet-DAgger formalizacije tarča. Z floto je človeška pozornost redka vir in nepopolna razdelitev premaga brez. Z enim ramenom na enem namizju niste v tem režimu.
Človeško-vratna zanka, že povezana
Prevzem med tečajočo seanso sklepanja, per-okvir oznake intervencije na popravljenih segmentih, kuracija vsake teče v popravke ali oceno, sestava mešanega nabora podatkov iz virov ki jih izberete, in nadaljevanje usposabljanja od obstoječega nadzornega mesta so vgrajeni namesto pisani z roko. Prevzem deluje z vodilnim ramenom, ali s tipkovnico in drsniki če jih nimate.
Pridi kako DAgger zanka tečePolje je pol metode; upravljanje podatkov je druga pol
Polje se odloči kateri okviri so jih vozili ljudje, ne kaj s tem početi, in ta druga odločitev je kjer se krogI najpogosteje potratijo. Prvo pravilo je tisto kar D v DAgger pomeni: agregiraj, ne zamenjaj. Fino ladjenje nadzornega mesta čisto na nekaj sto korekcijskim okvirjem ti da model ki je videl skoraj nič ampak obnavljanja in je pozabil nominalno trajektorijo.
Drugo pravilo je da intervencijski okviri niso navadni okviri. Mandlekar et al. zgrajeni oddaljeni-teleoperacijski sistem za 6-DoF manipulacijo pustila operaterje nadzor politike in prevzemi na neuspehu, nato usposobljeni iterativno z algoritmom ki "spodbuja politiko da se nauči kako prečkati ozka mesta skozi intervencije"; agenti usposobljeni na teh podatkih premagali agente usposobljene na enaki številki navadnih vzorcev demonstracij. Sirius potiska idejo v namestitev, "ponovno uteženje vzorcev usposabljanja z približano človeškim zaupanjem in optimizacijo politik z uteženim posnemovanjem vedenja". Oboje potrebuje per-okvir oznako kaj je vodilo človeške, ki je zakaj intervencija oznaka je važnejša kot izgleda.
Tretje pravilo je da avtomatska mešanja je past. Sestava naborov podatkov ki virov ne morete šteti je ena ki je ne morete razhroščiti ko se naslednjo krog poslabša. Na tej platformi je koraka sestave je eksplicitan za to razlog — prvotni nabor podatkov plus popravki, izbor epizode na vir, in rezultat je navadna LeRobot nabor podatkov da sinhronizira in usposobi kot drugače; dokumentacija nabora podatkov pokriva stran formata.
| Korak v krogu | Kaj proizvede | Najbolj pogost način se slabo zgodi |
|---|---|---|
| Teči sklepanje z snemanjem na | Teči pod lastno porazdelitvijo stanj politike | Snemano kot navadna teleoperacija, izgubljeno da je politika vozila |
| Prevzem na neuspehu | Korekcijski segmenti s per-okvir oznako intervencije | Popravljanje lepotnega tresenja, učenje sloga namesto obnavljanja |
| Kuracija vsake epizode | Popravki, ocena, ali zavržki | Hranjenje vsega; napačen prevzem stane več kot je bila epizoda vredna |
| Sinhronizacija popravkov | Različna različica nabora podatkov ob strani prvotne | Popravki ki nikoli ne zapustijo lokalni stroj |
| Sestava mešanega nabora podatkov | Prvotna plus popravki, eksplicitna izbira | Tiho avtomatska mešanja, tako da poznejša regresija ne more biti izsledena do vira |
| Nadaljevanje od nadzornega mesta | Nadzorno mesto inicializirano iz prejšnjega | Pričakovanje optimizator povzetka; uteži inicializirajo model, ne obnovijo stanja optimizatorja |
Nastavitev polja ki ga lahko oseba drži
"Človek se odloči" ni specifikacija. Dva operaterja z različnimi pragami proizvajata neprimerljive kroge, in drsečim pragom proizvaja trend ki ga ne morete prebrati. Napiši sprožilce pred prvo teko.
- Imeni pogoje ki odpirajo polje — pristop napačen za več kot fiksno maržo, gripper zapira na nič, sklepa ki drsejo proti meji, zastoj več kot sekundo ali dve — in ohranjaj seznam nespremenjen za krog.
- Imeni kaj to ne odpira. Preskok politika se okupira od sebe je signal usposabljanja; prevzem tam briše obnavljanja ki ga že pozna.
- Prevzem dovolj zgodaj za čist prenos, roke hrbet takoj ko je stanje okupljivo.
- Beži zakaj ste prevzeli, per epizode. Tri krogI kasneje je to edini zapis ali se ista napaka vrne.
- Ohranjaj kamere, besedilo naloge in operater stalna čez kroge. Spremeniti eno in številke nesorazmerne.
Mehansko prenos ima dve varianti. Z vodilnim ramenom mora vodilni dosegniti položaj sledilnika pred prenosom navora, ali se ramo skoči; ta uskladitveni potez je najmanj testirana del verigi na pravi opremi. Brez vodilnega roka je prevzem ročni od prve tipke: sledilnik je drži in operater ga nežno potiska sklepo za sklep od tipkovnice ali vlečejo drsniki, s strežnika-strani sponkami držeč vsakem vnosu majhen — nekaj stopinj na tipko, nekaj na drsnik posodobitev, ker je velik korak v drži pose je kako si snamete servo. Korak za korakom različica s tipko vezavni je v sprehod skozi DAgger krog na SO-100; ozadje na obeh teleoperacijskih načinov je v teleoperacijska dokumentacija in vodilni-sledilnik vnos.

Branje ali je polje naredilo kaj
Metrika človeško-vratna krog je stopnja intervencije: intervencijski okviri deljeni z okviri teka. Ima eno nalogo — če ne pada čez kroge, krog niče kupil in naslednji bi moral spremeniti kaj drugega kot količino podatkov.
To je pristranski metrika in bi morali vedeti kako. Meri prag operaterja kot zmogljivost politike, ki je zakaj seznam sprožilcev ostane fiksn; operater ki se sprosti čez sejo proizvaja padajočo krivuljo z nič vraga. Tudi ignora resnostи — deset okvirjev za ustavo trka in deset za nudati gripper izgledajo identični. Pariti ga s fiksnim набира za oceno brez popravkov podatkov nikoli narisali od. Članek o meritvi DAgger zanke dela čez zasnovo ocenjevanja, vključno z kako ohranjamo epizode ocenjevanja iz mešanja usposabljanja.
- Dela na prvi dan, na katerikoli arhitekturi politike, brez dodatnega modela za umerjanje
- Ujame zanesljivo-in-napačne neuspeha nobena varianca prag zaznava
- Proizvede popravke snemane medtem ko je operater imel polni nadzor, ob trenutku katerega so si izbrali
- Izpuste per-okvir oznako da intervencija-utežene metode kot kot IWR in Sirius porabe
- Stroški neprekinjene nadzore; se ne skalira na eno osebo in mnogo robotov
- Odvisno od skladnosti operaterja — drsečim pragom pokvarjene stopnjo intervencije
- Proizvede brez modela tveganja samo; HG-DAgger naučeni prag in ThriftyDAgger ocenjevalka so dodatna mehanika
- Šteje okvire, ne posledic
- Ne more reševanja politiko ki neuspehu je vzgorvodno nadzora, kot zamenjana kamera ali napačno označena besedilo naloge
Odprta vprašanja vredna obdržati v pogledu
Primerjave so šibke. Spencer in kolegi pregled tistih uporabljenih za test pristopov posnemovanja učenja in ugotovil jih "izvedljivi in preprosti in zato neizkušeni za zajemanje težjih režimov napake sesipanja videni v pravem svetovanju odločanja težave" — in, nasproti obdajajočim литературе, ugotovil navaden obnašanje kloniranja se je dobro. To je razlog biti skeptičen katerekoli razvrstitve DAgger variant počiva na teh nalogah, vključno nekatere številke v tabeli zgoraj.
Robotska polja na velikih politikah niso rešena tudi. AIM delo zamenja negotovost s posrednikom Q-funkcijo mimična človeške intervencije pravila in poroča 40% izboljšanja v prevzem stroške in učenja učinkovitosti nad ThriftyDAgger — v zvezne in diskretne nadzor, ne na viziji-jeziku-dejanju modela vozijo manipulatorja. Ali je katerikoli od teh polj prenose fino-ladjenje VLA je odprto. Anketa naredi sorodnega točko: polje terminologijo in strukture niso enotne čez literatura, ki naredi metode težko primerjati. Na vašem lastnem ramenom, vaši dnevniki so dokazov ki ste jim.
Je HG-DAgger res DAgger če človek samo oznake med intervencijami?▾
Ohranja del ki je važen — podatki zbrani pod porazdelitvijo stanja učenec inducira, agregiran s kam je prišlo pred — in spušča del ki ne preživi stik s strojno opremо. Kelly et al. predstavi ga kot varianto; 2011 ne-obžalovanje jamstvo ne nosi preko nespremenjena.
Sem lahko uporabil robotsko polje na fino-ladjenje VLA politike na SO-100?▾
Ne direktno. SafeDAgger klasifikatorja potrebuje poizvedljivo referenčno politiko ki je niste. EnsembleDAgger potrebuje nabor, ki za več milijard-parameter model sredstva več kopij v spominu plus njihov sklepa stroški. ThriftyDAgger potrebuje ocenjevalko tveganja prilagojeno na uspehe in neuspehi ki ne obstajajo pred vaš prvi krogi.
Kako dolgo bi moral biti en prevzem?▾
Dovolj dolgo za dosego stanja politika lahko nadaljevati od in ne več: raztegnjeni prevzemi obrnejo teči v seanso demonstracije in poplavijo popravek niz z nominalnim obnašanjem. LazyDAgger ugotovka reže druga pot tudi — veliko zelo kratke stikala so njihovi lastni stroški.
Ali bi moral trenirati samo na popravljenih segmentih?▾
Ne — to je najbolj pogost način potratiti krog. Model fino-ladjenje samo na okupiteljnih je videl skoraj nič ampak okupiteljnih. Mešanje popravkov v prvotni nabor podatkov z viri izbrani ekspliciten; jiti naprej, gulejte v intervencija-utežene pristopih kot IWR ali Sirius, ki gor-utež človeške-vodili okviri namesto izolacijo jih.
Kaj če stopnja intervencije ne pada po krogu?▾
Vzamite to ob obličaju vrednost: krog ni pomagal. Pred dodajanjem popravkov, preverite cenejše razlage — je nadzornik prag drsenje, so bili popravki lepote, je sestava nabor podatkov je res imel jih, je bil usposabljanje inicializiran od nameravanega nadzora. Krog ki je molčeče začel od osnovnega modela izgleda natanko kot krog ki ni uspel za učenje.
Ali ne-intervencija nositi informacije?▾
Pod Expert Intervention Learning, ja: raztegi kje nadzornik ogleda in ne delati so branja kot šibka dokazov da stanje in dejanja so sprejemljive, formaliziran kot omejitev na funkcijo vrednosti. Večina praktičnih cevovodi, vključno ta, oznaka samo kaj je vodilo član.
Za en roka na namizje je izbira: drži polje sebe, napišite kaj odpira ga, in porabijo trud na upravljanje podatkov vraga je namesto avtomatizacija stikala. Stran platforme je opisana na DAgger zanko stran, usposabljanje možnosti na politike družina pod usposabljanje in obračun. Za ozadje, začeti s posnemovanje učenja in posnemovanje učenja na SO-100; za prve tekanje teči prvi politike je krajša pot.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started