
Obični DAgger traži od čovjeka da označi stanja dok robot i dalje vozi. Na stvarnom hardveru to je nesigurno i daje loše oznake. Gatirane varijante zamjenjuju slijepo označavanje gatom koju netko mora držati: čovjek u HG-DAgger-u, sigurnosni klasifikator u SafeDAgger-u, različitost ansambla u EnsembleDAgger-u, procijenjeni budžet za novost i rizik u ThriftyDAgger-u. Ovaj članak uspoređuje ih prema tome tko drži gatu, koji signal je otvara i što svaka košta — i zašto ljudski-gatirani oblik preživljava kontakt sa stvarnom rukom.
Klonirana politika neće uspjeti tamo gdje su joj završili treninzni podaci. Rješenje je nastaviti prikupljati podatke pod diskretnom distribucijom stanja policy-ja umjesto onom demonstratora, što DAgger radi i što uvod u agregaciju skupa podataka pokriva od prvih principa. Ostavlja otvorenim nezgodni dio izvornog algoritma: dok učenik vozi, stručnjak bi trebao reći što bi učinio, za svako stanje, bez da je u kontroli.
U simulatoru s pisanim stručnjakom to je besplatno. Na stolu sa stvarnom rukom nije ni besplatno ni sigurno. HG-DAgger autori precizno navode prigovor: takve sheme uzorkovanja "zahtijevaju da stručnjak pruži oznake akcije bez da bude u punoj kontroli sustava", što "može smanjiti sigurnost i, kada se koriste ljudi kao stručnjaci, vjerojatno će smanjiti kvalitetu prikupljenih oznaka zbog opažene kašnjenja aktuatora" (Kelly et al., 2019). Dva neuspjeha skrivena su u toj rečenici: politika i dalje ulazi u stanja koja nitko ne želi, a oznake kupljene s tim rizikom gore su nego one koje čovjek proizvede održavajući kontrolu. Svaka varijanta ispod odgovara na isto pitanje — staviti gatu na kontrolu i pustiti da netko odluči kada se otvara. Razlikuju se po tome tko je taj netko.
Kratka verzija
- •Gatirane varijante zamjenjuju slijepo označavanje sa prebacivačem između kontrole politike i kontrole stručnjaka. Ono što ih razdvaja je tko drži prebacivač.
- •HG-DAgger daje prebacivač čovjeku i agregira samo podatke prikupljene dok je čovjek imao neprekinutu kontrolu.
- •SafeDAgger mu daje binarni klasifikator koji predviđa odstupanje od referentne politike; EnsembleDAgger zahtijeva nisku varijancu ansambla i malu udaljenost do akcije stručnjaka istovremeno.
- •LazyDAgger dodaje histerezis tako da kontrola ne prebacuje brzo; ThriftyDAgger gatu na temelju novosti ili procijenjenog rizika pod eksplicitnim budžetom intervencije.
- •Robotski-gatirani signali trebaju nešto što finoća-prilagođen VLA na hobijaničkom ramenu obično nema: referentnu politiku, jeftini ansambl ili kalibriranu epistemičku nesigurnost.
- •Gata je polovica metode. Ono što se s segmentima intervencije kasnije dešava — miješanje, ponderiranje, agregacija — odlučuje jesu li podataka poboljšani.
Ljudski-gatirane i robotski-gatirane: podjela koja je bitna
Interaktivno učenje imitacijom ima vlastitu analizu; Celemin i kolege katalogiziraju ga po vrsti povratne informacije, sučelju, modelu učenja, korisničkom iskustvu, primjeni i provjeri. Podjela koja odlučuje o tvojoj inženjeriji jednostavnija je od bilo koje od tih osa i nedavni radovi je izravno nazivaju: metoda je ljudski-gatirano kada nadzornik odluči kada intervenirati, a robotski-gatirano kada agent odluči kada tražiti pomoć (Cai et al., 2025). Sve drugo je mehanika koja služi jednoj od te dvije opcije. Ugovor je vidljiv od početka: ljudska gata košta neprekinutu pozornost, a robotska gata obećava vratiti tu pozornost — ali samo ako je signal koji gata pouzdana, a izgradnja tog signala je sama po sebi istraživačka problema.
SafeDAgger: klasifikator koji predviđa vlastito odstupanje
SafeDAgger (2016) Zhang i Cho je rana od tih gata. Ispitivanje referentne politike je skupi dio, pa mala mreža — sigurnosna politika — predviđa je li ispitivanje uopće vrijedno. Vraća "binarnu oznaku koja pokazuje je li primarnoj politici vjerovatno da odkloni od referentne politike bez ispitivanja". Oznaka je definirana prema kvadratnoj L2 devijaciji između akcija dvaju politika s pragom tau, a klasifikator se prilagođava s binarnom unakrsnom entropijom. U vremenu izvršavanja odlučuje po stanju zadržava li učenik vožnju ili referentna preuzima. Sažetak izvješćuje manje referentnih upita u simulatoru utrke automobila plus ubrzanje brzine konvergencije koje autori pripisuju automatskom efektu kurikuluma, bez navođenja broja za bilo što.
Kvaka je u definiciji, ne u rezultatima. Obučavanje klasifikatora zahtijeva akciju referentne politike na svakom stanju korištenom za prilagođavanje, što pretpostavlja da je referentna drugi program. Ako je tvoja referentna osoba s voditeljskom rukom, taj skup oznaka nije jeftin i metoda gubi svojstvo za koje je bila dizajnirana.
EnsembleDAgger: nedoumica i neslaganje, oboje
Menda, Driggs-Campbell i Kochenderfer (2019) tretiraju gatu kao vjerojatnostno pitanje. EnsembleDAgger "aproksimira Gaussov proces koristeći ansambl neuronskih mreža" i čita varijancu ansambla kao proxy povjerenja: visoka varijanca znači regiju drugačiju od podataka treninga, koja — pretpostavljajući da stručnjak izbjegava stanja neuspjeha — korelira s blizinom neuspjehu. Pravilo je konjunkcija. Učenik može djelovati samo kada L2 udaljenost između njegove srednje akcije i akcije stručnjaka ostane ispod jednog praga (neslaganje) i varijanca predvidljive akcije ostane ispod drugog (nedoumica). Ako bilo koji ne uspije, stručnjak preuzima kontrolu. Cilj je maksimizirati udio akcija učenika dok se ograničava vjerojatnost neuspjeha; članak izvješćuje poboljšanu sigurnost i učenje prema ostalim DAgger varijantama na obrnutom njihalu i MuJoCo HalfCheetah.
To tiho diskvalificira potpuno pravilo za nadzor bez ruku. Udaljenost između akcije učenika i akcije stručnjaka zahtijeva akciju stručnjaka u tom stanju, u tom trenutku. Sa pisanim stručnjakom, dobro. Sa čovjekom, čovjek mora neprekidno proizvoditi akcije — točno je teret koji su gatirane varijante trebale ukloniti. Samo termin nedoumice je bez ruku; konjunkcija nije.
LazyDAgger: zaustavi prebacivač da ne brblja
Hoque i kolege (2021) napali su trošak koji raniji radovi nisu mjerili: sam prebacivač. Svaka intervencija "prekida drugi rad koji čovjek radi, nosi latenciju sa svakom promjenom konteksta između nadzornika i autonomne kontrole, i zahtijeva vrijeme za izvršavanje". Gata koja se otvara i zatvara deset puta u minuti gore je nego ona koja se otvara jednom deset sekundi, pri identičnom autonomnom udjelu. LazyDAgger proširuje SafeDAgger s asimetričnim pragovima — teže je ući u nadzor kontrole nego ostati u njoj — tako sustav ne oscilira na granici. U simulaciji "može smanjiti prebacivanja konteksta za prosječno 60% u odnosu na SafeDAgger-a na 3 zadatka kontinuirane kontrole dok održava najveću robotsku politiku"; u manipulaciji tkaninom sa ABB YuMi "smanjuje prebacivanja konteksta za 60% tijekom postizanja 60% veće stope uspjeha od SafeDAgger-a u vremenu izvršavanja".
ThriftyDAgger: novost ili rizik, pod budžetom
ThriftyDAgger (Hoque et al., CoRL 2021) počinje od budžeta nadzornika umjesto od politike. "Koristi naučenu politiku prebacivanja da traži intervencije samo u stanjima koja su dovoljna (1) nova, gdje robotska politika nema referentnog ponašanja za imitaciju, ili (2) rizična, gdje robot ima nisku povjerenja u završetak zadatka", s novom metrikom za procjenu tog rizika. Budžet je ulaz, ne izlaz: navodiš koliko ljudskog vremena ćeš potrošiti. Primijenjena u vremenu izvršavanja metoda "postiže 100% stopu uspjeha na simulaciji i fizičkim zadacima", i korisničko istraživanje s deset sudionika koji kontroliraju troliste-robotsku flotilju uz bočni zadatak koncentracije izvješćuje da "povećava ljudsku i robotsku uspješnost za 58% i 80% odnosno u odnosu na sljedeći najbolji algoritam dok smanjuje teret nadzornika". Postavka flote je prirodan dom za ovaj rad; Fleet-DAgger kasnije je formalizirao interaktivno učenje flote s više robota i nadzornika, predlažući Return on Human Effort kao količinu za optimizaciju.
HG-DAgger: čovjek drži gatu
Kelly et al. (2019) idu druge smjere. Nema politike prebacivanja. Učenik je prevezen "dok stručnjak ne primijeti da je početnik ušao u nesigurno područje prostora stanja", u kojem točki stručnjak preuzima kontrolu i vodi sustav natrag. Pravilo agregacije je strogi dio: "Oznake akcija stručnjaka se prikupljaju i dodaju skupu podataka samo tijekom tih putanja oporavka, tijekom kojih čovjek stručnjak ima neprekinutu kontrolu sustava." Ništa se ne označava dok je čovjek promatrač.
Nije se zaustavilo na prebacivač. HG-DAgger također "uči sigurnosni prag za metriku rizika temeljenu na neizvjesnosti modela koja se može koristiti za predviđanje uspješnosti u potpunosti obučenog početnika u različitim regijama prostora stanja": bilježi koliko je bio neiskrenen učenik u trenutcima kada je čovjek intervenirao i prosječuje zadnji četvrtinu tih zapisa, gdje učenik najviše podsjeća na njegovu finalnu formu. To nije gata koju robot koristi već dijagnostika koja ti govori gdje se očekuje da će gotova politika držati. Evaluacija pokriva simulirani i s stvarnim svijetom zadatak vožnje i izvješćuje poboljšanu performansu prema DAgger-u i ponašajnom kloniranju.
Jedna povezana linija mijenja ono što se broji kao oznaka. Spencer i kolege Expert Intervention Learning drži da "bilo koliko povratne informacije stručnjaka, bilo intervenijom ili neintervencijom, daje informacije o kvaliteti trenutnog stanja, optimalnosti akcije ili oboje", formalizirano kao ograničenje na vrijednosnu funkciju učenika i rješeno s online nažalno-regret učenjem. Pod tom čitanjem, rastezanja gdje je čovjek gledao i ništa nije radio su slabe pozitivne dokaze umjesto praznog. EIL uči izbjegavanje sudaranja od oko jedne minute stručnjakovog nadzora.

Varijante jedan pored drugog
| Metoda | Tko otvara gatu | Signal | Trebanja dostupna | Izvješćeno |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Nitko — učenik uvijek vozi | Ništa; stručnjak označava sve posječeno stanje | Stručnjak koji može označiti stanja off-politike bez kontrole | Nažalnost-regret smanjenje s garancijama pod distribucijom stanja učenika |
| HG-DAgger (Kelly et al., 2019) | Ljudski nadzornik | Nadzornikiova procjena da je stanje nesigurno | Netko koji gleda i čist rukopis kontrole | Nadmašuje DAgger i ponašajno kloniranje na simuliranom i stvarnom zadatku vožnje; i uči prag rizika |
| SafeDAgger (Zhang & Cho, 2016) | Robot | Binarni klasifikator za L2 devijaciju od referentnog iznad tau | Ispitivana referentna politika za oznake klasifikatora | Manje referentnih upita u simulatoru utrke automobila, brža konvergencija (bez broja) |
| EnsembleDAgger (Menda et al., 2019) | Robot | Varijanca ansambla i udaljenost do akcije stručnjaka, oboje ispod praga | Ansambl mreža plus akcija stručnjaka na svakom koraku | Poboljšana sigurnost i učenje na njihalu i HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Robot, s histerezom | SafeDAgger-ov signal s odvojenim pragovima ulaska i izlaska | Što SafeDAgger trebam plus drugi prag za podešavanje | ~60% manje prebacivanja na 3 zadatka; 60% veća uspješnost na YuMi tkanini |
| ThriftyDAgger (Hoque et al., 2021) | Robot, pod budžetom | Novost ili procijenjeni rizik od nepotpunosti zadatka | Naučena procjena rizika i naveden budžet intervencije | 100% uspješnost u vremenu izvršavanja; korisničko istraživanje (N=10): 58% i 80% dobitaka nad sljedećim najboljim |
| EIL (Spencer et al., 2020) | Čovjek — neintervencija se broji i | Intervencija i njezina odsutnost kao ograničenja na vrijednosnoj funkciji | Online nažalno-regret učenje preko vrijednosnog ograničenja | Izbjegavanje sudaranja od oko jedne minute stručnjakovog nadzora |
Što svaka gata kupuje i što naplaćuje
Čitaj dolje stupcu "trebanja" i obrazac pada: svaki robotski-gatirani signal tamo je proxy koji mora biti napravljen, i svaki proxy ima svoj račun.
- Signali neslaganja (SafeDAgger, LazyDAgger, polovica EnsembleDAgger-ovog pravila) trebaju referentnu politiku. Ili imaš pisanog stručnjaka, u kojem slučaju zanimljivi problem je već riješen, ili čovjek neprekidno proizvodi akcije u pozadini kako bi se mogla računati udaljenost.
- Signali nedoumice trebaju kalibriranu epistemičku nesigurnost. Ansambl malih mrežu kontrole je aproksimira; ansambl tromilijardnog parametra modela vizije-jezika-akcije je memorija i latencija prvi problem.
- Signali novosti i rizika trebaju naučenu procjenu završetka zadatka, prilagođenu na dovoljno uspješnih i neuspješnih valjanja. Na zadatku koji još uvijek radiš, ti podaci ne postoje u kolu jedan.
- Ljudska gata trebanja pozornost i ništa else — jedini signal dostupan dan jedan, na bilo kojoj arhitekturi politike, bez ekstra modela za trening.
- Nema robotske gate koja uklanja čovjeka iz sobe. Smanjuju koliko česti čovjek mora djelovati, ne trebaju li biti prisutni.
Postoji tiših razlika u što gata proizvodi. Robotska gata koja ispaljivanja srednje-putanje daje osobi pokretnu ruku na proizvoljnoj pozy. Ljudska gata dopušta operateru da odabere trenutak — nakon pokušaja, prije hvata, ne srednje kroz zamah. Segmenti oporavka od dva nisu jednako čisti, a ti segmenti su cijeli proizvod kruga.
Zašto oblik ljudski-gatirane vrati na stvarnom hardveru
Ovo je inženjerski argument, ne rezultat mjerila — nema rada koji smo pronašli koja koristi sve pet gata na istom manipulatoru s istom klasom politike. Počiva na četiri točke.
Prvo, nadzornik je tamo ionako. Nitko ne ostavlja SO-100 rukom trčeće bez nadzora pored objekata koje može srušiti. Kada je netko gledao, marginalnih troškova koji daju gumb za preuzimanje je blizu nule; izgradnja kalibriranog procjenitelja rizika je projekt.
Drugo, neizvjesnost koju zaista možeš mjeriti na modernoj politici često je krivo količina. Difuzija ili protok-podudaranja glava proizvodi varijancu preko uzorkovanih čunkova akcije, i ta varijanca odražava multimodalnost koju je glava bila obučena predstavljati, ne epistemičku neznanje o stanju. EnsembleDAgger-ov termin nedoumice koristi ansambl upravo da zatvori potonje. Dva izgledaju kao isti broj i nisu; akciji-chunking i protok-podudaranja stavke pokrivaju kako te glave emitiraju akcije na prvi mjestu.
Treće, neuspjesi koji se broje u manipulaciji su često semantički umjesto statistically neobični. Politika zatvaranja grifera dva centimetra ranije, ili dostojanstveno dosezanje krivi od dva identična kubusa, nije u stanju visoke varijance — je sigurna i kriva. Nema praga varijance koji hvata; osoba koja gleda hvata odmah.
Četvrto, kvaliteta oznake — originalna HG-DAgger točka, i ona koju se najčešće preskače. Oznake prikupljene dok je čovjek imao neprekinutu kontrolu nadmašuju oznake narativne tijekom pokretnog sustava. Ako je cilj korisnički podatci vrijednih agregacije, teret dokaza leži s automatskom gatom.
Slika se vraća kada je jedan nadzornik odgovoran za puno robota — režim ThriftyDAgger-ova korisničkog istraživanja i Fleet-DAgger-ove formalizacije cilja. Sa flotilom, ljudska pozornost je mala sredstvo i loša dodjela nadmašuje ništa. Sa jednom rukom na jednom stolu niste u tom režimu.
Ljudski-gatirani krut, već zapitana
Preuzimanje tijekom pokretne sesije zaključivanja, po-zaokretnog intervencije zastavice na korigirane segmente, zbrinjavajući svaki krug u ispravke ili evaluaciju, zbirka mješovitog skupa podataka iz izvora koju odabireš, i nastavak treninga od postojećeg provjere su ugrađeni umjesto pisanima rukom. Preuzimanje radi sa voditeljskom rukom, ili s tipkovnicom i klizačima ako nemaš.
Pogledaj kako DAgger krug se pokrećeGata je polovica metode; rukovanje podacima je drugi dio
Gata odlučuje koje okvire je čovjek vozio, a ne što učiniti s njima, i ta druga odluka je gdje su krugovi najčešće propadom. Prvo pravilo je onaj D u DAgger oznaka: agregacija, ne zamjena. Finoća-prilagođavanja provjeri čisto na nekoliko stotina okvira ispravke daje ti model koji je vidio gotovo ništa ali oporavke i zaboravio je nominalni putanja.
Drugo pravilo je da intervencije okviri nisu obični okviri. Mandlekar et al. izgrađeni daljinski-teleopscije sustav za 6-DoF manipulaciju koji omogućuje operaterima da nadziru politike i preuzmu pri neuspjehu, zatim obučavani iterativno s algoritmom koji "ohrabruje politiku učiti kako prelaziti blokade putem intervencija"; agenti obučavani s tim podacima nadmašili su agente obučavane s jednakim brojem običnih uzoraka demonstracije. Sirius gura ideju u uvođenje, "ponovno ponderiranje uzoraka treninga s aproksimiranom ljudskom povjerenjem i optimizacija politika s ponderiranim ponašajnim kloniranjem". Oboje trebaju po-zaokret marker od što je bilo ljudski-voženo, što je zašto intervenciji zastava bitna više nego izgleda.
Treće pravilo je da automatsko miješanje je zamka. Zbir skup čiji izvori ne možete popis je onaj koji ne možete otklanjati kada sljedeći krug postane lošiji. Na ovoj platformi sastav korak je eksplicitan za taj razlog — originalni skup plus ispravke, odabir epizode po izvoru, i rezultat je obični LeRobot skup što se sinkronizira i vježba kao bilo koji drugi; skupna dokumentacija pokriva stranicu oblika.
| Korak u krugu | Što proizvodi | Najčešće kako ide krivo |
|---|---|---|
| Izvedite zaključivanje s snimanjem uključene | Krug pod diskretnom politike distribucijom stanja | Snimljeno kao obična teleopscija, gubeći da je politika vozila |
| Preuzmi na neuspjehu | Segmenti ispravke s po-zaokret intervencije zastavice | Ispravljajući kozmetički tresetaj, poučavanje stila umjesto oporavka |
| Kurirajte svaki epizodu | Ispravke, evaluacija ili odbacivanja | Čuva sve; botčan preuzimanja košta više od epizode je vrijednost |
| Sinkronizacija ispravke | Verzioniran skup pored originalne | Ispravke koje nikad ne napuštaju lokalnu stroj |
| Zbir mješovitih skupa | Originalno plus ispravke, eksplicitan odabir | Tiho samodomiješanje, tako da kasnije regresija ne može biti trasirana do izvora |
| Nastavak od provjere | Provjera inicijalizirana od prethodnog | Očekivujući optimizatora nastavak; utegari inicijaliziraju model, oni ne obnavljaju optimizatornog stanja |
Postavljanje gata osoba zapravo mogu držati
"Čovjek odlučuje" nije specifikacija. Dva operatera s različitim pragovima proizvode neusporedive krugove, a driftajući prag proizvodi trend koji ne možeš čitati. Napišite okidače prije prvi krug.
- Imenujte uvjete koji otvaraju gatu — pristup isključi više od fiksne marže, grifer zatvara na ništa, zglob driftajući prema granici, zaustavka više od sekunda ili dvije — i čuvajte popis nepromijenjen za krug.
- Imenujte što ne otvara je. Preletjeti politika oporavka je od na vlastitu je treninzni signal; preuzimanje tamo briše oporavak koji već zna.
- Preuzmi dovoljno rano za čist rukopis, rukom natrag čim je stanje oporavka.
- Zapisati zašto ste preuzeli, po epizodi. Tri kruga kasnije je jedini zapis ako isti neuspjeh vraća.
- Čuva kamere, zadatak tekst i operater konstantu kroz krugove. Promjena jedan i brojevi prestaju biti usporedivi.
Mehanički rukopis ima dva varijante. Sa voditeljskom rukom, voditelj mora dosegnuti sljedbeničkog trenutnog paze prije torke transferta, ili ruka skače; taj usklađivanja je najmanje-testiran dio lanca na stvarnom hardveru. Bez voditeljske ruke preuzimanje je ručno od prvi keypress: sljedbenik je održavao i operater ga tjera mješoviti-zajednom od tipkovnice ili vučluca klizače, sa serverske strani pinceta čuvajući svaki unos mali — par stupnja per keypress, rukovanje per klizač ažuriranje, jer veliki korak u održavanu pozu je kako strijaš servo. Korak-po-korak verziju sa ključevima vezama je u vodiču kroz DAgger krug na SO-100; pozadina na obje teleopscije režima je u teleopscije dokumentacijom i voditelj-sljedbenik stavka.

Čitanje jesu gata učinio bilo što
Metriki ljudski-gatirane kruga je intervenciji rata: intervenciji okviri podijeljeni s okviri kruga. Ima jedan posao — ako ne pada kroz krugove, krug kupil ništa, i sljedeće trebam promijeniti nešto drugoga od količine podataka.
To je pristrano metriku i trebali biste znati kako. Mjere operater prag kao politike kompetencie, što je zašto okidač popis ostaje fiksno; operater tko relaksira tijekom sesije proizvodi padi kruga s ništa iza njega. To i ignora težinu — deset okvira zaustavljanja sudaranja i deset tjeskobenja hvata izgleda identično. Par to s fiksnom evaluacijom set nema ispravke podatci su ikad iscrtani od. Članak na mjerenju DAgger petlje radi kroz evaluaciju dejan, uključujući kako čuvati evaluaciju epizode iz miješanja treninga.
- Radi dan jedan, na bilo kojoj arhitekturi politike, bez ekstra modela za umjeravanje
- Hvata sigurna-i-krivo neuspjehe nema varijance praga otkriva
- Proizvodi ispravke snimljene dok je operater imao puna kontrola, u trenutak koju su odabrali
- Daje po-zaokret marker koji intervenciji-ponderirana metode kao IWR i Sirius konzumiraju
- Cijene kontinuirane nadzora; ne skalira na osoba i puno robota
- Ovisi operater konzistenciji — driftajući prag korumpira intervenciji rata
- Proizvodi nema modela rizika u vlastito; HG-DAgger-ov naučena prag i ThriftyDAgger-ov procjena su ekstra mehanika
- Broji okvire, ne konzekvencie
- Ne mogu spasiti politiku čija je neuspjeh uzvodan od kontrole, kao što je zamjena kamera ili krivo-označen zadatak string
Otvorena pitanja vrijedna čuvanja u prikazu
Mjerila su slaba. Spencer i kolege ispitali su korištena za testiranje pristupa učenja imitacijom i pronašli su ih "realizabilni i jednostavni i stoga nedovoljavajući za hvaljenje teže režima greške-spojnog vidilja u stvarnom svijetu donošenja odluka problemi" — i, protiv okružujuće literature, pronašli da obični ponašajni kloniranje jesto dobro na njima. To je razlog biti skeptičan o bilo kojem rangiranju DAgger varijanti počivanja na tih zadacima, uključujući neki brojevi u tabeli gore.
Robotske gate na velikim politikama nisu riješene ili. AIM rad zamjenjuje neizvjesnost s proxy Q-funkcija oponašanja ljudske intervencije pravila i izvješćuje 40% poboljšanje u preuzimanja-preko troška i učenja učinkovitosti nad ThriftyDAgger — u kontinuirane i diskretne kontrole, nije na modelu vizije-jezika-akcije koji voženja manipulatora. Jesu li bilo od tih gata prenosi finoća-prilagođen VLA je otvoreno. Analiza stvara povezanu točku: poljska terminologija i struktura nisu ujedinjene kroz literaturu, što čini metode teško usporediti. Na vlastito rukama, vlastito zapisni su dokazi koji imate.
Je HG-DAgger zaista DAgger ako je čovjek samo oznaka tijekom intervencija?▾
Drži dio koji je bitna — podaci prikupljeni pod distribucijom stanja učenik induces, agregirani s što je došlo prije — i pada dio koji ne preživljava kontakt s hardverom. Kelly et al. sadržava je kao varijante; 2011 nažalo-regret jamstvo ne nosi preko nepromijenjen.
Mogu li koristiti robotsku gatu na finoća-prilagođen VLA politici na SO-100?▾
Ne ravno. SafeDAgger-ov klasifikator trebat ispitivanu referentnu politiku nemaš. EnsembleDAgger trebam ansambl, što za multi-milijardnog-parametra model znači nekoliko kopija u memoriji plus njihovo zaključivanja troška. ThriftyDAgger trebam procjena rizika prilagođena na uspješne i neuspješne koji ne postoje prije prvi krugovi.
Kako bi trebao biti jedan preuzimanja?▾
Dovoljno dugo dostigne stanje politika može nastaviti od, i nema duže: prošireni preuzimanja okrenuti krug u sesiju demonstracije i poplava ispravke set s nominalnim ponašanjem. LazyDAgger-ov nalaz rezanja drugi način i — puno vrlo kratko prebacivanja su njihova vlastita troška.
Trebam li trening samo na korigirane segmente?▾
Nije — to je najčešće kako baciti krug. Model finoća-prilagođen samo na oporavka je vidio gotovo ništa ali oporavka. Miješanja ispravke u originalni skup s izvorima odabranih eksplicitan; ići dalje, pogledaj intervenciji-ponderirana pristupa kao IWR ili Sirius, koji gore-teže ljudski-vozio okvire umjesto izoliranje njih.
Što ako intervenciji rata ne pada nakon kruga?▾
Uzmi to u nominalni vrijednost: krug nije pomognulo. Prije dodavanja ispravke, provjeri jeftinije objašnjenja — je operater prag driftajući, su ispravke kozmetički, je sastavljen skup zapravo sadržavao ih, je bil inicijaliziran od naknanadan provjere. Krug koji tiho počeo od model base izgleda točno kao krug koji nije uspjelo učiti.
Je ne-intervenciji nosu informacija?▾
Pod Expert Intervention Learning, da: rastezanja gdje je nadzornik gledao i nije intervenirao su čitanja kao slabi dokazi da stanja i akcija su bila prihvatljivi, formalizirati kao ograničenja na vrijednosnoj funkciji. Većinu praktičnih cjevovoda, uključujući ovaj, oznaka samo što je čovjek vozio.
Za osam-ruke na stolu izbora je napravljen: drži gatu sam, napišite što otvara je, i potrošak nastojanje na rukovanje podacima iza njega umjesto na automatizacija prebacivača. Platformska stranu je opisao na DAgger petlje stranice, treninga opcije po politici obitelj pod treninga i cijene. Za pozadina, početi s imitacija učenja i imitacija učenja na SO-100; za prvi krug, izvedite prvi politike je kraća putanja.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started