
Obični DAgger traži od čovjeka da označi stanja dok robot još vozi. Na stvarnom hardveru to nije sigurno i stvara loše oznake. Kontrolirane varijante zamjenjuju slijepo označavanje sa vratima koja netko mora držati: čovjek u HG-DAgger-u, sigurnosni klasifikator u SafeDAgger-u, neslaganje ansambla u EnsembleDAgger-u, budžetirana procjena novosti i rizika u ThriftyDAgger-u. Ovaj članak ih uspoređuje prema tome tko posjeduje vrata, koji signal ih otvara i što svaki koštaju — i zašto oblik kontroliran čovjekom je onaj koji preživi susret sa stvarnim rukom.
Klonirana policy ne valja gdje mu je obuka ponestala podataka. Ispravka je nastaviti prikupljati podatke prema vlastitoj distribuciji stanja policy-ja umjesto od demonstratora, što radi DAgger i što uvod u agregaciju podataka pokriva od prvih načela. Ostavlja otvorenim neugodnu stranu originalnog algoritma: dok uči vozi, stručnjak trebao bi reći što bi učinio, za svako stanje, bez biti na kontroli.
U simulatoru sa skriptiranim stručnjakom to je besplatno. Na stolu sa stvarnom rukom nije ni besplatno ni sigurno. Autori HG-DAgger-a precizno navodosacheme kako to prosljeđuju: takve sheme prikupljanja "zahtijevaju od stručnjaka da pruži akcijske oznake bez da bude u potpunoj kontroli sustava", što "može smanjiti sigurnost i, kada se koriste ljudi kao stručnjaci, vjerojatno će degradirati kvalitetu prikupljenih oznaka zbog percipiranog kašnjenja pokretača" (Kelly i dr., 2019). Dva neuspjeha skrivena su u toj rečenici: policy nastavlja voziti u stanja koja nitko ne želi, a oznake kupljene sa tim rizikom gore su od onih koje čovjek производи dok drži kontrole. Svaka varijanta ispod odgovara na isto pitanje — stavi vrata na kontrolu i pusti nekoga da odluči kada se otvaraju. Razlikuju se po tome tko je taj netko.
Kratka verzija
- •Kontrolirane varijante zamjenjuju slijepo označavanje sa prebacivačem između control policy-ja i stručnjaka. Što ih odvaja je tko posjeduje prebacivač.
- •HG-DAgger daje prebacivač čovjeku i agregira samo podatke prikupljene dok je čovjek imao neprekinutu kontrolu.
- •SafeDAgger mu daje binarnom klasifikatoru koji predviđa devijaciju od referentne policy-ja; EnsembleDAgger zahtijeva nisku varijancu ansambla i malu udaljenost do akcije stručnjaka istovremeno.
- •LazyDAgger dodaje histereze tako kontrola ne prebacuje; ThriftyDAgger postavlja vrata na novost ili procijenjeni rizik pod eksplicitnim budžetom intervencije.
- •Signali kontrolirani robotom trebaju nešto što fino podešena VLA na amaterskoj ruci obično nema: referentnu policy, jeftini ansambal, ili kalibrirani epistemski neodređenost.
- •Vrata su pola metode. Što se dešava sa segmentima intervencije nakon toga — miješanje, težinovanje, agregacija — odlučuje je li runda nešto poboljšala.
Čovjekom kontrolirane i robotom kontrolirane: podjela koja se broji
Interaktivno učenje imitacijom ima svoju pregled; Celemin i kolege ga katalogariziraju prema vrsti povratne informacije, sučelju, modelu učenja, korisničkom iskustvu, aplikaciji i mjerilu. Razlika koja određuje tvoju tehniku je jednostavnija od bilo koje od tih osi, i nedavni rad je izravno navodi: metoda je kontrolirana čovjekom kada supervizor odluči kada intervenirati, i kontrolirana robotom kada agent odluči kada zamoliti pomoć (Cai i dr., 2025). Sve ostalo je mehanika koja služi jednoj od te dvije izbore. Razrada je vidljiva od početka: čovjekova vrata koštaju kontinuirane pažnje, i robotska vrata obećavaju vratiti tu pažnju — ali samo ako je signal što ih控制 je pouzdan, i izgradnja tog signala je its own research problem.
SafeDAgger: klasifikator koji predviđa svoju vlastitu devijaciju
Zhang i Cho SafeDAgger (2016) je najstarija od tih vrata. Postavljanje upita referentne policy je skupo, pa druga, mala mreža — sigurnosna policy — predviđa je li postavljanje upita uopće vrijedno. "Vraća binarnu oznaku koja pokazuje je li primarna policy vjerojatno da će se devijirati od referentne policy bez postavljanja upita". Oznaka je definirana prema kvadrirajućoj L2 devijaciji između akcija dvije policy s pragom tau, i klasifikator je prilagođen sa binarnom entropijom. Za vrijeme pokretanja odluči po stanju drži li učenik voziti ili referenca preuzima. Apstraktno izvještava manje upita referentne u racing simulatoru plus ubrzanje brzine konvergencije što autori pripisuju efektu automatizirane kurikule, bez davanja broja za bilo što.
Zamka je u definiciji, ne u rezultatima. Obučavanje klasifikatora zahtijeva akciju referentne policy na svakom stanju korištenom za prilagođenje, što pretpostavlja da je referenca drugi program. Ako je tvoja referenca osoba sa leaderskom rukom, taj set oznaka nije jeftin i metoda gubi svojstvo za što je dizajnirana.
EnsembleDAgger: sumi i nepodudarnost, obje
Menda, Driggs-Campbell i Kochenderfer (2019) tretiraju vrata kao vjerojatnosno pitanje. EnsembleDAgger "aproksimira Gaussovski proces koristeći ansambal neuronskih mreža" i čita varijancu ansambla kao proxy pouzdanosti: visoka varijanca znači regiju različitu od podataka obuke, što — pretpostavljajući da stručnjak izbjegava stanja neuspjeha — korelira sa blizinom neuspjeha. Pravilo je konjunkcija. Učenik može raditi samo kada L2 udaljenost između njegove srednje akcije i akcije stručnjaka ostaje ispod jednog praga (nepodudarnost) i varijanca njegove predviđene akcije ostaje ispod drugog (sumnje). Ako bilo koji ne uspije, stručnjak preuzima kontrolu. Cilj je maksimizirati udio akcija učenika dok se ograničava vjerojatnost neuspjeha; papir izvještava poboljšanu sigurnost i učenje naspram drugih DAgger varijanti na inverznom klatnu i MuJoCo HalfCheetah.
To tiho diskvalificira puno pravilo za bez ruku nadzor. Udaljenost između akcije učenika i akcije stručnjaka zahtijeva akciju stručnjaka u tom stanju, u taj trenutak. Sa skriptiranim stručnjakom, u redu. Sa čovjekom, čovjek mora kontinuirano proizvoditi akcije — točno teret što su kontrolirane varijante trebale ukloniti. Termin sumnje sam je bez ruku; konjunkcija nije.
LazyDAgger: zaustaviti prebacivač od čavrljanja
Hoque i kolege (2021) su napadli trošak što ranije papire nisu mjerili: sam prebacivač. Svaka intervencija "prekida drugi rad što čovjek radi, nanosi kašnjenje sa svakim prebacivanjem konteksta između supervizora i autonomne kontrole, i zahtijeva vrijeme za obavljanje". Vrata što se otvaraju i zatvaraju deset puta u minuti gore su od onih što se otvaraju jednom za deset sekundi, sa identičnim autonomnim udjelom. LazyDAgger proširuje SafeDAgger sa asimetričnim pragovima — teže ući u nadzor nego ostati u njemu — tako sustav se ne oscilira na granici. U simulaciji "može smanjiti prebacivanja konteksta u prosjeku za 60% naspram SafeDAgger-a na 3 neprekidne zadatka kontrole održavajući najsuvremeniju performansu policy-ja"; u manipulaciji tkanine sa ABB YuMi "smanjuje prebacivanja konteksta za 60% dok postiže 60% višu stopu uspjeha od SafeDAgger-a za vrijeme izvršavanja".
ThriftyDAgger: novost ili rizik, pod budžetom
ThriftyDAgger (Hoque i dr., CoRL 2021) počinje od budžeta supervizora umjesto od policy-ja. "Koristi naučenu policy prebacivanja za traženje intervencija samo u stanjima što su dovoljno (1) nova, gdje robot policy nema referentnog ponašanja za imitaciju, ili (2) rizična, gdje robot ima nisku pouzdanost u završetku zadatka", sa novom metrikom za procjenu tog rizika. Budžet je ulaz, ne ishod: navodiš koliko ljudskog vremena ćeš potrošiti. Primijenjeno za vrijeme izvršavanja metoda "posttiže 100% stopu uspjeha na i simulaciji i fizičkim zadacima", i korisnikova studija sa deset sudionika kontrolirajućih trorobobni flotila pobok sa zadatkom koncentracije izvještava da "povećava ljudsku i robotsku performansu za 58% i 80% respektivno naspram sljedećeg najboljeg algoritma dok smanjuje teret supervizora". Postavka flote je prirodni dom za ovaj rad; Fleet-DAgger kasnije je formalizirao interaktivno učenje flote sa više robota i supervizora, predlaže Return on Human Effort kao količinu za optimiziranje.
HG-DAgger: čovjek drži vrata
Kelly i dr. (2019) idu drugim putem. Nema policy prebacivanja. Učenik je pokrenuta "dok stručnjak ne primijeti da učenika je ušao u nesigurnu regiju prostora stanja", u tom trenutku stručnjak preuzima kontrolu i vodi sustav natrag. Pravilo agregacije je strogi dio: "Akcijske oznake stručnjaka se prikupljaju samo dodaju na skup podataka tijekom tih oporavajućih trajektorija, tijekom kojih čovjek stručnjak ima neprekinutu kontrolu sustava." Ništa se ne označava dok je čovjek promatrač.
Ne staje na prebacivačima. HG-DAgger također "uči sigurnosni prag za model-neodređenost model rizika što se može koristiti za predviđanje performanse potpuno obučenog učenika u različitim regijama prostora stanja": beleži koliko je bio neizvjesan učenik u trenucima kada je čovjek intervenira i prosječna posljednja četvrtina tih zapisa, gdje učenik najveće nalikuje svojoj konačnoj formi. To nije vrata što robot upravlja već dijagnostika što vam govori gdje se očekuje da završio policy drži. Procjena pokriva simuliranu i stvarnu zadaću vožnje i izvještava poboljšanu performansu naspram i DAgger-a i ponašanja kloniranja.
Jedan srodni red mijenja što se računa kao oznaka. Spencer i kolege Expert Intervention Learning drže da "bilo koji iznos povratne informacije stručnjaka, bilo intervencijom ili ne-intervencijom, pružava informaciju o kvaliteti trenutnog stanja, optimalnosti akcije, ili oboje", formalizira kao ograničenja na funkciju vrijednosti učenika i riješeno sa bez-žaljenja mrežnog učenja. Pod tom čitanjem, dionica gdje čovjek je gledao i nije napravio ništa su slaba pozitivna dokaza umjesto praznog. EIL uči izbjegavanje sudara od oko jedne minute stručnjaka kontrole.

Varijante jedna pored druge
| Metoda | Tko otvara vrata | Signal | Trebam dostupno | Izvješteno |
|---|---|---|---|---|
| DAgger (Ross i dr., 2011) | Nitko — učenik uvijek vozi | Ništa; stručnjak označava svako posjetano stanje | Stručnjak sposoban označiti off-policy stanja dok nije na kontroli | Bez žaljenja redukcija sa jamstvima pod distribucijom stanja učenika |
| HG-DAgger (Kelly i dr., 2019) | Čovjek supervizor | Supervizors sud da je stanje nesigurno | Netko koji gleda, i čist transfer kontrole | Pobjeđuje DAgger i ponašanje kloniranja na simuliranoj i stvarnoj vožnji zadatci; također uči rizični prag |
| SafeDAgger (Zhang & Cho, 2016) | Robot | Binarni klasifikator za L2 devijaciju od referentnog iznad tau | Queryable referentna policy za oznake klasifikatora | Manje upita referentnih u racing simulatoru, brža konvergencija (nema dane brojke) |
| EnsembleDAgger (Menda i dr., 2019) | Robot | Varijanca ansambla i udaljenost od akcije stručnjaka, obje ispod praga | Ansambal mreža plus akcija stručnjaka na svakom koraku | Poboljšana sigurnost i učenje na klatnu i HalfCheetah |
| LazyDAgger (Hoque i dr., 2021) | Robot, sa histerezom | SafeDAgger signal sa odvojenim pragovima ulaska i izlaska | Što SafeDAgger trebaj, plus drugi prag za podešavanje | ~60% manje prebacivanja konteksta na 3 zadatci; 60% viša stopa uspjeha na YuMi tkanini |
| ThriftyDAgger (Hoque i dr., 2021) | Robot, pod budžetom | Novost, ili procijenjeni rizik ne dovršavanja zadatka | Naučeni rizični procjenjivač i navedeni budžet intervencije | 100% stopa uspjeha za vrijeme izvršavanja; korisnikova studija (N=10): 58% i 80% dobitka naspram sljedećeg-najbolje |
| EIL (Spencer i dr., 2020) | Čovjek — ne-intervencija se broji isto | Intervencija i njezina odsutnost kao ograničenja na funkciji vrijednosti | Mrežno učenje bez-žaljenja preko ograničenja vrijednosti | Izbjegavanje sudara od oko jedne minute stručnjaka kontrole |
Što svaka vrata kupuju, i što naplaćuju
Čitaj dolje stupac "trebam" i obrazac pada van: svaki robot-kontrolirani signal tamo je proxy što mora biti proizveden, i svaki proxy ima svoju счёт.
- Signali nepodudarnosti (SafeDAgger, LazyDAgger, pola od EnsembleDAgger pravila) trebaju referentnu policy. Ili imaš skriptirani stručnjak, u kojem slučaju zanimljiva problem je već riješena, ili čovjek nastavlja proizvoditi akcije u pozadini tako udaljenost može biti izračunata.
- Signali sumnje trebaju kalibrirane epistemske neodređenosti. Ansambal malih kontrolnih mreža ga aproksimira; ansambal trogradnog milijuntnog parametra model vide-jezik-akcije je problem memorije i kašnjenja prvo.
- Signali novosti i rizika trebaju naučeni procjenjivač završetka zadatka, prilagođen na dovoljno uspješnih i neuspješnih pokretanja. Na zadatci što još uspostavljaš da radi, taj podaci ne postoji u prvoj rundi.
- Čovjekova vrata trebaju pažnju i ništa drugo — jedini signal dostupan na prvog dana, na bilo kojem arhitekturi policy-ja, bez dodatnog modela za obučavanje.
- Nema robot vrata uklonjava čovjeka iz sobe. Oni smanjuju koliko često čovjek mora raditi, nije li trebao biti prisutan.
Postoji tiša razlika u što vrata proizvode. Robot vrata koja se pale sredinom trajektorije ruci osobu pokretnu ruku na proizvoljnoj poziciji. Čovjekova vrata neka operater odaberi trenutak — nakon dosega, prije hvatanja, nije sredine ljuljanja. Oporavne dijelove iz dvije nisu jednako čiste, i oni dijelovi su cijeli proizvod runde.
Zašto čovjekom kontrolirani oblik dobiva na stvarnom hardveru
Ovo je inženjering argument, ne rezultat mjerila — nema papira što smo našli što radi sve pet vrata na istom manipulatoru sa istom klasu policy. Počiva na četiri točke.
Prvo, supervizor je tamo ionako. Nitko ne ostavlja SO-100 ruku pokrenuta bez nadzora pored objekata što može srušiti. Kada netko gleda, marginalni trošak dati im dugme za preuzimanje je blizu nula; gradnja kalibriranog procjenjivača rizika je projekt.
Drugo, neodređenost što zaista možeš mjeriti na modernoj policy često je pogrešna količina. Difuzija ili tokova-podudaranja glava proizvodi varijancu preko uzorkovanih akcijskih komada, i ta varijanca odražava multimodalnost što je glava obučena za predstavljanje, nije epistemsku neznanje o stanju. EnsembleDAgger termin sumnje koristi ansambal upravo za lov sljednji. Dvije izgledaju kao ista broj i nisu; komadiranje akcije i tokova podudaranja stavke pokrivaju kako te glave emitiraju akcije prvo.
Treće, neuspjehi što se broje u manipulaciji su često semantički umjesto statističke neuobičajeno. Policy koji zatvara gripper dva centimetra rano, ili doseganja samouzダствeno za pogrešnu od dvije identične kocke, nije u visoko-varijanci stanju — je samozuvjeran i pogrešan. Nema varijanci prag to hvata; osoba koja gleda hvata ga odmah.
Četvrto, kvaliteta oznake — originalni HG-DAgger točka, i ona što se najčešće preskače. Oznake prikupljene dok čovjek ima neprekinutu kontrolu bolje su od oznaka pričane preko pokretnog sustava. Ako je cilj ispravne podatke vrijedno agregiranja, teret dokaza leži sa automatiziranom vratima.
Slika okreta kada je jedan supervizor odgovoran za mnogo robota — režim što ThriftyDAgger korisnikova studija i Fleet-DAgger formalizacija ciljaju. Sa flotom, čovjekova pažnja je oskudna resurs i neperfektna alokacija bolje je od ničega. Sa jedan ruku na jedan stolu nisi u tom režim.
Čovjekom kontrolirani petlji, već ožičena
Preuzimanje tijekom izvršnog zaključivanja sesije, po-okviru oznake intervencije na ispravljenim dijelovima, kuriranje svake runde u ispravke ili procjene, komponiranje miješanog skupa podataka iz izvora što odabiraš, i nastavak obuke iz postojećeg checkpoint su izgrađeni u umjesto skriptiran sa rukom. Preuzimanje radi sa leaderskom rukom, ili sa tipkovnicom i klizačima ako nemaš jedan.
Vidi kako DAgger petlja radiVrata su pola metode; rukovanje podacima je druga pola
Vrata odluč koji su okviri čovjek vozio, nije što učiniti sa njima, i druga odluka je gdje se runde najvećim dijelom rasipaju. Prvo pravilo je ono što D u DAgger stoji za: agregat, ne zamijeni. Fino-podešavanjem checkpoint čisto na nekoliko stotinu ispravnih okvira daje ti model što je vidio gotovo ništa ali oporavke i je zaboravio nominalni trajektorije.
Drugo pravilo je ta intervencija okviri nisu obični okviri. Mandlekar i dr. izgrađena teleoperacija sistema za 6-DoF manipulaciju neka operateri nadzorni politici i preuzeti na neuspjeh, zatim obuka iterativno sa algoritam što "potiče policy naučiti kako prelaziti problematične mjesta kroz intervencije"; agenti obučeni na tom podatke nadmašio agenti obučeni na jednak broj običnih demonstraciji uzorci. Sirius gura ideju u raspoređivanje, "ponovno-težinovanje obuke uzorci sa približnim čovjeka povjerenja i optimiziranje politici sa težinske ponašanja kloniranja". Oba trebaju po-okviru marker što je čovjek-vozio, što je zašto intervencija zastava broji više nego što izgleda.
Treće pravilo je automatsko miješanje je zamka. Sastavljen skup podataka čije izvore ne možeš nabrojati je onaj što ne možeš ispravljati kada sljedenja runda postaje gore. Na ovoj platformi komponiranje korak je eksplicitan zato — originalni skup podataka plus ispravke, epizoda izbora po izvoru, i rezultat je obični LeRobot skup podataka što sinkronizira i obuke kao bilo koji drugi; dokumentacija skupa podataka pokriva oblik strane.
| Korak u rundi | Što proizvodi | Najčešće način to ide krivo |
|---|---|---|
| Pokrenuti zaključivanje sa snimanjem uključeno | Pokretanje pod vlastitom distribucijom stanja policy-ja | Snimljeno kao običan teleoperacija, gubit što je policy vozio |
| Preuzeti na neuspjeh | Ispravke dijelova sa po-okviru intervencija oznakom | Ispravka kozmetičkog ljuljanja, učenje stila umjesto oporavka |
| Kuriranje svake epizode | Ispravke, procjene, ili odbacivanja | Čuvanje svega; pokvarena preuzimanja koštanja više nego što epizoda jest bila vrijedna |
| Sinkronizirati ispravke | Verzioniran skup podataka pored originalnog | Ispravke što nikad ne napustaju lokalnu mašinu |
| Komponirati miješani skup podataka | Originalni plus ispravke, eksplicitan izbor | Tiho auto-miješanja, tako kasnija regresija ne može pratiti na izvor |
| Nastavak iz checkpoint | Checkpoint inicijaliziran iz prethodnog | Očekivanja optimizatora sažeti; težine inicijalizira model, oni ne obnavljaju optimizatora stanja |
Postavljanje vrata što osoba zapravo može držati
"Čovjek odlučuje" nije specifikacija. Dva operatera sa različitim pragovima proizvode neusporedive runde, i plutajući prag proizvodi trend što ne možeš pročitati. Napiši okidače dolje prije prve runde.
- Navedi uvjete što otvaraju vrata — pristup isključen više nego fiksni margina, gripper se zatvara na ništa, zglobovi plutaju prema ograničenja, stagna više nego sekunde ili dvije — i drži popis nepromijenjen za rundu.
- Navedi što ne otvara to. Preskočiti što policy oporavak od sebe je obuku signala; preuzimanja tamo briše oporavak što već zna.
- Preuzeti dovoljno rano za čist transfer, vratiti čim je stanje oporavno.
- Bilježi zašto si preuzet, po epizodi. Tri runde kasnije je jedini zapis je li ista neuspjeh vraća.
- Drži kamere, zadatak tekst i operater konstanta preko rundi. Promijena jedan i brojke prestanu biti usporedivi.
Mehanički transfer ima dva varijante. Sa leaderskom rukom, voditelj mora dosegnuti pratnika trenutnu poziciju prije mom trakfer, ili ruke skače; ovaj usklađivanje premještanja je najmanje-testirane dio lanac na stvarnom hardveru. Bez leaderske ruke preuzimanja je ručno iz prvog pritiska: pratnik je držan i operater je gurnuo zglobovi od tipkovnice ili draga klizačima, sa servera-strane stiješnjenja drži svaki ulaz mali — paru stupnjeva po tipka, puku per klizač aktualizacija, jer veliki korak u držanu poziciju je kako trgaš servo. Korak-po-korak verzija sa tipkovnicu vezanja je u prikaz DAgger runde na SO-100; pozadina na oboje teleoperacija načini je u teleoperacija dokumentacija i voditelj-pratnik stavka.

Čitanja je li vrata radila bilo što
Metrička čovjekom-kontrolirana runda je intervencija stopa: intervencija okviri podijeljeno sa okvirima runde. Ima jedan posao — ako ne pada preko rundi, runda kupljena ništa, i sljedenja bi trebala promijeniti nešto osim količine podataka.
To je pristrana metrička i trebao bi znati kako. Mjere supervizora prag kao što je policy kompetencija, što je zašto okidač popis ostaje fiksna; operater što se opušta preko sesije proizvodi pada krivulja sa ništa iza toga. To i ignora ozbiljnost — deset okvira za zaustaviti sudara i deset za gurnuti hvatanja izgledaju identični. Upari to sa fiksni procjeni skup nema ispravka podataka bila ikad crtana iz. Članak na mjerenju DAgger petlje radi kroz procjeni dizajn, uključujući kako drži procjeni epizode van obuke miješanja.
- Radi prvoga dana, na bilo kojoj politici arhitekturi, bez dodatnog modela za kalibraciju
- Hvata samozuvjeran-i-krivi neuspjehi nema varijanci prag detektira
- Proizvodi ispravke snimljene dok je operater imao potpunu kontrolu, u trenutak koje su odabrali
- Daje per-okviru marker što intervencija-ponderirani metodi kao što su IWR i Sirius konzumira
- Koštanja kontinuirane nadzora; to ne skalira na jedan osoba i mnogo robota
- Zavisi na operater konzistencije — plutajući prag koruptira intervencija stopu
- Proizvodi nema rizik model na sebe; HG-DAgger je naučio prag i ThriftyDAgger procjenjivač su dodatna mehanika
- Broji okvire, nije koncesije
- Ne može spasiti politiku čiji neuspjeh je uzvodni kontrole, kao zamijenjene kamere ili mislabeled zadatak niz
Otvorena pitanja vrijedna čuvanja u pogledu
Mjerila su slaba. Spencer i kolege pregledanu koristio za testiranje pristupa učenja imitacijom i pronašli ih "realizabilni i jednostavni i tako nedostatni za hvatanja tvrđe režima pogreške kumulacije viđene u stvarnog svijeta donošenja odluke probleme" — i, naspram okružujućeg književnosti, pronašli obični ponašanja kloniranje je učinio dobro na njima. To je razlog biti sceptičan od bilo kojeg rangiranja DAgger varijanti počivanja na te zadatke, uključujući neki brojke u tablici iznad.
Robot vrata na velikom politike nisu ni riješena. AIM rad zamjenjuje neodređenost sa proxy Q-funkcija kretnje čovjeka intervencija pravila i izvještava 40% poboljšanja u preuzimanja trošak i učenja efikasnosti naspram ThriftyDAgger — u kontinuirana i diskretna kontrola, nije na vide-jezik-akcije modelu voziti manipulator. Bilo koji od tih vrata transferi na fino-podešena VLA je otvoriti. Pregled čini srodni točka: poljska terminologije i struktura nisu ujedinjeni preko književnosti, što čini metodi teško usporediti. Na vlastitoj ruci, vaši zapisnici su dokazi što imaš.
Je HG-DAgger zaista DAgger ako čovjek samo oznake tijekom intervencije?▾
Čuva dio što broji — podaci prikupljeni pod distribucijom stanja što učenika inducira, agregirani sa što je došlo prije — i pada dio što ne preživi kontakt sa hardveru. Kelly i dr. predstavljaju to kao varijanta; 2011 bez-žaljenja jamstvo ne nosi preko nepromijenjena.
Mogu li koristiti robot vrata na fino-podešena VLA policy na SO-100?▾
Ne jasno. SafeDAgger je klasifikator trebaj queryable referentnu policy što nemaš. EnsembleDAgger trebaj ansambal, što za tlo-milijardu-parametra model znači nekoliko kopija memorije plus njihove zaključivanja trošak. ThriftyDAgger trebaj rizik procjenjivač prilagođen na uspjehe i neuspjehi što ne postoji prije tvoj prvi rundi.
Kako dugo trebalo bi biti jedan preuzimanja?▾
Dugo dovoljno dosegnuti stanje što policy može nastaviti, i ne dulje: produženi preuzimanja pretvori rundu u demonstraciju sesiju i poplavi ispravka skup sa nominalno ponašanja. LazyDAgger je pronašao reže drugi način — mnogo vrlo kratke prebacivanja su njihove vlastite trošak.
Trebam li obuke samo na ispravljenih dijelova?▾
Ne — to je najčešće način rasipati rundu. Model fino-podešavanjem samo na oporavke ima vidio gotovo ništa ali oporavke. Miješati ispravke u originalni skup podataka sa izvorima odabranih eksplicitno; ići dalje, pogledaj intervencija-ponderirani pristupe kao što su IWR ili Sirius, što gore-ponderirani čovjek-vozio okviri umjesto izoliranja njih.
Što ako intervencija stopu ne pada nakon runde?▾
Uzmi to lice vrijednost: rundu nije pomogla. Prije dodavanja ispravke, provjeri jeftiniji objašnjenja — je li operater prag plutajući, bili su ispravke kozmetičke, je li komponiran skup podataka zaista sadržani njih, je li obuke inicijalizirana iz predviđenog checkpoint. Rundu što je tiho počela od baznog modela izgleda točno kao rundu što nije uspjela naučiti.
Je li ne-intervencija nosi informaciju?▾
Pod Expert Intervention Learning, da: dionica gdje supervizor je gledao i nije napravio su čitane kao slaba dokaza što stanja i akcija su bili prihvatljiva, formalizira kao ograničenja na vrijednost funkciji. Većina praktični cjevovoda, uključujući ovo, marker samo što čovjek vozio.
Za jedan ruku na stolu izbor je postavljen: držati vrata za sebe, napiši što otvara to, i potrošak napor na rukovanje podacima iza toga umjesto na automatiziranje prebacivača. Stranica platforme je opisana na DAgger petlje stranica, obuka opcije po politici obitelj pod obuka i cijene. Za pozadina, počnite sa učenja imitacijom i učenja imitacijom na SO-100; za prvi pokretanje, pokrenuti vašu prvu politiku je kraći put.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started