Operater koji nadgleda robotsku ruku kroz interfejs teleopеracije, ruke na kontrolama i spreman da preuzme kontrolu
DAggerInteraktivno učenje imitacijomHG-DAggerRobotske politikeSO-100

HG-DAgger i gatirani varianti: Ko odlučuje kada da preuzme kontrolu nad robotskom politikom

AY-Robots ResearchAugust 27, 202615 min čitanja

Običan DAgger traži od čoveka da označi stanja dok robot još vozи. Na pravoj hardveru to je nеbezbeдno i proizvodi loše oznake. Gatirani varianti zamenjuju slepo označavanje sa gatom koju neko mora držati: čovek u HG-DAgger, klasifikator bezbeđnosti u SafeDAgger, neusaglašenost ansambla u EnsembleDAgger, procenjivanje novosti i rizika sa budžetom u ThriftyDAgger. Ovaj članak ih upoređuje prema tome ko poseduje gatu, koji signal je otvara i koliko svaki od njih košta — i zašto forma kontrolisana od čoveka je ona koja preživi kontakt sa pravom rukom.

Klonirana politika pada gde jој训練 podaci nestanu. Popravka je da nastavimo prikupljati podatke под sopstvenom raspodelом stanja politike umesto raspodelom demonstratora, što DAgger radi i što uvodnjenje u agregaciju skupa podataka pokriva iz prvo principa. Ostavlja otvorenom neugodnu часt originalnog algoritma: dok učenik vozи, stručnjak bi trebao da kaže šta bi uradio, za svako stanje, bez kontrole.

U simulatoru sa skriptiranim stručnjakom to je besplatno. Na stolu sa pravom rukom na njega niti je besplatno niti bezbedno. HG-DAgger autori tačno navode prigovor: takve šeme uzorkovanja "zahtevaju od stručnjaka da pruži oznake akcija bez potpune kontrole sistema", što "može smanjiti bezbednost i, kada se koriste čoveka kao stručnjak, verovatno će degradirati kvalitetu prikupljenih oznaka zbog percipiranog zaostajanja aktuatora" (Kelly i sar., 2019). Dva neuspeha se kriju u toj rečenici: politika nastavlja voziti u stanja koja nikome nisu potrebna, a oznake kupljene tim rizikom su gore od onih koje čovek proizvodi dok drži kontrole. Svaki varijant ispod odgovara na isto pitanje — stavi gatu na kontrolu i pustи nekoga da odluči kada se otvara. Razlikuju se po tome ko je to neko.

Kratka verzija

  • Gatirani varianti zamenjuju slepo označavanje sa prekidačem između kontrole politike i kontrole stručnjaka. Ono što ih razdvaja je ko poseduje prekidač.
  • HG-DAgger daje prekidač čoveku i agreguje samo podatke zabeležene dok je čovek imao neprekidnu kontrolu.
  • SafeDAgger to daje binarnom klasifikatoru koji predviđa devijaciju od referentne politike; EnsembleDAgger zahteva nisku varijansu ansambla i mali rastojanje od akcije stručnjaka istovremeno.
  • LazyDAgger dodaje histeresis tako da kontrola ne osciluje; ThriftyDAgger gatirovana na novosti ili procenjenom riziku pod eksplicitnim budžetom intervencije.
  • Signali gatirani od strane robota trebaju nešto što fino-tunirani VLA na amatoru-klasi ruke obično nedostaje: referentnu politiku, jeftinu kolekciju, ili kalibriranu epistemičku neizvesnost.
  • Gata je polovica metode. Šta se dešava sa segmentima intervencije posle — mešanje, ponderisanje, agreacija — odlučuje da li je runda unapredila nešto.

Kontrolisano od čoveka i kontrolisano od strane robota: podela koja bitka

Interaktivno učenje imitacijom ima vlastitu anketu; Celemin i kolege ga katalogizuju prema tipu povratne informacije, interfejsu, modelu učenja, iskustvu korisnika, aplikaciji i testu. Razlika koja odlučuje tvoje inženjerstvo je jednostavnija od bilo koje od tih osa, i nedavna dela ga direktno imena: metoda je kontrolisana od čoveka kada nadzornik odluči kada će intervenisati, i kontrolisana od strane robota kada agent odluči kada će tražiti pomoć (Cai i sar., 2025). Sve ostalo je mehanizam koji služi jednom od ta dva izbora. Tradeoff je vidljiva od početka: čovečja gata košta neprekidnu pažnju, i robotska gata obećava da vrati tu pažnju — ali samo ako je signal koji gatiřuje pouzdan, i izgradnja tog signala je sopstveni problem istraživanja.

SafeDAgger: klasifikator koji predviđa vlastitu devijaciju

SafeDAgger Zhang-a i Cho-a (2016) je najstarija od ovih gata. Ispitivanje referentne politike je skupo, tako da druga, manja mreža — politika bezbednosti — predviđa da li je ispitivanje uopšte vredeće. Ona "vraća binarnu oznaku koja ukazuje da li je primarna politika verovatno devijacija od referentne politike bez njenog ispitivanja". Oznaka je definisana prema kvadriranjem L2 devijacijom između akcija dve politike sa pragom tau, i klasifikator je pristajao sa binarnim unakrsnom entropijom. U vremenu izvršavanja odlučuje po stanju da li učenik nastavlja voziti ili referentna preuzima kontrolu. Apstrakt izveštava manje referentne upite u simulatoru trke automobila plus ubrzanje brzine konvergencije koju autori pripisuju automatizovanom efektu kurikuluma, bez datuma za bilo šta od toga.

Hvatanje je u definiciji, ne u rezultatima. Obuka klasifikatora zahteva akciju referentne politike na svakom stanju korišćenom za prilagođavanje, što pretpostavlja da je referenca drugi program. Ako je vaša referenca osoba sa liderom rukom, taj skup oznaka nije jeftin i metoda gubi svojstvo za koje je bila dizajnirana.

EnsembleDAgger: sumnja i neusaglašenost, oba

Menda, Driggs-Campbell i Kochenderfer (2019) tretiraju gatu kao verovatnu pitanja. EnsembleDAgger "približava Gausov proces korišćenjem ansambla neuronskih mreža" i čita varijansu ansambla kao proxy poverenja: visoka varijansa znači region sličan podacima obuke, što — pretpostavljajući da stručnjak izbjegava stanja neuspeha — korelira sa blizinom neuspeha. Pravilo je konjunkcija. Učenik može delovati samo kada je L2 rastojanje između njegove srednje akcije i akcije stručnjaka ostaje ispod jednog praga (neusaglašenost) i varijansa njegove predviđene akcije ostaje ispod druga (sumnja). Ako bilo šta ne uspe, stručnjak preuzima kontrolu. Cilj je maksimizovati deo akcija učenika dok ograničava verovatnost neuspeha; papir izveštava poboljšanu bezbednost i učenje nasuprot ostalim DAgger varijantama na invertovanom klatnu i MuJoCo HalfCheetah.

Termin neusaglašenosti trebakosti akcije stručnjaka

Ovo tiho diskvalifikuje potpuno pravilo za nadzor bez ruku. Rastojanje između akcije učenika i akcije stručnjaka zahteva akciju stručnjaka u tom stanju, u tom momentu. Sa skriptiranim stručnjakom, dobro. Sa čovekom, čovek mora proizvesti akcije neprekidno — tačno opterećenje koje su gatirani varianti trebali da uklone. Samo sumnja je bez ruku; konjunkcija nije.

LazyDAgger: zaustaviti oscilovanje prekidača

Hoque i kolege (2021) napali su trošak koji su raniji radovi nisu merili: sam prekidač. Svaka intervencija "prekida drugi rad koji čovek radi, uvodi latenciju sa svakom prelaskom konteksta između nadzornika i autonomne kontrole, i zahteva vreme za izvršenje". Gata koja se otvara i zatvara deset puta u minuti je gora od jednog otvaranja deset sekundi, sa identičnom autonomnom podelom. LazyDAgger proširuje SafeDAgger sa asimetričnim pragovima — teže da uđe nadzor nego da ostane — tako da sistem ne osciluje na granici. U simulaciji "može smanjiti kontekst prelazaka za prosečno 60% preko SafeDAgger na 3 kontinualna zadatka kontrole zadržavajući najčešće moderno performansu politike"; u manipulaciji tkaninom sa ABB YuMi "smanjuje kontekst prelazaka za 60% dok se postiže 60% veća stopa uspeha od SafeDAgger u vremenu izvršavanja".

ThriftyDAgger: novost ili rizik, pod budžetom

ThriftyDAgger (Hoque i sar., CoRL 2021) počinje od nadzornog budžeta umesto politike. Koristi "naučenu politiku prebacivanja da traži intervencije samo u stanju koja su dovoljno (1) nova, gde robotska politika nema referentno ponašanje da oponaša, ili (2) rizična, gde robot ima nisku poverenje u završetak zadatka", sa novom metrikom za procenjivanje tog rizika. Budžet je ulaz, ne izlaz: navedete koliko čovekovog vremena ćete potrošiti. Primenjeno u vremenu izvršavanja metoda "dostiže 100% stopu uspeha na simulaciji i fizičkim zadacima", i korisničko istraživanje sa deset učesnika kontrolišući flotu od tri robota uz task saputnje izveštava da "povećava čovekov i robotski performanse za 58% i 80% respektivno u odnosu na sledећи najbolji algoritam dok smanjuje opterećenje nadzornika". Flota postavka je prirodnom domenu za ovaj rad; Fleet-DAgger kasnije formalizovao interaktivno učenje flote sa više robota i nadzornika, predlažući Povratak na čovečijev napor kao količinu za optimizovanje.

HG-DAgger: čovek drži gatu

Kelly i sar. (2019) idu drugi put. Nema politike prebacivanja. Učenik se ukupuje "dok stručnjak primeti da početnika uđe u nеbezbедno područje prostora stanja", u kojem trenutku stručnjak preuzima kontrolu i vodi sistem nazad. Pravilo agregacije je ključan deo: "Oznake akcije eksperta se prikupljaju i dodaju skupu podataka samo tokom ovih segmenata oporavka, tokom kojih je čovečji stručnjak imao neprekidnu kontrolu sistema." Ništa se ne označava dok je čovek gledalac.

Ne staje na prekidaču. HG-DAgger takođe "uči prag bezbednosti za metriku rizika zasnovanu na neizvesnosti modela koja se može koristiti da predvidi performansu potpuno obučene početnika u različitim oblastima prostora stanja": beloži kako neizvesna je bila početnika u trenucima kada je čovek intervenisao i prosečava poslednju četvrtinu tih zapisa, gde početnika najviše liči na svoj završni oblik. To nije gata koju robot upravlja već dijagnostika koja ti govori gde se očekuje da završena politika drži. Evaluacija pokriva simuliran i stvaran zadatak vožnje i izveštava poboljšane performansu i DAgger i učenju ponašanja.

Jedna srrodna linija menja šta računa kao oznaka. Spencer i kolege Učenje intervencije eksperta drži da "bilo koja količina povratne informacije eksperta, bilo intervencijom ili nе-intervencijom, pruža informacije o kvaliteti trenutnog stanja, optimalnosti akcije, ili oba", formalizovano kao ograničenje na vrednosnu funkciju učenika i rešeno sa ne-žaljenjem onlajn učenjem. Pod tim čitanjem, периodi gde je čovek gledao i ništa nije uradio su slabe pozitivne dokaze umesto praznog. EIL uči izbjegavanje sudara iz oko jedne minute kontrole eksperta.

Robotska ruka radnog prostora sa kamerama pozicioniranim za prikupljanje podataka tokom nadzora politike rollout
Čovečja gata je obična sesija zaključivanja sa snimačem priloženim. Okviri koje je operator vodio su označeni; ostatak ostaje kako je bio.

Varianti jedno pored drugog

MetodaKo otvara gatuSignalPotrebna dostupnostIzvešteno
DAgger (Ross i sar., 2011)Niko — učenik uvek vozиNema; stručnjak označava sve posećena stanjaStručnjak koji može označiti vиš-politička stanja bez kontroleRedukcija bez žaljenja sa garancijama pod raspodelom stanja učenika
HG-DAgger (Kelly i sar., 2019)Čovečji nadzornikNadzornički osuda da je stanje nеbezbедnoNeko koji gleda, i čista predaja kontrolePobеđuje DAgger i učenje ponašanja na simuliranom i pravom zadatku vožnje; takođe uči prag rizika
SafeDAgger (Zhang & Cho, 2016)RobotBinarni klasifikator za L2 devijaciju od reference iznad tauIspitiviva referentna politika za oznake klasifikatoraManje referentnih upita u simulatoru trke, brža konvergencija (nema broja datuma)
EnsembleDAgger (Menda i sar., 2019)RobotVarijansa ansambla i rastojanje do akcije stručnjaka, oba ispod pragaAnsambl mreža plus akcija stručnjaka na svakom korakuPoboljšana bezbednost i učenje na klatnu i HalfCheetah
LazyDAgger (Hoque i sar., 2021)Robot, sa histerezomSignal SafeDAgger sa odvojenim pragovima ulaska i izlaskaŠta SafeDAgger trebakosti, plus drugi prag za uštine~60% manje kontekstnih prelazes na 3 zadatka; 60% viši uspeh na YuMi tkanini
ThriftyDAgger (Hoque i sar., 2021)Robot, pod budžetomNovost, ili procenjeni rizik od ne završetka zadatkaNaučeni procenilac rizika i navedeni budžet intervencije100% uspeh u vremenu izvršavanja; korisničko istraživanje (N=10): 58% i 80% dobitaka preko sledećeg najbolji
EIL (Spencer i sar., 2020)Čovek — nе-intervencija broji suvišeIntervencija i njena odsustvo kao ograničenja na vrednosnu funkcijuOnlajn učenje bez žaljenja preko vrednosnog ograničenjaIzbjegavanje sudara iz oko jedne minute kontrole eksperta

Šta svaka gata nabavlja, i šta naplaćuje

Čitaj dole "trebakosti" kolonu i šablon pada: svaki robot-gatirani signal tamo je proxy koji mora biti proizvedeni, i svaki proxy ima svoju kartu.

  • Signali neusaglašenosti (SafeDAgger, LazyDAgger, pola od EnsembleDAgger pravila) trebakosti referentnu politiku. Ili imaš skriptirani stručnjak, u kojem se slučaju interesantan problem je već rešen, ili čovek kontinuirano proizvodi akcije u pozadini tako da rastojanje može biti izračunato.
  • Signali sumnje trebakosti kalibriranu epistemičku neizvesnost. Ansambl malih mreža kontrole je približava; ansambl od tri milijarde parametara modela vid-jezika-akcije je memorija i latencija problem prvo.
  • Signali novosti i rizika trebakosti naučeni procenilac završetka zadatka, uklonjen na dovoljno usešnim i neusešnim rolloutima. Na zadatku koji još radiš, ti podaci ne postoje u kolu jedan.
  • Čovečja gata trebakosti pažnje i ništa drugo — jedini signal dostupan na dan jedan, na bilo kojoj arhitekturi politike, bez dodatnog modela da obučaš.
  • Nе robot gata uklanja čoveka iz sobe. Smanjuju koliko često čovek mora delovati, nije li trebakosti biti prisutan.

Postoji tišeća razlika u šta gata proizvodi. Robot gata gašenja srednje trajektorije prosleđuje čoveka pokretnu ruku sa произвољном pozom. Čovečja gata dozvoljava operateru da odabere trenutak — posle dosega, pre hvata, ne ni kroz zamah. Segmenti oporavka od dva nisu jednako čisti, i ti segmenti su ceo proizvod kola.

Zašto čovečja gata oblika pobjeđuje na pravoj hardveru

Ovo je inženjerski argument, ne benchmark rezultat — nema članka koji smo našli koje vodи sve pet gata na istom manipulatoru sa istom klasom politike. Oporira se na četiri tačke.

Prvo, nadzornik je ionako tamo. Niko ne ostavlja SO-100 ruku funkcionišući nеприпеnо pored objekata koje može srušiti. Čim neko gleda, marginalni trošak davanja im dugmeta preuzimanja je blizu nula; izgradnja kalibriranog procenioca rizika je projekat.

Drugo, neizvesnost koju zapravo možeš meriti na modernoj politici je često pogrešna količina. Difuzija ili hlađenje头部 proizvodi varijansu u uzorkovanim akcionim čunkovima, i ta varijansa odražava multimodalnost koju je glava obučavana da predstavi, ne epistemičku neznanju o stanju. EnsembleDAgger sumnji terminu koristi ansambl tačno da uhvati poslednje. Dva izgledaju kao isti broj i nisu; action chunking i flow matching unosi pokrivaju kako ti головы emituju akcije na prvom mestu.

Treće, neuspehi koji su bitka u manipulaciji često su semantički umesto statitički neobičnog. Politika koja zatvorи gripper dva centimetra ranije, ili dosegu samouvereno za pogrešnu od dva identična kocka, nije u stanju visokoj varijansi — je samouverena i pogrešna. Nе prag varijanse hvata to; čovek gledajući hvata to odmah.

Četvrto, kvaliteta oznake — originalna HG-DAgger tačka, i one često preskočene. Oznake prikupljene dok je čovek imao neprekidnu kontrolu pobjeđuju oznake naraćene nad pokretnim sistemom. Ako je cilj korekciona data vredna agregacije, opterećenje dokaza leži sa automatizovanom gatom.

Gde robot gata plaćaju

Slika pretvršava kada jedan nadzornik je odgovaran za mnogo robota — režim ThriftyDAgger korisničkog istraživanja i Fleet-DAgger formalizacije ciljnog. Sa flotom, čovečka pažnja je retko i automtizirani raspodela pobjeđuje nijedan. Sa jednom rukom na jednom stolu nisi u tom režimu.

Čovečja gata petlja, već napravljena

Preuzimanje tokom izvršavanja sesije zaključivanja, sveodnosne intervencije zastavice na korektivnim segmentima, kuratovanje svakog kola u korekcije ili evaluacija, komponovanje mešovitog skupa podataka iz izvora koje odabereš, i nastavljanje obuke od postojeće kontrollne tačke su ugrađeni umesto skriptirani ručno. Preuzimanje radi sa liderom rukom, ili sa tastaturom i klizačima ako ga nemaš.

Vidi kako DAgger petlja radi

Gata je polovica metode; rukovanje podacima je druga polovica

Gata odlučuje koje okvire je čovek vodio, ne šta uraditi sa njima, i ta druga odluka je gde se kola često baca. Prvo pravilo je ono što D u DAgger stoji za: agreguj, nemoj zameniti. Fino-podesiti checkpoint čisto na nekoliko stotina korekcijskih okvira daje ti model koji je vidio gotovo ništa osim oporavka i je zaboravio nominalni trajektoriju.

Drugo pravilo je da intervencioni okviri nisu obični okviri. Mandlekar i sar. izgrađeni sistem teledirovanosti za 6-DoF manipulaciju pustio operaterima da prate politike i preuzmu na neuspehu, zatim obučeni iterativno sa algoritmom koji "ohrabruje politiku da uči kako da pređe grla kroz intervencije"; agenti obučavani na toj data prevaziše agente obučavane na jednakom broju običnih uzoraka demonstracije. Sirius gura ideju u postavljanje, "ponovno ponderisanje uzoraka obuke sa približenom čovečjim poverenjem i optimizacijom politike sa ponderisanom ponašanju kloniranjem". Oba trebakosti sveodnosnog okvira markera šta je bilo čovečji voziti, što je zašto intervention zastava bitka više nego što izgleda.

Treće pravilo je da je automatsko mešanje zamka. Komponovan skup podataka čiji izvori ne možeš nabrojati je jedan koji ne možeš ispraviti kada sledeće kolo postane gore. Na ovoj platformi korak komponovanja je eksplicitan za tu razlog — originalni skup podataka plus korekcije, izbor epizode po izvor, i rezultat je običan LeRobot dataset koji se sinkronizuje i obučava kao i bilo koji drugi; dokumentacija skupa podataka pokriva stranu format.

Korak u koluŠta proizvodiNajčešće pute grešaka
Pokreni zaključivanje sa snimanjemKolo pod sopstvenom raspodelom stanja politikeZabeleženo kao obična teleopеracija, gubeci što je politika vozila
Preuzmi na neuspehuKorekcioni segmenti sa sveodnosnom intervencijom zastavicoIspravljanje kozmetičkog titranja, podučavanje stila umesto oporavka
Kuratuj svaku epizoduKorekcije, evaluacija, ili odbacivanjaČuvanje svega; botovana preuzimanja košta više nego što je epizoda bila vredna
Sinkronizuj korekcijeVerzioniran skup podataka pored originalneKorekcije koje nikada ne napuste lokalni stroj
Komponuj mešovit skup podatakaOriginalni plus korekcije, eksplicitan izborTihim auto-mešanjem, tako da kasnije regresija ne može biti tragana na izvor
Nastavi od kontrollne tačkeKontrollna tačka inicijalizovana od prethodnogOčekujući optimizator pauzu; težine inicijalizuje model, ne vraća stanje optimizatora

Postavljanje gata koju čovek zapravo može držati

"Čovek odlučuje" nije specifikacija. Dva operatera sa različitim pragovima proizvode neuporedivo kola, i drifting prag proizvodi trend koji ne možeš pročitati. Napиši okidače dole pre prvog kola.

  1. Imenuj uslove koji otvaraju gatu — doseg isključeno više nego fiksni margin, gripper zatvaranje na ništa, zglobе klizi prema granici, stall od više od sekunde ili dva — i drži listu nemenjena za kolo.
  2. Imenuj šta ne otvara. Prekoračaj politika od kojih se opravlja sama je signal obuke; preuzimanje tamo briše oporavak koji već zna.
  3. Preuzmi dovoljno rano za čistu predaju, ruku nazad čim je stanje povratljivo.
  4. Beloži zašto si preuzeo, po epizodi. Tri kola kasnije je jedino zapisa da li se ista greška vraća.
  5. Drži kamere, tekst zadatka i operatera konstante preko kola. Promeni jedan i brojevi prestanu biti uporedivi.

Mehanički predaja ima dva varianta. Sa liderom rukom, lider mora dosegnuti sledbenika trenutnu pozu pre prenosa momenata, ili se ruka skače; ovaj pokret poravnanja je najmanje testirana deo lanca na pravoj hardveri. Bez liderom ruke preuzimanje je ručni od prvog pritiska tastera: sledběnik je drži i operator ga nudžа zglobе po zglobе od tastature ili vuče klizače, sa serverskom stranom stezanja održavanja svakog ulaza mali — par stepeni po pritsku tastera, pedesetak po ažuriranju klizača, jer je veliki korak u održavan pozu kako ćeš otkinuti servomehanizam. Korak-po-korak verzija sa ključnom vezom je u vodiču kroz DAgger kolo na SO-100; pozadina na oba teleopеracija modusa je u teleopеracija dokumentacija i lider-sledbenić unos.

Poređenje podržanih arhitekturi politike sa njihovim karakteristikama obuke i zaključivanja
Gata je arhitektura-agnostična. Koju politiku ispravljaš menja trošak obuke kola, ne kako preuzimanje radi.

Čitanje da li je gata uradila nešto

Metrika čovečja gata kola je stopa intervencije: intervencije okviri deljeni sa okvirima kola. Ima jedan posao — ako ne padne preko kola, kolo nije kupilo ništa, i sledeće bi trebalo promeniti nešto drugo umesto količine podataka.

To je nepristrana metrika i trebala bih da znaš kako. Meri nadzornički prag kao što je politika kompetencija, što je zašto lista okidača ostaje fiksna; operater koji opušta preko sesije proizvodi padajuću krivu bez toga iza. Takođe ignoriše težinu — deset okvira da zaustavi sudarе i deset da nudžа hvat izgledaju identični. Uparivaj sa fiksnom evaluacijom skupom bez korekcije podataka ikada privučeno od. Članak o merenju DAgger petlje radi kroz design evaluacije, uključujući kako da drži evaluaciju epizode od strane obuke mešanja.

Čovečja gata, iskreno
Šta daje
  • Radi na dan jedan, na bilo kojoj arhitekturi politike, bez dodatnog modela da kalibruješ
  • Hvata samouverene i greške nе prag varijanse detektuje
  • Proizvodi korekcije zabeležene dok je operater imao puna kontrole, u momentu koji je odabrao
  • Donosi sveodnosni okvir marker da intervencioni ponderisani metode kao što su IWR i Sirius konzumiraju
Šta ne
  • Košta neprekidni nadzor; ne skalira na jednu osobu i mnogo robota
  • Zavisi od operatera konzistencije — drifting prag korupi stopa intervencije
  • Proizvodi nе risk model sam; HG-DAgger naučeni prag i ThriftyDAgger procenilac su dodatne mehanike
  • Računa okvire, ne posledice
  • Ne može spasiti politiku čija greška je upstream od kontrole, kao što je zamenjenom kamera ili pogrešno označeno zadatak stringе

Otvorena pitanja vredna čuvanja u pregledu

Testovi su slabi. Spencer i kolege ispitali one korišćene za ispitivanje pristupa učenja imitacijom i našli ih "ostvarljive i jednostavne i samim tim nedovoljne za zahvatanje težih režima greške komponovanja viđenega u stvarnim problemeima odlučivanja" — i, nasuprot okolnim literaturama, našli je obično ponašanje kloniranje uradio dobro na njima. To je razlog za skepsu bilo koje rangiranje DAgger varianta oporovane tim zadacima, uključujući neke brojeve u tabeli gore.

Robot gata na velikim politikama takođe nisu rešeni. AIM rad zamenjuje neizvesnost sa proxy Q-funkcijom oponaša čovečjog intervencionskog pravila i izveštava 40% poboljšanje u trošku preuzimanja i efikasnosti obuke preko ThriftyDAgger — u kontinualnom i diskretnom kontroli, ne na vid-jezika-akcije modelu vozenja manipulatora. Da li bilo koji od ovih gata prenosa na fino tunirani VLA je otvoren. Anketa čini povezanu tačku: terminologija polja i struktura nisu ujedinjene premala literaturom, što čini metode teške za poređenje. Na tvojoj ruci, tvoji zapisи su dokazi koje imaš.

Da li je HG-DAgger zaista DAgger ako čovek samo označava tokom intervencija?

Drži deo koji bitka — podaci prikupljeni pod raspodelom stanja koju učenik induktuje, agregovan sa onim što je došlo pre — i padnu deo koji ne preživi kontakt sa hardverom. Kelly i sar. ga predstavljaju kao varijanta; 2011 ne-žaljenja garancija ne nosi preko promenjena.

Mogu li koristiti robot gatu na fino-tunirani VLA politiku na SO-100?

Ne direktno. SafeDAgger klasifikator trebakosti ispitiviva referentna politika koju neću imati. EnsembleDAgger trebakosti ansambl, što za multi-milijardi parameter model znači nekoliko kopija u memoriji plus njihovim zaključivanjem trošak. ThriftyDAgger trebakosti procenilac rizika uklonjen na uspesima i neuspesima koji ne postoje pre tvojih prvих kola.

Koliko dugo bi trebao biti jedan preuzimanja?

Dovoljno dugo da dosegne stanje politika može nastaviti od, i ne duže: prošireni preuzimanja pretvori kolo u demonstracijsku sesiju i poplavi korekcioni skup sa nominalnim ponašanjem. LazyDAgger pronalazak seče drugi put previše — mnogi vrlo kratki prekidači su sopstveni trošak.

Trebakosti li obuke samo na korektivnim segmentima?

Ne — to je najčešće pute bacanja kola. Model fino-tunirani samo na oporavke je vidio gotovo ništa osim oporavka. Mešaj korekcije u originalni skup podataka sa izvorima izabranim eksplicitno; da odeš dalje, pogledaj intervenciono ponderisane pristupe kao što su IWR ili Sirius, koji gore ponderuju čovečje voziti okvire umesto izolovanja ih.

Šta ako stopa intervencije ne padne posle kola?

Uzmi to u nominalno vrednost: kolo nije pomoglo. Pre nego što dodam korekcije, proveri jeftiniji objašnjenja — da li je nadzornički prag driftovao, da li su korekcije kozmetičke, da li je komponovan skup podataka zapravo sadržavao ih, obuka je li inicijalizovana od namernskog kontrollne tačke. Kolo koje je tiho započelo od baznog modela izgleda tačno kao kolo koje je neuspelo da nauči.

Da li nе-intervencija nosi informacije?

Pod Stručnjak intervencija učenjem, da: periodi gde je nadzornik gledao i nije delovao se čitaju kao slabi dokazi da su stanje i akcija bili prihvatljivi, formalizovano kao ograničenje na vrednosnu funkciju. Većina praktični cevovodi, uključujući ovaj, markera samo što je čovek vodio.

Za jednu ruku na stolu izbor je napravljen: drži gatu sam, napиши šta otvara, i potroši napor na rukovanje podacima iza njega umesto na automatizovanju prekidača. Stranu platforme je opisana na DAgger petlja stranici, opcije obuke po porodici politike ispod obuka i cene. Za pozadinu, počni sa učenje imitacijom i učenje imitacijom na SO-100; za prvi kolo, pokreni tvoju prvu politiku je kraća putanja.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started