
Prostý DAgger požiada ľudského označovateľa, aby označil stavy, zatiaľ čo robot stále jazdí. Na skutočnom hardvéri je to nebezpečné a produkuje slabé značky. Gated varianty nahradzujú slepe označovanie bránou, ktorú musí niekto držať: ľudský v HG-DAgger, bezpečnostný klasifikátor v SafeDAgger, neshodu ensemblu v EnsembleDAgger, budgetovaný odhad novosti a rizika v ThriftyDAgger. Tento článok ich porovnáva podľa toho, kto vlastní bránu, aký signál ju otvára a čo každý z nich stojí — a prečo je forma ľudských brán tá, ktorá prežije kontakt so skutočným ramenom.
Klonovaná politika zlyhá tam, kde jej trénovacie údaje skončili. Riešením je pokračovať v zbere údajov pod vlastnou distribúciou stavov politiky namiesto demonstrátorových, čo robí DAgger a čo úvod do agregácie dataset pokrýva od základov. Ponecháva otvorenú trápnu časť pôvodného algoritmu: zatiaľ čo sa učiteľ pohybuje, expert má hovoriť, čo by bol urobil, pre každý stav, bez toho, aby mal kontrolu.
V simulátore so skriptovaným expertom je to zadarmo. Na stole so skutočným ramenom to nie je ani zadarmo, ani bezpečné. Autori HG-DAgger presne vyslovujú námietku: takové schémy odberu vzoriek "vyžadujú, aby expert poskytnul značky akcií bez úplnej kontroly nad systémom", čo "môže znížiť bezpečnosť a pri používaní ľudí ako expertov pravdepodobne zhorší kvalitu zozbieraných značiek kvôli vnímanej latencii aktuátora" (Kelly et al., 2019). Dve chyby sa skrývajú v tejto vete: politika stále jazdí do stavov, ktoré nikto nechce, a značky kúpené s týmto rizikom sú horšie ako značky, ktoré vytvorí ľudský expert, ktorý drží ovládače. Každá nižšie uvedená varianta odpovedá na rovnakú otázku — položí bránu na kontrolu a nechá niekoho rozhodnúť, kedy sa otvára. Líšia sa v tom, kto je ten niekto.
Krátka verzia
- •Gated varianty nahradzujú slepe označovanie prepínačom medzi kontrolou politiky a kontrolou experta. Čo ich oddeľuje, je kto vlastní prepínač.
- •HG-DAgger dáva prepínač ľudskému a agreguje iba údaje zaznamenané, zatiaľ čo mal ľudský neprerušovanú kontrolu.
- •SafeDAgger mu dáva binárny klasifikátor predpovedajúci odchýlku od referenčnej politiky; EnsembleDAgger vyžaduje nízky rozptyl ensemblu a malú vzdialenosť od akcie experta naraz.
- •LazyDAgger pridáva hysteréziu, aby sa kontrola neping-pongovala; ThriftyDAgger brány v novosti alebo odhadnutom riziku pod explicitným rozpočtom intervencie.
- •Signály robotických brán potrebujú niečo, čo jemne ladená VLA na ramene so záľubou zvyčajne postrádajú: referenčnú politiku, lacný ensemble alebo kalibrovanú epistemickú neistotu.
- •Brána je polovicou metódy. To, čo sa stane so segmentmi intervencie potom — miešanie, váženie, agregácia — rozhoduje, či sa kolo zlepšilo.
Human-gated a robot-gated: rozdelenie, ktoré sa počíta
Interactive imitation learning má svoj vlastný prieskum; Celemin a kolegovia ho katalógizujú spolu s typom spätnej väzby, rozhraním, modelom učenia, skúsenosťami používateľa, aplikáciou a benchmarkom. Rozdelenie, ktoré rozhoduje o vašom inžinierstve, je jednoduchšie ako ktorákoľvek z týchto osí a nedávna práca to priamo pomenováva: metóda je human-gated keď supervízor rozhoduje, kedy zasiahnuť, a robot-gated keď agent rozhoduje, kedy požiadať o pomoc (Cai et al., 2025). Všetko ostatné je strojovňa slúžiaca jednej z týchto dvoch možností. Obchod je viditeľný od začiatku: ľudská brána stojí nepretržitú pozornosť a robotická brána sľubuje vrátiť túto pozornosť — ale len ak je signál, ktorý hlídá, dôveryhodný, a konštrukcia tohto signálu je jej vlastná výskumný problém.
SafeDAgger: klasifikátor, ktorý predpovedá svoju vlastnú odchýlku
SafeDAgger od Zhanga a Choa (2016) je najstarší z týchto brán. Dotazovanie referenčnej politiky je nákladná časť, takže druhá, malá sieť — bezpečnostná politika — predpovedá, či sa vôbec oplatí dotazovať. Vracia "binárnu značku označujúcu, či sa primárna politika pravdepodobne odchýli od referenčnej politiky bez jej dotazovania". Značka je definovaná voči kvadratickej euklidovskej odchýlke medzi akciami oboch politík s prahom tau a klasifikátor je vybavený binárnou cross-entropiou. V čase behu rozhoduje za stav, či sa učiteľ stále pohybuje alebo preberá referencia. Abstrakt uvádza menej referenčných dopytov v simulátore pretekov áut plus zrýchlenie rýchlosti konvergencie, ktoré autori pripisujú efektu automatického učebného plánu bez uvedenia čísla pre nijaký.
Problém je v definícii, nie vo výsledkoch. Trénovanie klasifikátora vyžaduje akciu referenčnej politiky v každom stave použitom na jej vybavenie, čo predpokladá, že referencia je iný program. Ak je vaša referencia osoba s ramenom vodcu, táto sada značiek nie je lacná a metóda strácajú vlastnosť, ktorá bola navrhnutá pre.
EnsembleDAgger: pochybnosti a nesúlad, oboje
Menda, Driggs-Campbell a Kochenderfer (2019) považujú bránu za pravdepodobnostnú otázku. EnsembleDAgger "aproximuje Gaussov proces pomocou ensemblu neurónových sietí" a číta rozptyl ensemblu ako proxy zabezpečenia: vysoký rozptyl znamená región na rozdiel od trénovacích údajov, čo — za predpokladu, že expert sa vyhýba stavom zlyhania — koreluje s blízkosťou zlyhania. Pravidlo je spojenie. Učiteľ môže pôsobiť iba vtedy, keď euklidovská vzdialenosť L2 medzi jeho priemernou akciou a akciou experta zostane pod jednou prahom (nesúlad) a rozptyl svojej predpovedanej akcie zostane pod druhou (pochybnosť). Ak niektorý zlyhá, expert prevezme kontrolu. Cieľom je maximalizovať podiel akcií učiteľa pri zväčšovaní pravdepodobnosti zlyhania; papier uvádza zlepšenú bezpečnosť a učenie proti iným variantom DAgger na prevráteného kyvadla a MuJoCo HalfCheetah.
Toto ticho diskvalifikuje úplné pravidlo na dohľad bez zásahu. Vzdialenosť medzi akciou učiteľa a akciou experta vyžaduje akciu experta v tom stave, v tom momente. So skriptovaným expertom, v poriadku. S ľudským, musí ľudský nepretržite produkovať akcie — presne ten problém, ktorý mali na mysli gated varianty. Termín pochybnosti sám je bez zásahu; spojenie nie je.
LazyDAgger: zastaviť prepínač od chvenia
Hoque a kolegovia (2021) zaútočili na náklady, ktoré starší papiere neuvádzali: sám prepínač. Každá intervencia "prerušuje inú prácu, ktorú ľudský vykonáva, znáša latenciu pri každom prepínnutí kontextu medzi supervízorom a autonómnou kontrolou a vyžaduje čas na vykonanie". Brána, ktorá sa otvára a zatvára desať krát za minútu, je horšia ako ten, ktorý sa otvorí raz na desať sekúnd, s rovnakým autonómnym podielom. LazyDAgger rozširuje SafeDAgger asymetrickými prahmi — ťažšie vstúpiť na supervízorsku kontrolu ako v nej zostať — aby sa systém neosciloval na hranici. V simulácii to "môže znížiť prepínania kontextu v priemere o 60 % nad SafeDAgger na 3 úlohách nepretržitej kontroly pri zachovaní najmodernejšieho výkonu politiky"; v manipulácii textílií s ABB YuMi to "znižuje prepínania kontextu o 60 % pri dosahovaní 60 % vyššej úspešnosti ako SafeDAgger v čase vykonávania".
ThriftyDAgger: novosť alebo riziko, pod rozpočtom
ThriftyDAgger (Hoque et al., CoRL 2021) začína rozpočtom supervízora namiesto politiky. Používa "naučenú prepínaciu politiku na požiadanie o intervencie iba v stavoch, ktoré sú dostatočne (1) nové, kde robotická politika nemá referenčné chovanie na napodobňovanie, alebo (2) riskantné, kde robot má nízku dôveru v dokončenie úlohy", s novým metrikom na odhad tohto rizika. Rozpočet je vstup, nie výstup: uviedete, koľko ľudského času strávite. Aplikované v čase vykonávania metóda "dosahuje 100 % úspešnosť na simulácii aj fyzických úlohách" a štúdia s desiatimi účastníkmi kontrolujúcimi flotilu troch robotov vedľa úlohy koncentrácie uvádza, že to "zvyšuje ľudský a robotický výkon o 58 % a 80 % resp. v porovnaní s najlepším ďalším algoritmom, zatiaľ čo znižuje záťaž supervízora". Nastavenie flotily je prirodzený dom pre túto prácu; Fleet-DAgger neskôr formalizoval interaktívne učenie flotily s viacerými robotmi a supervízormi a navrhol Return on Human Effort ako množstvo na optimalizáciu.
HG-DAgger: ľudský drží bránu
Kelly et al. (2019) idú druhou cestou. Neexistuje žiadna prepínaná politika. Učiteľ je rozvinutý "kým expert nepozoruje, že nováčik vstúpil do nebezpečného regiónu stavového priestoru", v tom momente expert prevezme kontrolu a vedie systém späť. Pravidlo agregácie je prísna časť: "Značky akcií experta sa zbierajú a pridávajú do dataset iba počas týchto obnovovacích trajektórií, počas ktorých mal ľudský expert neprerušovanú kontrolu nad systémom." Nič sa neoznačuje, zatiaľ čo je ľudský divák.
Nezastaví sa pri prepínači. HG-DAgger tiež "naučí sa bezpečnostný prah pre model-uncertainty-based risk metric, ktorý sa dá použiť na predpovedanie výkonu plne tréneného nováčika v rôznych regiónoch stavového priestoru": zaznamenáva, ako neistý bol učiteľ v momentoch, keď ľudský zasiahnul a spriemerouje poslednú štvrtinu týchto záznamov, kde sa učiteľ najviac podobá svojej konečnej forme. To nie je brána, ktorú robot ovláda, ale diagnostika hovoriaca, kde sa očakáva, že skončená politika drží. Vyhodnotenie pokrýva simulovanú a reálnu jazdnú úlohu a uvádza zlepšený výkon voči DAgger aj behavior cloning.
Jedna súvisiaca línia mení to, čo sa počíta ako značka. Expert Intervention Learning od Spencera a kolegov tvrdí, že "akákoľvek spätná väzba od experta, či už intervenciu alebo ne-intervenciu, poskytuje informácie o kvalite súčasného stavu, optimalnosti akcie alebo oboje", formalizované ako objednávka na funkcii hodnoty učiteľa a vyriešené učením bez veľkej len online. Pod týmto čítaním sú úseky, kde ľudský sledoval a neurobil nič, slabé kladné dôkazy spíše ako prázdne. EIL sa naučí vyhýbanie sa zrážkam asi jednu minútu odborného riadenia.

Varianty vedľa seba
| Metóda | Kto otvára bránu | Signál | Potrebuje dostupné | Ohlásené |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Nikto — učiteľ vždy jazdí | Žiadny; expert označuje všetky navštívené stavy | Expert schopný označiť mimo-politikou stavy bez toho, aby mal kontrolu | Žiadna-veľká redukcia so zárukami podľa stavovej distribúcie učiteľa |
| HG-DAgger (Kelly et al., 2019) | Ľudský supervízor | Supervízor rozhodnutie, že stav je nebezpečný | Niekto sledujúci a čistý prevod kontroly | Porazí DAgger a behavior cloning na simulovanej aj reálnej jazdnej úlohe; tiež sa učí bezpečnostný prah |
| SafeDAgger (Zhang & Cho, 2016) | Robot | Binárny klasifikátor na L2 odchýlku od referenčnej nad tau | Dotazovateľná referenčná politika pre značky klasifikátora | Menej referenčných dopytov v simulátore pretekov, rýchlejšia konvergencia (žiadne číslo dané) |
| EnsembleDAgger (Menda et al., 2019) | Robot | Ensemble rozptyl a vzdialenosť od akcie experta, oboje pod prahom | Ensemble sietí plus akcia experta v každom kroku | Zlepšená bezpečnosť a učenie na kyvadla a HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Robot, s hysteréziou | Signál SafeDAgger so samostatnými vstupnými a výstupnými prahmi | Čo potrebuje SafeDAgger, plus druhý prah na ladenie | ~60 % menej prepínania kontextu na 3 úlohách; 60 % vyššia úspešnosť na YuMi textílie |
| ThriftyDAgger (Hoque et al., 2021) | Robot, pod rozpočtom | Novosť alebo odhadnuté riziko nedokončenia úlohy | Naučený odhad rizika a uvedený rozpočet intervencie | 100 % úspešnosť v čase vykonávania; štúdia používateľa (N=10): 58 % a 80 % zisk nad najlepším |
| EIL (Spencer et al., 2020) | Ľudský — ne-intervencia sa počíta aj | Intervencia a jej chýbanie ako objednávky na funkciu hodnoty | Online bez veľkej učenie sa nad objednávkou hodnôt | Vyhýbanie sa zrážkam z asi jednej minúty odborného riadenia |
Čo každá brána kúpi a čo to stojí
Čítajte nadol stĺpcom "potreby" a vzor vypadá: každý robot-gated signál tam je proxy, ktoré sa musí vyrábať, a každý proxy má svoju vlastnú faktúru.
- Signály nesúladu (SafeDAgger, LazyDAgger, polovica pravidla EnsembleDAgger) potrebujú referenčnú politiku. Buď máte skriptovaného experta, v ktorom prípade je zaujímavý problém už vyriešený, alebo ľudský nepretržite produkuje akcie na pozadí, aby sa mohla vypočítať vzdialenosť.
- Signály pochybnosti potrebujú kalibrovanú epistemickú neistotu. Ensemble malých kontrolných sietí ju aproximuje; ensemble trojmiliardového modelu vision-language-action je problém pamäte a latencii najskôr.
- Signály novosti a rizika potrebujú naučený odhad dokončenia úlohy, vybavený na dosť úspešných a neúspešných rolloutov. Na úlohe, ktorú stále pracujete, tieto údaje v prvom kole neexistujú.
- Ľudská brána potrebuje pozornosť a nič iné — jediný dostupný signál na deň jeden, na anej politike, bez extra modelu na trénovanie.
- Žiadna robotická brána neodstraňuje ľudskú z miestnosti. Redukujú, ako často musí ľudský pôsobiť, nie či majú byť prítomní.
V tom je tichšej rozdiel, aká brána produkuje. Robotická brána strieľa v strede trajektórie rukou osoby pohybujúceho sa ramena v ľubovoľnej póze. Ľudská brána nechá operátora vybrať si moment — po dosahu, pred úchopom, nie v strede švingu. Obnovovacie segmenty z oboch nie sú rovnako čisté a tieto segmenty sú celý produkt kola.
Prečo forma ľudských brán vyhráva na skutočnom hardvéri
Toto je inžinierskym argumentom, nie benchmarkom výsledok — žiadny papier, ktorý sme našli, nespúšťa všetky päť brán na rovnakom manipulátore s rovnakou politikou. Spočívá na štyroch bodoch.
Najprv je supervízor tam tak ako tak. Nikto nechá SO-100 rameno bežať bez dozoru vedľa predmetov, ktoré môže zhodiť. Keď niekto sleduje, medzný náklad, aby som im dal tlačidlo prevzatia, je blízko nule; budovanie kalibrovaného odhadu rizika je projekt.
Po druhé, neistota, ktorú si môžete skutočne zmerať na modernej politike, je často nesprávne množstvo. Difúzna alebo flow-matching hlava produkuje rozptyl v rámci vzorkovaných čunkov akcií a tento rozptyl odráža multimodalitu, ktorú bola hlava trénovaná na reprezentáciu, nie epistemická ignorancia o stave. EnsembleDAgger pochybnosti termín používa ensemble presne na jeho zachytenie. Tieto dva vyzerajú ako rovnaké číslo a nie sú; action chunking a flow matching položky pokrývajú, ako tie hlavy emitujú akcie na prvom mieste.
Po tretie, zlyhania, ktoré na manipulácii záleží, sú často sémantické, nie štatisticky neobvyklé. Politika zatvára grip dva centimetre skoro, alebo dosahuje s istotou na nesprávnemu z dvoch identických kociek, nie je vo vysokej variačnom stave — je si istý a nesprávny. Žiadny rozptylový prah to chytiť; osoba sledujúca to chytiť hneď.
Po štvr-tretie, kvalita značiek — pôvodný HG-DAgger bod a ten najčastejšie vynechaný. Značky zbierané, zatiaľ čo ľudský má neprerušovanú kontrolu, porážajú značky narrované na pohybujúcom sa systéme. Ak je cieľom opravy údajov, ktorý stojí za to, aby sa agregoval, dôkaz leží s automatickou bránou.
Obrázok sa otáča, keď jeden supervízor je zodpovedný za mnohých robotov — režim ThriftyDAgger štúdia používateľa a Fleet-DAgger formalizácia cieľa. S flotilou, ľudská pozornosť je vzácny zdroj a nedokonalá alokácia porazí žiadny. S jedným ramenom na jednom stole nie ste v tom režime.
Ľudským-gated slučka, už drotená
Prebratie počas bežiaceho inferenčného relácie, za-rámec intervencia vlajky na opraveném segmentoch, kurátorstvo každého beh do opravy alebo vyhodnotenie, skladanie zmiešaného dataset z zdrojov si vyberiete a pokračovanie učenie z existujúceho bodu sú vybudované v skôr ako napísané rukou. Prebratie funguje s vodným ramenom alebo s klávesnicou a posúvačmi, ak jeden nemáte.
Vidieť, ako DAgger slučka bežíBrána je polovicou metódy; manipulácia s údajmi je druhou polovicou
Brána rozhoduje, ktoré rámce ľudský jazdil, nie čo s nimi urobiť, a to druhé rozhodnutie je miesto, kde sa kolá najčastejšie strácajú. Prvé pravidlo je ten, D v DAgger stojí za: agregujú, nenahraďujú. Fine-tuning checkpoint čisto na pár stoviek opravy rámcov vám dá model, ktorý videl takmer nič, ale zotavy a zabudol nominálnu trajektóriu.
Druhé pravidlo je, že intervencia rámce nie sú bežné rámce. Mandlekar et al. postavil diaľkové teleoperačnom systéme pre 6-DoF manipulácii nechať operátorom monitorovať politiky a prevziať na zlyhanie, potom trénovaní iterativne s algoritmom, ktorý "povzbudzuje politike sa naučiť, ako sa dostať cez úzké miesta cez intervencie"; agenti trénovaní na tieto údaje, prešť agentov trénovaných na rovnaký počet bežných ukážok. Sirius tlačí myšlienku do nasadenia, "re-vážené tréninku vzorky s aproximovanou ľudskej dôvere a optimalizácia politiky s vážených správať sa kloning". Oba potrebu za-rámec značka čo bolo ľudským jazdil, ktorý je prečo intervencia vlajka má väčší dôležitosť ako to vyzerá.Tretie pravidlo je, že automatické zmiešavanie je pasť. Zložený dataset, ktorého zdrojom si nemôžete vymenovať je ten, ktorý si nemôžete ladiť, keď ďalšie kolo sa zhorší. Na tejto platforme krok zloženia je explicitný z toho dôvodu — pôvodný dataset plus opravy, episódna výber za zdroj a výsledok je bežný LeRobot dataset
ktorý synchronizuje a trénuje ako iný; dataset dokumentácia pokrýva stranu formátu.Krok v koleČo to produkuje
| Najbežnejší spôsob, ako sa to pokazí | Spustiť inferenciu s záznamom | Beh pod vlastnou distribúciou stavov politiky |
|---|---|---|
| Zaznamenaný ako bežný teleoperation, stratil, že politika bola riadená | Prevziať pri zlyhaniu | Opravy segmenty s za-rámec intervencia vlajka |
| Opravovanie kozmetického kolísania, výučba štýl skôr ako zotavenie | Kurátorstvo každý episódy | Opravy, vyhodnotenie alebo zahodenia |
| Uchovávanie všetkého; pokazená prebratie náklady viac ako episódou bol stojí | Synchronizácia opravn | Verzovaný dataset vedľa pôvodného |
| Opravy, ktoré nikdy neopúšťajú lokálny stroj | Zloženie zmiešaného dataset | Pôvodný plus opravy, explicitný výber |
| Tiché auto-zmiešavanie, takže neskôr regresiu nemôže sa sledovať na zdroj | Pokračovanie z bodu | Bod inicializovaný z predchádzajúceho |
| Očakávajúci optimizer obnovenie; vážení inicializujú model, oni neobnovujú optimizer stav | Nastavenie brány osoba skutočne drží | "Ľudský rozhoduje" nie je špecifikácia. Dvaja operátor s iný prahy produkovať neporovnateľný kolá a driftovanie prah produkuje trend si nemôžete čítať. Napísať spúšť nadol pred prvého behu. |
Názov podmienok, ktoré otvoria bránu — priblížiť sa vypnutý o viac ako pevný maržu, gripiera zatváraní na nič, kĺb drifting smerom k limit, zaseknutie viaceré sekundy — a ponechať zoznam bez zmeny pre kolo.
Názov čo neotvor to. Přestřelit politikou sa zotavuje z na sebe je tréninku signál; preberaní tam vymaže zotavenie to už vie.
- Prevziať dosť skoro na čisté handover, ruku spät ako len po stav je možný obnoviť.
- Prihlásiť si prečo si vyrieši nad, za episódy. Tri kolá neskôr to je jediný záznam či rovnaký chyba vracia.
- Udržiavajte kamery, text úlohy a operátor konštantnú cez kolá. Zmena jeden a čísla prestať byť porovnateľný.
- Mechanicky handover má dva varianty. S vodným ramenom, vodca musí dosiahnuť nasledovateľ je súčasná póza pred točiť prenosy, či rameno skáče; táto zarovnanie sa pohybovať je najmenej-testovaný časť reťaze na skutočném hardware. Bez vodného ramena prebratie je ručné z prvého stlačenia: nasledovateľ drží a operátor nudges to kĺb po kĺbe z klávesnice alebo ťahy posúvače, s serverom boku svorne každý vstup malý — pár stupňov za kľúč, hľava za posúvač update, pretože veľký krok do držal póza je ako si preskúšiť servo. Krok-o-krok verzia s klávesy zväzky je v
- návod DAgger kolo na SO-100
; pozadie na oboch teleoperačnom režimoch je v teleoperačnom dokumentácia a vodca-nasledovateľ položka.Porovnanie podporovaných politiky architektúra s ich tréninku a inferencie charakteristikyBrána je architektura-agnostický. Ktoré politiky si opraviť zmeny tréninku nákladu kolo, nie ako prebranie funguje.

Je to sklon metrika a malo by ste vedieť ako. To meria operátor prah ako veľa politikou kompetencia, ktorý je prečo spúšť zoznam zostáva pevný; operátor ktoré relaxy cez relácie produkuje padajúci krivka s nič za ním. To tiež ignoruje vážnosť — desať rámce zastaviť zrážku a desať nudge grasp vyzerajú identické. Pár to s pevný vyhodnotenie súbor nie oprava údajov bol nikdy čerpané z.
Článok na meranie DAgger slučka
funguje cez vyhodnotenie dizajn, vrátane ako si udržiavajú vyhodnotenie episódne bez tréninku zmiešavanie.Ľudská brána, úprimneČo vám dáva
- Produkuje opravy zaznamenaný zatiaľ čo operátor mal plnou kontrolu, v momente si vyberiete
- Výnosy za-rámec značka, že intervencia-vážení metódy, akože IWR a Sirius konzumujú
- Náklady nepretržitá dohľad; to nie je kváskála na jeden osoba a mnohých robotov
- Závisí od operátor konzistencia — driftovanie prah korumpuje intervencia sadzba
- Produkuje žádný rizika model na sebe; HG-DAgger je naučenému prah a ThriftyDAgger je odhad sú extra strojovňa
- Počíta rámce, nie následky
- Nemôže zachrániť politikou ktorých zlyhanie je upstream kontrola, ako kamera vymenené alebo mislabeled úloha reťazce
- Otvorená otázka vhodné udržiavajúce v pohľad
- Benchmark sú slabé. Spencer a kolegovia skúmali tých používa test napodobňovanie učenie prístupy a našli ich "realizovateľný a jednoduché a tak nedostatočný pre chytanie ťažšie režimov chyba zložitosti vidiť v reálnom svete rozhodovanie problemy" — a, proti okolitému literatúra, našli bežný správať sa kloning urobili dobre na nich. To je dôvod na byť skeptickej akýchkoľvek poradí DAgger varianty spočívajúci na tieto úlohy, vrátane niektorých čísla v tabuľka vyššie.
Robot brány na veľké politiky nie sú vyriešené buď. AIM práca nahradzuje neistota s proxy Q-function napodobňovanie ľudskej intervencie pravidlo a hlási 40 % zlepšenie v take-over nákladu a učenie účinnosť nad ThriftyDAgger — v nepretržité a diskrétne kontrola, nie na modeli vision-language-action riadenie manipulátor. Či nejaký z týchto brány prenesie na jemne-ladené VLA je otvorený. Prieskum robí súvisiaci bod: terén terminológie a štruktúra nie sú jednotný cez literatúry, čo vynecháva metódy ťažko porovnávať. Na svoj vlastný ramenom, vaše protokoly sú dôkazy máte.
Je HG-DAgger skutočne DAgger ak ľudský značky len počas intervencie?
To udržiava časť, ktorá záleží — údajov zbierané pod stavovej distribúcie učiteľ indukuje agregovaný s tým, čo prišli pred — a klesá časť, ktorá neprevádzajú kontakt s hardvérom. Kelly et al. prezentovať to ako variant; 2011 bez žiadnej regret záruka nenosí cez bez zmeny.
Mohu použiť robot brána na jemne-ladené VLA politikou na SO-100?▾
Nie priamo. SafeDAgger je klasifikátor potrebuje dotazovateľný referenčný politike si nemáte. EnsembleDAgger potreby ensemble, ktorý pre multi-miliardový model znamená viaceré kópie v pamäť plus ich inferencie nákladu. ThriftyDAgger potreby rizika odhad vhodný na uspechov a zlyhaní, ktorí neexistuje pred vaší prvého kolá.
Ako dlho by mali jedného prevzatia byť?▾
Dosť dlho na dosiahnuť stav politike mohly pokračovať z, a nie viac: rozšírené prevzatia zmeny behu do ukážky relácie a záplava opravy set s nominálne správania. LazyDAgger je nález rezov iný spôsob príliš — veľa veľmi krátke prepínače sú ich vlastný nákladu.
Mám som trénovať len na opravené segmenty?▾
Nie — to je najbežnejší spôsob, ako stratiť kolo. Model jemne-ladené len na obnovy videl takmer nič, ale obnovy. Zmiešiť opravy do pôvodného dataset s zdrojami vybrane explicitne; ísť ďalej, hľadať intervencia-vážení prístupy, ako IWR alebo Sirius, ktoré up-váženie ľudský-jazdia rámce skôr ako izolujú ich.
Čo ak intervencia sadzba nepadajú po kolo?▾
Vezmite to na tvár hodnotu: kolo neurobilo pomôcť. Pred pridaním opravy, skontrolujte lacnejší vysvetlenia — bol operátor je prah drift, boli opravy kozmetické, bol zložené dataset skutočne obsahovať ich, bol tréninku inicializovaný z určená bod. Kolo, ktoré ticho začal z základný model vyzerajú presne tak isté ako kolo, ktoré zlyhalo učenie.
Je non-intervencia prenášať informácie?▾
Podľa Expert Intervention Learning, áno: úseky kde supervízor sledoval a neurobil vyloženej sú čítaní ako slabé dôkazy, že stav a akcia boli prijateľný, formalizované ako objednávka na funkciu hodnoty. Väčšina praktické potrubia, vrátane tohto jeden, značka len čo ľudský jazdí.
Pre jedného ramenom na stole voľba je urobené: drží bránu sa, napísať nadol, čo otvára to, a strávate úsilie na údajových manipulácii za ním spíše ako na automatizácia prepínač. Platformy stranu je popísaný na ▾
DAgger slučka stránka
, tréninku možnosti za politiky rodina pod tréninku a ceny. Za pozadie, začínať s napodobňovanie učenie a napodobňovanie učenie na SO-100; pre prvý beh, spustite váš prvý politikou je kratšia cesta.spustite váš prvý politiku je kratšia cesta.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started