Abstraktné znázornenie scény manipulácie robota, ilustrujúce rozdelenie stavov, ktoré navštívi naučená politika počas vykonávania
DAggerImitation LearningBehavior CloningUčenie sa robotaTeória

DAgger Vysvetlený: Prečo sa Behavior Cloning drifuje a čo Dataset Aggregation vlastne dokazuje

AY-Robots ResearchAugust 27, 202615 min čítania

Behavior cloning prispôsobuje politiku distribúcii stavov experta a potom sa nasadí sama. Medzera medzi týmito dvoma distribúciami je dôvod, prečo sa politika, ktorá vyzerá dobre pri validácii, v kroku 300 padne zo stola. Toto je teoretická kapitola našej série DAgger: odkiaľ pochádza kvadratický člen chyby, čo zmení agregácia množín údajov, čo predpokladá dôkaz bez ľútosti a ktorá časť účtu musí stále hradeť ľudský expert.

Existuje špecifické zlyhanie, s ktorým sa stretne každý, kto tréni politiku manipulácie skôr či neskôr. Politika siaha po kocke, dostane sa do vzdialenosti dvoch centimetrov, váha, driftuje nabok a potom robí niečo nesúvisiace s úlohou. Validačná strata bola v poriadku. Open-loop opakovanie voči zadržovaným epizódam bolo v poriadku. A predsa je rameno v polohe, ktorá sa nikde v tréningových údajoch neobjavuje, a odtiaľ nemá nič zmysluplného povedať.

Toto zlyhanie má názov a ustálenú teoretickú časť za sebou. Toto je prvý zo štyroch článkov o DAgger, a pokrýva samotný argument: prečo prispôsobenie politiky vlastným trajektóriám demonštranta vytvára chybu, ktorá môže rásť so štvorcom dĺžky epizódy, čo zmení agregácia množín údajov a čo záruky bez ľútosti neslubujú. Slučka na reálnom hardvéri sa vzťahuje na spustenie DAgger slučky na SO-100, variant s bránením ľuďmi v HG-DAgger a intervenciách s bránením ľuďmi, a otázka merania v meranie DAgger slučky.

Krátka verzia

  • Behavior cloning tréňuje na distribúcii stavov experta a je hodnotená na vlastnej politike. Nesúlad sa v priebehu epizódy hromadí.
  • Ross a Bagnell ukázali, že dodatočný náklad môže rásť ako T na druhú krát chyba za krok; papier DAgger túto hranicu preformuluje a poznamenáva, že je tesná.
  • DAgger označuje stavy, ktoré sama navštívi politika, a pretrénuje sa na každej dosiaľ zhromaždenom množine údajov, nie len tú najnovšiu.
  • Záruka je redukcia na no-regret online learning: agregácia a pretrénenie je Follow-The-Leader.
  • Vzťahuje sa na najlepšiu stratu dosiahnutú v triede politiky, nie na nulu - a expert stále musí označovať stavy, ktoré by nikdy neproduková.

Predpoklad, ktorý behavior cloning potichu robí

Demonštračná množina údajov je hromada párov pozorovania a akcií. Behavior cloning prispôsobuje funkciu tejto hromade bežným supervízeným učením a zastaví sa tam. Toto je najstaršia myšlienka v tejto oblasti. Pomerleau ALVINN v roku 1988 bola trojvrstvová sieť spätného šírenia, ktorá brala obrázky z kamery a laserového distančného zistenia a vytvárala smer, ktorým by sa vozidlo malo pohybovať; bola trénovaná na simulovaných cestných obrázkoch a nasledovala skutočné cesty v niektorých terénnych podmienkach. Recept sa veľa nezmenil; siete áno.

Čo sa vynechá, je kontrola toho, odkiaľ tieto páry pochádzajú. Každý z nich leží na trajektórii, ktorú vyprodukoval demonštrant. Politika, ktorú nasadíte, vytvára vlastnú. Keď sa odchýli, je sa pýta na stavy, ktoré neboli v distribúcii tréningen, a jej odpoveď ju presúva ďalej von. Ross, Gordon a Bagnell otvoria papier DAgger práve s tým: sekvenčná predikcia porušuje predpoklad i.i.d. podľa štatistického učenia, pretože vlastné predpovede učiaceho sa určujú vstupy, ktoré vidí ďalej.

Najjasnejšou ilustráciou v tomto papieri nie je robot vôbec. Klonovaním takmer optimálneho plánovača pre Super Mario Bros. sa vytvorila politika, ktorá sa opakovane zasekla proti prekážke namiesto jej preskočenia. Dôvod je celý argument v jednej vete: expert vždy skočil z komfortnej vzdialenosti, takže množina údajov neobsahovala žiadny stav, v ktorom by bol Mario pritlačený proti prekážke, a preto žiadny štítok, čo robiť, keď tam bol.

Vymeň Mario za SO-100 arm a štruktúra je totožná. Vaše demonštrácie ukazujú čisté priblíženie a čisté schopnosti chytávania, nie záver gripper o dva centimetre chýbajúci - takže politika nevie, čo robiť odtiaľ, a čo som hádal, vás presúva ďalej von. Covariate shift je vlastnosť postup zhromaždzovania údajov, nie architektúru siete.

Odkiaľ pochádza kvadratický člen

Papier 2010 AISTATS od Rossa a Bagnella, Efficient Reductions for Imitation Learning, robí hromadenie presným. Nech T je horizont úlohy, nech je cena úlohy ohraničená v jednotkovom intervale a nech epsilon je náhradná strata meraná pod expert distribúcia stavov - počet, ktorý hlási vaša validačná množina. Potom dodatočný náklad na spustenie tejto politiky počas T krokov, v porovnaní s expertom, je ohraničený T na druhú krát epsilon. Ross, Gordon a Bagnell to preformulujú ako Vetu 2.1 v papieri DAgger a pridajú vetu, ktorá záleží: hranica je tesná. Existujú problémy, kde politika s epsilon stratou pri distribúcii experta naozaj vynakladá dodatočné náklady rastúce kvadraticky v T.

Tesný neznamená typický. Kvadratický člen je najhorší prípad v triede problémov, nie predikcia o vašej úlohe vyhľadávania a umiestnenia. Čo to etabluje, je, že viac odborných demonštácií nemôže odstrániť problém: iba zacieľuje odhad epsilon na distribúcii, na ktorej politika nebude testovaná.

Trasa úniku je v rovnakom papieri, preformulovaná ako Veta 2.2. Ak politika dosahuje stratu epsilon pod svojou vlastnou distribúcii stavov a jedna zlá akcia stojí maximálne u v cene do budúcnosti pod expertom, dodatočný náklad je ohraničený u krát T krát epsilon - lineárne v horizonte. Konštanta u je zaujímavá veličina: maximálne 1 pre 0-1 nezhodu s expertom a O(1) kedykoľvek môže expert obnuviť v priebehu niekoľkých krokov. V najhoršom prípade je O(T) a lineárna hranica nie je potom lepšia ako kvadratická.

NastavenieViaziť na dodatočné náklady nad expertomNa čom to spočíva
Behavior cloning (Ross & Bagnell 2010, preformulované ako Thm. 2.1 v Ross et al. 2011)T na druhú krát epsilonepsilon meraný pri distribúcii stavov experta; cena v [0,1]; hranica je tesná
Akákoľvek politika s epsilon stratou pod svojou vlastnou distribúciou (Thm. 2.2)u krát T krát epsilonu viaza penalizáciu ceny do budúcnosti jednej zlej akcie; maximálne 1 pre 0-1 stratu, O(T) najhorší prípad
Prednedostupné tréňovanie (Ross & Bagnell 2010)u krát T krát epsilonjedna politika za časový krok; potrebuje T politík a známy, konečný T
SMILe (Ross & Bagnell 2010)blízko lineárne v T a epsilon na niektorých triedach problémovalpha v O(1/T na druhú), N v O(T na druhú log T); výťažok stochastickej zmesi
DAgger (Thm. 3.2, Ross et al. 2011)u krát T krát epsilon_N, plus O(1)N v poriadku uT; silne konvexná ohraničená strata; no-regret learner; epsilon_N je najlepšia strata spätne pohľadom
Pracovný priestor robota predstavujúci stavy, ktoré politika navštívi a nikdy sa neobjavili v súbore demonštrácie
Stavy, ktoré záleží na DAgger kole, sú tie, ktoré nikto nedeklaroval: takmer zmeškaný úchop, polovične otvorený gripper, rameno mimo objektu.

Dva pokusy, ktoré viedli DAgger

Prednedostupné tréňovanie je čestná, ale nepraktická odpoveď. Natrénujte oddelnú politiku pre každý časový krok, v poradí, každá v distribúcii stavov vyvolanej politikami už fixovanými pre predchádzajúce kroky, takže každá politika vidí presne distribúciu, ktorej bude čeliť. Chytenie je v popise: T politík, trénovaných postupne, bez skorého zastavenia. Pri manipulácii epizódou pri 30 snímkach za sekundu je T stovkami.

SMILe, z rovnakého papiera, a SEARN, z práce Daumea, Langforda a Marcua o štruktúrovanej predikcii, idú druhou cestou: jedna stacionárna politika, ale stochastická. Každá iterácia trénuje komponent a pridáva ho do zmesi, posúva hmotnosť pravdepodobnosti preč od experta. Výsledkom je zmes, v ktorej sú niektoré komponenty horšie ako iné - na fyzickom ramene, kontrolér, ktorý môže počas pohybu vzorkovať zlý komponent. To je uvedená motivácia na požiadavku stacionárneho deterministic politika namiesto.

DAgger: jedna myšlienka, jedna krabica

Dataset Aggregation udržuje deterministickú politiku a presúva opravu do zhromaždzovania údajov. Každé kolo: spustiť aktuálnu politiku, zaznamenať navštívené stavy, opýtať sa experta, čo by bola správna akcia v každom, pridať tieto páry k množine údajov, ktorú ste už mali, pretrénať na zjednotení. Názov je algoritmus - agregujete, nikdy nemiete.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
Meta-algoritmus DAgger, Algoritmus 3.1 od Rossa, Gordona a Bagnella (2011).

Tri podrobnosti majú väčší význam, ako vyzerajú. Štítky sú pre stavy navštívené zmiešanou politikou, ale akcie pochádzajú od experta - politika poskytuje otázky, expert odpovede. Pretrénenie je na celom agregáte, čo robí každé kolo krokom Follow-The-Leader: v kole n si vyberiete najlepšiu politiku spätne pohľadom nad každou dosiahnutou trajektóriou. Tento rámec je to, na čom záruky visia. A algoritmus končí vrátením najlepšej politiky v sekvencii, ako je zvolená na validačnej množine, pretože teorémy zaradzujú nejaký politika v sekvencii je dobrá, nie že posledná je.

Beta plán a prečo to nie je ladiaci gombik

Zmiešaná politika je beta_i krát expert plus jeden mínus beta_i krát učiak. Bod je praktický: prvé niekoľko naučených politík je trénovaných na veľmi málo údajov, robia veľa chýb a inak by strávili rollout v stavoch, ktoré sa stanú irelevantní, keď sa politika zlepší.

Teória ukladá presne jednu podmienku: priebežný priemer biet musí ísť na nulu. Analýza funguje s beta_i ohraničeným (1 - alfa) na mocninu i-1, pre konštantu alfa nezávislú od T.

PlánČo to robíČo papier hlási
beta_1 = 1Prvé kolo je čistá experta demonštrácia; nevyžaduje sa počiatočná politikaOdporúčaný počiatočný bod v každom variante
beta_i = 1 ak i = 1, inak 0Expert len v prvom kole; bez voľného parametraBesprávna verzia papiera, ktorá hovorí, že často dosahuje najlepšie výsledky v praxi; 2980 na Super Mario Bros. po 20 iteráciách
beta_i = p^(i-1) s p = 0.5Pravdepodobnosť experta sa zmenšuje geometricky3030 na rovnakom benchmarku, mierne pred bezparametrickou verziou
beta_i = p^(i-1) s p = 0.9Expert zostáva v slučke oveľa dlhšieMarkantne pomalšia konvergencia; stále sa zlepšuje, keď skončilo 20 iterácií

Medzera medzi 2980 a 3030 na mierke vedúcej na zhruba 4300 je malá, ale vysvetlenie papiera je najužitočnejšia praktická poznámka v sekcii. S bezparametrickou plánovaním sa Mario zasekol na rovnakom mieste skoro a vygeneroval hromadu takmer duplikátnych údajov z tohto jediného miesta; nechanie experta jazdiť zlomok času tým, že sa oslobodil a rozšírili varietu stavov. Plán je menej o zmiešavacom pomere ako o tom, či vaše zhromažďovanie údajov naďalej produkuje nové stavy alebo rovnaké zlyhanie.

Prečo sa plán neprekladá na fyzické rameno tak, ako je napísané

Stochastická zmesž za časový krok znamená prepínanie autority riadenia na rýchlosti riadenia, 30-krát za sekundu na typickom SO-100 nastavení. Žiadne teleoperačné rozhranie to nezaistí bezpečne alebo zmysluplne. Na reálnom hardvéri beta plán ustúpi ľudskému rozhodnutiu o tom, kedy prevziať: iný algoritmus s inou analýzou.

Záruka: redukcia na no-regret online learning

Tu je krok, ktorý robí papier tým, čo je. Zaobchádzajte s každým DAgger kolom ako s jedným príkladom v probléme online učenia, kde je strata v kole i náhradná strata pod distribúciou stavov politiky použitej v kole i. Učiak sa zaviazal politike pred videním tejto straty, a sekvencia je nestacionárna, pretože závisí od doposiaľ vytvorených politík.

Algoritmus nemá ľútosť, ak sa jeho priemerná strata počas N kôl priblíži tej z najlepšej jednotlivej politiky spätne pohľadom. Follow-The-Leader na silne konvexných stratách je taký algoritmus, s priemerným ľútosťou zmenšujúcou sa v poriadku 1/N - a pretrénenie na úplnom agregáte je presne Follow-The-Leader. Akýkoľvek iný no-regret learner by slúžil rovnako dobre: analýza je redukcia, nie vlastnosť jedného optimizéra.

Jedno lema premosťuje priepasť medzi zmiešanou politikou, ktorá zhromaždila údaje, a naučenou politikou, ktorá bude nasadená: Lema 4.1 viazí L1 vzdialenosť medzi ich distribúciami stavov 2 T beta_i. Toto je dôvod, prečo musia biety ubúdať - zatiaľ čo expert stále drží výraznú autoritu riadenia, stavy, ktoré zhromažďujete, nie sú stavy, ktoré vaša politika bude produkovať. Kombinujte lemu s regresom viazaným a hlavný výsledok nasleduje: po zhruba T iteráciách má nejaká politika v sekvencii náhradu straty pod svojou vlastnou distribúciou v rámci O(1/T) epsilon_N. Privádzajú to do lineárnej hranice a vy sa dostanete k Vete 3.2.

Empirická strana je skromná podľa dnešných noriem. V Super Tux Kart supervízny základný plán nezvýšil svoj priemer pádov za kolo, keď prišli údaje, DAgger dosiahol politiku, ktorá nikdy neskĺzla zo stopy po pätnástich iteráciách, a SMILe po dvadsiatich stále padala približne dvakrát za kolo. Na benchmarku rukopisu bola presnosť znakov 82 percent bez štruktúry, 83,6 percenta supervízne, 85,5 percenta s DAgger. Nič z toho nie je manipulačný výsledok.

Čo dôkaz nesľubuje

Vety sú podmienené a podmienky sú zaťažujúce.

DAgger záruka, pročítaná pozorne
Čo vám to dáva
  • Lineárna hranica skôr ako kvadratická v T, za uvedených predpokladov.
  • Stacionárna deterministická politika skôr ako stochastická zmes.
  • Skutočná redukcia: akýkoľvek no-regret online learner sa umiestni.
  • Konkrétny počet iterácií - približne T kôl, kým sa člen ľútosti prestane páčiť.
  • Záruka za aspoň jednu politiku v sekvencii, odtiaľ to uzatvárací validačný priechod.
Čo vám to nedáva
  • Vzťahuje sa na epsilon_N, najlepšiu stratu v triede spätne pohľadom, nie na nulu. Ak vaša trieda nemôže reprezentovať experta, je v praxi prázdna.
  • Potrebuje no-regret metódu alebo silne konvexnú náhradnú stratu - silnejšiu ako redukcie klasifikácie, na ktorých sa buduje, ako poznamenávajú autori.
  • Konštanta u môže byť O(T) v najhoršom prípade a lineárna hranica sa potom zrúti späť na kvadratickú.
  • Viazuje iterácie, nie odborných štítkov. Na robotovi sú štítky rozpočet.
  • Predpokladá, že na experta možno sa opýtať na každom navštívenom stave a odpovedá tam správne. Tento predpoklad je celý náklad.

Jeden ďalší výsledok sa často cituje ako vyvrhnutie a nie je jedno. Rajaraman, Yang, Jiao a Ramachandran študujú minimax limity imitation learning v episodických MDP s konečným stavovým priestorom S a horizontom H a dokázali suboptimalitu dolnej hranice v poriadku |S| H na druhú cez N, ktorá je platná aj vtedy, keď sa učiak môže aktívne opýtať experta na navštívených stavoch. To je najhoršia sadzba v triede MDP pri pevnom rozpočte epizódy a čo vylučuje, je myšlienka, že interakcia zlepšuje minimax sadzbu; veta DAgger je iné vyhlásenie, viazané nasadenej politike vzťahom k tomu, čo jej vlastná trieda politiky môže dosiahnuť.

Swamy, Choudhury, Bagnell a Wu neskôr klasifikovali tieto algoritmy podľa toho, ktoré momenty správania experta sa zhodujú, a zaviedli pojem recoverability momentu, ktorý odlišuje, ako dobre každá rodina zmierňuje hromadenie chýb. Prieskumy Osy a Celemínu pokrývajú algoritmickú krajinu a rozhrania ľudskej spätnej väzby.

Účet: označovanie stavov, ktoré expert nikdy nevyprodukoval

Všetko vyššie predpokladá experta, na ktorého možno sa opýtať kdekoľvek. V simulácii s plánovačom, ktorý je skoro zadarmo - pokusy s Mariem používali takmer optimálneho plánovača s úplným prístupom k stavu hry. S ľudskou bytosťou na robotovi je to dominantný náklad a zvláštny: ľudská bytosť musí vyprodukovaní správnu akciu v konfigurácii, ktorú by jej vlastná spôsobilosť nikdy nevytvorila.

Kelly, Sidrane, Driggs-Campbell a Kochenderfer priamo uvádzajú námietku v papieri HG-DAgger. Vanilkový DAgger vyžaduje od experta dodať štítky akcií, zatiaľ čo nie je plne v kontrole systému. To znižuje bezpečnosť a s ľudskými odborníkmi je pravdepodobné, že sa zhorší kvalita zhromaždených štítkov, čo pripisujú vnímanej latentnote aktuátora. Štítok, ktorý dostanete späť, nie je štítok, ktorý algoritmus predpokladal.

Laskey a kolegovia útočia na problém z druhej strany s DART a ich námeranie je frank: on-policy techniky sú únavné pre ľudských dozorovateľov, zvyšujú výpočtovú záťaž a môžu počas tréninku navštíviť nebezpečné stavy. Ich alternatíva vstrekovuje kalibrovaný šum do vlastných demonštácií supervízora, takže regenerácia sa demonštruje bez toho, aby robot kedy spustil nedôveryhodnú politiku. Na MuJoCo Humanoid hlásia DART znižovanie kumulatívnej odmeny supervízora o 5 percent počas tréninhu, zatiaľ čo DAgger vykonáva politiky s 80 percentami nižšou kumulatívnou odmenou ako supervízor; pri chytávaní v zápase s Toyota HSR, priemerný nárast 62 percent oproti behavior cloning.

SafeDAgger od Zhanga a Choa zaobchádza so otázkami na referenčnú politiku ako s nedostatkovým zdrojom: samostatná bezpečnostná politika predpovedá, bez opýtania, či sa primárna politika chystá odchýliť od referencie za prahom, a len tie stavy sú presunuté. Všetky tri reagujú na ten istý fakt - analýza DAgger neplní nič za odborných štítkov a realita si účtuje veľa.

Časť, ktorú vám nikto nevaní

Označovanie mimo distribúcie stavov je mentálne ťažšie ako demonštrácia úlohy. Normálna demonštrácia znamená vykonávanie motorného plánu, ktorý už máte. Oprava politiky, ktorá umiestnila gripper na mieste, ktoré by ste nikdy nepoužívali, znamená vytvorenie regenerácie na mieste, pod časovým tlakom, s robotom stále pohybom. Očakávajte menej použiteľných minút za sedenie ako na bežnej relácii záznamu a sledujte, ako sa vaša vlastná kvalita opravy počas jednej znižuje.

LeRobot štruktúra množiny údajov zobrazujúca epizódy, rámce a stĺpce za rámec ako uložené na disku
Opravy sa stanú množinou údajov len vtedy, keď sú oznámené intervničné rámce - vo formáte LeRobot, stĺpec za rámec vedľa pozorovania a akcie.

Čo to znamená pre SO-100 na vašom stole

Preložte horizont do vlastných jednotiek. Dvadsať sekundová epizóda pri 30 snímkach za sekundu je 600 rozhodovacích krokov a T v každej hranici vyššie je to číslo. Pri T = 600 je rozdiel medzi termínom meranímtej s T a jedným meranímtej s T na druhú rozdielom medzi politikou, ktorá sa regeneruje z zlého priblíženia, a jednou, ktorá nie.

Toto je časť toho, prečo pomáha odseknutie akcií: keď politika emituje krátku sekvenciu akcií na krok inferencie, počet rozhodovacích bodov padne a rovnako tak počet možností na hromadenie. Zhao, Kumar, Levine a Finn pomenúvajú hromadenie chýb ako motiváciu pre Action Chunking s Transformers a hlásajú 80 až 90 percent úspešnosť na šiestich ťažkých úlohách v reálnom svete, na hardvéri dvouručného nízkeho nákladu, z desiatich minút demonštrácie. Odseknutie neodstraňuje covariate shift - stavy sú stále vlastné politiky - ale skracuje efektívny horizont. Pozri odseknutie akcií a SO-100 imitation learning guide.

Druhý preklad je metrika pokroku. Nemôžete priamo merať epsilon pod vlastnou distribúciou politiky - to potrebuje expert ground-truth akcie pre každý navštívený stav, vec, ktorú sa snažíte vyhnúť produkcii. Čo vám miesto s bránením ľuďmi dáva, je intervenčný podiel: zlomok snímkov v behu, počas ktorého ľudská bytosť prevzala. Je to proxy a pohybuje sa z dôvodov bez vzťahu k politike - trpezlivý operátor intervenuje menej. Používané konzistentne, je to jedna čísla, ktorá vám povie, či bolo kolo stojí za popoludním.

Tretí preklad je varovanie kvality údajov, ktoré analýza nepokrýva. Mandlekar a kolegovia študovali šesť offline algoritmov na päť simulovaných a troch skutočných viacstupňových manipulačných úlohách a hlásajú citlivosť na voľby algoritmického dizajnu, závislosť od kvality demonštrácie a variabilitu spôsobenú kritériom zastavenia. Belkhale, Cui a Sadigh tvrdia, že kvalita množiny údajov by mala byť formalizovaná prostredníctvom divergencie akcií a rozmanitosti prechodov a poznamenávajú, že rozmanitosť stavov nie je vždy prospešná. DAgger kolo pridáva stavy, ktoré si nikto zámerného nevybral: niektoré sú regeneračné údaje, ktoré potrebujete, niektoré sú robot zvrtať sa, zatiaľ čo hľadáte ovládací prvok prevzatia.

Mechanicky kolo je šesť krokov: spustiť inferenciu so záznamom zapnutým, prevziať, keď sa politika správa nesprávne, skúmať priebeh a podať každú epizódu, synchronizovať opravy, komponovať zmiešanú množinu údajov z originálov plus opravy s výberom epizódy explicitne na zdroj a pokračovať v tréningu od predchádzajúceho checkpoint skôr ako základný model. Na ay-robots tieto kroky existujú ako tlačidlá, čo eliminuje inštaláciu, ale nie posúdenie. Dve upozornenia: pokračovanie z checkpoint inicializuje hmotnosti a nie je životopis optimizéra, a zarovnanie vedúceho ramena sa stále testuje na hardvéri. Pozri training a datasets.

DAgger slučka, už zapojená

Prevzatie počas živej inferencie s záznamom, per-frame značenie intervencie, podávanie epizód ako opravy alebo hodnotenia, komponovanie zmiešanej množiny údajov s explicitným výberom epizódy na zdroj a pokračovanie v tréningu z existujúceho checkpoint sa všetci vstavajú. Stále sa rozhodujete, kedy prevziať a čo ponechať - tá časť sa neautomatizuje.

Pozri, ako DAgger slučka funguje

Strom rodiny v jednej tabuľke

MetódaKto si vyberá stavyČo expert dodávaHlavný náklad
Behavior cloningExpertČisté demonštrácieŽiadne regeneračné údaje; chyba sa môže hromadiť kvadraticky v T
Prednedostupné tréňovanieUčiak, za časový krokŠtítky pozdĺž vyvolanej distribúcieT oddelené politiky; nepoužiteľný pre dlhé obzory
SMILe / SEARNStochastická zmes experta a učiakaŠtítky pozdĺž distribúcie zmesiKomponenty zmesi sa líšia v kvalite
DAggerZmiešaná politika, beta úbúdajúca na nuluSprávna akcia pre každý navštívený stavOznačovanie stavov, ktoré expert nikdy nevyprodukoval, zatiaľ čo nie je v kontrole
DARTExpert, porušený vstrikivaným šumomDemonštrácie pod kalibrovaný šumŠum musí byť kalibrovaný na chybu učiaka
HG-DAggerUčiak, kým ľudská bytosť neprevezmieOpravy len v segmentoch s bránením ľuďmiZávisí od rozhodnutia ľudskej bytosti o tom, kedy intervenuje
SafeDAggerUčiak, filtrovaný bezpečnostným systémomŠtítky len, keď brána žiadaBrána samotná musí byť trénovaná a dôverovaná

Často kladené otázky

Budem skutočne pozorovať kvadraticky rast chýb na mojom robotovi?

Nie ako čista krivka. Hranica je najhorší prípad: tesný v tom, že niektorý problém ju dosahuje, nie že tvoj by. Čo vidíte, je dôsledok - politika, ktorá sa boduje dobre na zadržovaných rámcoch, zlyhá v reálnej úlohe a nezlepšuje sa, keď zaznamenáte viac tých istých. Ak pomôcť viac čistých údajov prestane pomáhať, je to covariate shift, nie problém s množstvom údajov.

Musím implementovať zmiešavanie biet, aby som to nazval DAgger?

Besprávna verzia - expert v prvom kole, čistý učiak potom - je legitimny zvláštny prípad a často vykonal najlepšie v pôvodných experimentoch. Čo nemôžete skočiť, je agregácia: pretrénenie len na najnovších opravách porušuje interpretáciu Follow-The-Leader, čo je miesto, kde pochádza argument bez ľútosti. Trénovanie na opravách samých je oveľa slabší postup.

Prečo vrátim najlepšiu politiku na validačnej množine namiesto poslednej?

Pretože teorémy zaradzujú dobrú politiku niekde v sekvencii, nie že je to finálny iterácia - hranica je na minime v sekvencii. Dodávanie čoho kedy skončilo posledné kolo, diskontinua uvedenú podmienku výsledku a posledné kolo nie je spoľahlivo najlepšie.

Koľko kôl by som mal plánovať?

Teória chce iterácií v poriadku T, čo pre 600-krok epizódu nie je číslo, ktoré niekto spúšťa na hardvéri. Pôvodné pokusy boli spustené dvadsať iterácií na každom benchmarku. V praxi spúšťate kôl, kým intervenčný podiel prestane padať, oveľa pod počtom, ktorý analýza predpokladá - skutočná priepasť medzi teóriou a praxou.

Čo ak moja trieda politiky jednoducho nemôže reprezentovať experta?

Potom DAgger vás neuloží a hranica hovorí tak - je vyjadrená vzťahom k epsilon_N, najlepšej strate v triede spätne pohľadom. Ak je veľký, pretože nesprávna architektúra, chýbajúce pozorovanie alebo kamera, ktorá nemôže vidieť scénu, agregácia vám dá politiku, ktorá je optimálna v triede, ktorá nemôže úlohu robiť. Spustiť open-loop opakovanie voči zadržovaným epizódam, kým zbieraš opravy.

Kde ísť odtiaľto

Ak ste ešte netrénovali politiku, je teória predčasná: zaznamenajte množinu údajov najskôr, počnúc tréningom vašej prvej politiky a desktop klient. Ak vážite ďalšieho sto čistých demonštrácie proti počiatku opravy: čisté demonštrácie nerobia problém distribúcie. V prípade mechaniky pokračujte s varianta s bránením ľuďmi a potom SO-100 sprievodca.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started