Robot manipuláció jelenetének absztrakt megjelenítése, amely az állapot-eloszlást illusztrálja, amit a tanult háziállat a végrehajtás során meglátogat
DAggerImitáció TanulásBehavior CloningRobot TanulásElméleti

DAgger Magyarázata: Miért csúszik el a Behavior Cloning és Mit Bizonyít Ténylegesen az Adatsor Aggregáció

AY-Robots ResearchAugust 27, 202615 perc olvasás

A behavior cloning egy háziállamot a szakértő állapot-eloszlásán illeszkedik, majd az önmaga helyén telepítik. A két eloszlás közötti rés az oka annak, hogy egy háziállam, amely validáláskor rendben néz ki, a 300. lépésben leesik az asztalról. Ez az elméleti fejezet a DAgger-sorozatunkban: ahonnan a négyzetes hibatag származik, mit változtat az adatsor aggregáció, mit feltételez a no-regret bizonyítás, és a számlának mely részét kell még a humán szakértőnek fizetnie.

Van egy konkrét kudarc, amellyel mindenki, aki manipulációs háziállamot tanít, előbb vagy utóbb találkozik. A háziállat a kocka felé nyúl, két centiméterre kerül, szándékosan megáll, oldalra csúszik, majd valami olyasmit csinál, amely nem kapcsolódik a feladathoz. A validálási veszteség rendben volt. Az nyílt hurkú lejátszás a tartott episódok ellen rendben volt. Mégis az kar olyan helyzetbe kerül, amely sehol sem jelenik meg a tanulási adatokban, és innen nincs értelmes válasza.

Ennek a kudarc van neve és megállapított elmélete. Ez a négy cikk közül az első a DAgger-ról, és az érvet magát tárgyalja: miért termel egy háziállamot a demonstrátor saját pályáira illesztve olyan hibát, amely az epizód hosszának négyzetével nőhet, mit változtat az adatsor aggregáció, és mit nem ígér a no-regret bizonyítás. A valódi hardveren futó hurok a DAgger hurok futtatása SO-100 karon tárgyalja, a humán-gated variáns a HG-DAgger és humán-gated beavatkozások címen, és a mérési kérdés a DAgger hurok mérése címen.

A rövid verzió

  • A behavior cloning a szakértő állapot-eloszlásán tanít és a háziállam sajátjára értékelődik. Az eltérés az epizód során összeadódik.
  • Ross és Bagnell megmutatták, hogy a többletköltség akár T négyzete szorozva per-lépés hibával nőhet; a DAgger cikk ezt a korlátot újra kimondja és megjegyzi, hogy szoros.
  • DAgger olyan állapotokat címkéz, amelyeket maga a háziállat meglátogat, és az összes eddig gyűjtött adatsorból újra tanít, nem csak a legújabbból.
  • A garancia egy redukció a no-regret online tanulásra: az aggregáció és az újra tanítás a Follow-The-Leader.
  • Relatív a háziállat osztályban elérhető legjobb veszteséghez, nem nulla-hoz - és a szakértőnek még olyan állapotokat kell címkéznie, amelyeket soha nem termelt volna.

Az a feltételezés, amelyet a behavior cloning csendben tesz

Az adatsor egy megfigyelt-akciós párok halmaza. A behavior cloning egy függvényt illeszked ehhez a halmazhoz szokásos felügyelt tanulással, és megáll. Ez a terület legrégebbi ötlete. Pomerleau ALVINN-je, 1988-ban, egy háromrétegű backpropagation hálózat volt, amely kamerából és lézeres távolságmérőből származó képeket vett fel, és azt az irányt adta, amelybe a jármű utazni kellene; szimulált út képeken tanítottak és valódi utakon követtek néhány terepen. A recept nem sok változott; a hálózatok igen.

Az kihagyott, hogy hol származtak ezek a párok. Minden egy pályán feküszik, amelyet a demonstrátor termelt. Az implementált háziállat a saját pályáját termeli. Az a pillanat, amikor eltér, olyan állapotokra kérdezik meg, amelyek nem voltak a tanulási eloszlásban, és a válasza még tovább viszi. Ross, Gordon és Bagnell a DAgger cikket pontosan ezzel nyitják meg: az egymást követő predikció sérti az i.i.d. feltételezést a statisztikai tanulás alatt, mivel a tanuló saját előrejelzésai határozzák meg az inputokat, amelyeket később lát.

A legvilágosabb illusztráció abban a cikkben nem robot. A Super Mario Bros.-hoz egy közel-optimális terv klónozása olyan háziállamot termelt, amely ismételten egy akadály ellen ragadt meg ahelyett, hogy át volna ugrott. Az ok a teljes érv egy mondatban: a szakértő mindig kényelmes távolságból ugrott, így az adatsor nem tartalmazott olyan állapotot, amelyben Mario egy akadály ellen nyomódott, ezért nem volt címke arra, hogy mit csináljon, ha már volt.

Cseréljen Mario-t egy SO-100 kar-ra, és a szerkezet azonos. A bemutatások tiszta megközelítést és tiszta fogást mutatnak, nem a fogó két centiméterre bezárva - így a háziállamnak fogalma sincs, mit kell csinálni innen, és amit sejtésez még tovább viszi. A covariate shift az adatgyűjtési eljárás tulajdonsága, nem a hálózati architektúráé.

Ahonnan a négyzetes tag származik

A 2010 AISTATS cikkből Ross és Bagnell által, Efficient Reductions for Imitation Learning, az összeadódás pontosítva van. Legyen T a feladat horizontja, a feladat költsége az egységnyi intervallumban korlátolt, és legyen epsilon a helyettesítő veszteség mérve az szakértő állapot-eloszlása alatt - a szám, amit a validálási készlet jelez. Akkor az a háziállamnak az extra költsége, amelyet T lépésre futtat, a szakértőhöz képest, T négyzete szorozva epsilonnal korlátolt. Ross, Gordon és Bagnell ezt a DAgger cikkben Theorem 2.1-ként ismét kimondja, és hozzáadja a mondatot, amely számít: a korlát szoros. Problémák vannak, ahol egy háziállamnak epsilon vesztesége a szakértő eloszlása alatt valóban extra költséget termel, amely kvadratikusan nő T-vel.

A szoros nem jelenti a tipikusat. A négyzetes tag egy legrosszabb eset egy problémaosztályt, nem egy előrejelzés az pick-and-place feladatodról. Amit megállapít, hogy több szakértő bemutató nem távolíthatja el a problémát: csak az epsilon becslésévé élesíti meg egy olyan eloszláson, amelyen a háziállamot nem teszteli.

A kijárati útvonal ugyanabban a cikkben van, Theorem 2.2 ismét kimondva. Ha egy háziállamnak epsilon vesztesége van az önmaga állapot-eloszlása alatt, és egy rossz akció legfeljebb u költségbe kerül a szakértő szerint, az extra költség u szorozva T-vel szorozva epsilonnal korlátolt - lineáris a horizontban. Az u konstans az érdekes mennyiség: legfeljebb 1 a 0-1 megsértéshez a szakértővel szemben, és O(1) amikor a szakértő néhány lépés alatt helyreáll. A legrosszabb esetben O(T), és a lineáris korlát akkor nem jobb a négyzetes korlátnál.

BeállításKorlát az extra költségre a szakértőhöz képestAmin alapul
Behavior cloning (Ross & Bagnell 2010, Thm. 2.1-ként ismét kimondva Ross et al. 2011-ben)T négyzete szorozva epsilonnalepsilon mérve a szakértő állapot-eloszlása alatt; költség [0,1]-ben; a korlát szoros
Bármely háziállam epsilon veszteséggel saját eloszlása alatt (Thm. 2.2)u szorozva T-vel szorozva epsilonnalu a rossz akció költség-utáni büntetésót korlátoz; legfeljebb 1 a 0-1 veszteséghez, O(T) legrosszabb eset
Előre tanítás (Ross & Bagnell 2010)u szorozva T-vel szorozva epsilonnalegy háziállam időlépésenként; T háziállamokra és ismert, véges T-re van szükség
SMILe (Ross & Bagnell 2010)közel-lineáris T-ben és epsilonban néhány problémaosztályonalfa O(1/T négyzet)-ben, N O(T négyzet log T)-ben; sztochasztikus keveréket termel
DAgger (Thm. 3.2, Ross et al. 2011)u szorozva T-vel szorozva epsilon_N-nel, plusz O(1)N a uT sorrendjében; erősen konvex korlátolt veszteség; no-regret tanuló; epsilon_N az utolsó legjobb veszteség
Robot munkaterület, amely olyan állapotokat jelent, amelyeket a háziállat meglátogat, amely soha nem jelent meg a bemutató készletben
A DAgger forduló számára fontos állapotok azok, amelyeket senki nem mutatott be: a közel-sikertelen fogás, a félnyitott fogó, a kar az objektum mögött.

A DAgger előtti két kísérlet

Az előre tanítás az őszinte de impraktikus válasz. Tanítson egy külön háziállamot minden időlépéshez, sorrendben, mindegyik az előző lépésekhez már rögzített háziállamok által kiváltott állapot-eloszláson, így minden háziállam pontosan azt az eloszlást látja, amellyel szembesülni fog. A fogás a leírásban van: T háziállam, egymás után tanítva, nincs korai leállás. Egy manipulációs epizódnál 30 képkocka másodpercenként, T százasok között van.

A SMILe, ugyanabból a cikkből, és a SEARN, Daume, Langford és Marcu strukturált predikciós munkájából, az ellenkező útvonalat veszik: egy stacionárius háziállam, de sztochasztikus. Minden iteráció egy összetevőt tanít és hozzáadja egy keverékhez, az eloszlási tömeget a szakértőtől elvonva. Az eredmény egy keverék, amelyben néhány összetevő rosszabb, mint mások - fizikai karokon egy szabályozó, amely rossz összetevőt mintavételezhet a mozgás közepén. Ez az az említett motiváció, amely ahelyett egy stacionárius determinisztikus háziállamot akar.

DAgger: egy ötlet, egy doboz

Az adatsor aggregáció megtartja a determinisztikus háziállamot és az útravaló az adatgyűjtésbe helyezi. Minden forduló: az aktuális háziállamot felteszed, rögzítsd az állapotokat, amelyeket meglátogat, kérd meg a szakértőtől, mi lenne a helyes akció mindegyikben, add hozzá ezeket a párokat az adatsorhoz, amelyednek már van, tanuítsd az egyesítést. A név az algoritmus - aggregálsz, sosem eldobsz.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
A DAgger metaalgoritmus, Ross, Gordon & Bagnell (2011) Algorithm 3.1-je.

Három részlet többet nyom, mint ahogy kimutatódik. A címkék a vegyes háziállam által meglátogatott állapotok számára, de az akciók a szakértőtől - a háziállam a kérdéseket adja, a szakértő a válaszokat. Az újra tanítás az összes aggregáción van, amely az egyes fordulókat Follow-The-Leader lépésévé teszi: az n fordulóban azt a háziállamot választod, amely a legjobb az összes eddig lezajlott pályán. Ez az a kerétezés, amelyen a bizonyítás függ. Az algoritmus az egyes háziállamok közül a legjobbakat választva végződik egy validálási halmazon, mert a tételek garantálják, hogy valamilyen háziállam a sorozatban jó, nem hogy az utolsó.

A beta ütemezés, és miért nem hangolási gomb

A vegyes háziállam beta_i szorozva a szakértővel plusz egy mínusz beta_i szorozva a tanulóval. A pont gyakorlati: az első néhány tanult háziállam nagyon kevés adaton tanítanak, sok hibát csinálnak, és másképpen a felteszedést olyan állapotban fordítanák, amely irrelevánssá válik, amint a háziállat javul.

Az elmélet pontosan egy feltételt ró: a betas futó átlagának nulláig kell mennie. Az elemzés beta_i-ket (1 - alfa) hatványára korlátozza i-1, egy T-tól független konstans alfára.

ÜtemezésMit csinálMit jelez az újság
beta_1 = 1Az első forduló tiszta szakértő bemutató; nincs szükség kezdeti háziállamraAz ajánlott kezdőpont minden változatban
beta_i = 1 ha i = 1, különben 0Csak az első fordulóban szakértő; nincs szabad paraméterA papír paraméter-mentes verziója, amely azt mondja, hogy gyakran jól teljesít a gyakorlatban; 2980 a Super Mario Bros.-on 20 iteráció után
beta_i = p^(i-1) p = 0,5-telSzakértő valószínűsége geometrikusan csökken3030 ugyanazon a benchmarkon, kis mértékben megelőzve a paraméter-mentes verziót
beta_i = p^(i-1) p = 0,9-celSzakértő sokkal hosszabb ideig marad a hurokbenSzámottevőbb konvergencia lassulás; még javul, amikor a 20 iteráció véget ért

A 2980 és 3030 közötti rés egy körülbelül 4300-ig futó skálán kicsi, de a papír ennek magyarázata a szakaszban a leghasznosabb gyakorlati megjegyzés. A paraméter-mentes ütemezéssel Mario egy közös helyen ragadt meg korán, és egy tömeg közeli-duplikátumú adatot termelt abból az egy helyről; a szakértő időről időre vezetést adva mind kiszabadította, mind szélesítette az állapotok sokféleségét. Az ütemezés kevésbé a keverési arányról, mint arról, hogy az adatgyűjtés új állapotokat termel vagy ugyanaz a kudarc.

Miért nem viszik át az ütemezést egy fizikai karra, ahogy írva van

Egy sztochasztikus per-lépéses keverék azt jelenti, hogy időlépésről időlépésre eltolódik az irányítási hozzáférés, 30-szor egy másodpercben egy tipikus SO-100 beállításon. Egyetlen teleoperációs felület sem teszi ezt biztonságos vagy értelmes. Valódi hardveren a beta ütemezés helyét egy humán döntés veszi át arról, mikor veszik át: egy másik algoritmus másik elemzéssel.

A garancia: egy redukció a no-regret online tanulásra

Itt van az a lépés, amely a papírt azzá teszi. Kezelje az egyes DAgger fordulókat egy online tanulási probléma egy példájaként, ahol az i fordulóban a veszteség az i fordulóban használt háziállam állapot-eloszlása alatt mért helyettesítő veszteség. A tanuló egy háziállamot egy előtt kötelezik, amielőtt látták volna azt a veszteséget, és a sorozat nem-stacionárius, mert az eddigi termelt háziállamaktól függ.

Egy algoritmus no-regret, ha az N fordulóban átlagos vesztesége megközelíti az utolsó legjobb egyetlen háziállamét. A Follow-The-Leader erősen konvex veszteségeken ilyen algoritmus, az átlagos sajnálat zsugorítva 1/N körül - és az összes aggregáción való újra tanítás pontosan a Follow-The-Leader. Bármely más no-regret tanuló képez szolgálni: az elemzés egy redukció, nem egy optimalizáló tulajdonsága.

Egy lemma overbrídzseli a szakadékot a vegyes háziállam között, amely az adatokat gyűjtötte, és a tanult háziállam között, amely telepítésre kerül: Lemma 4.1 az L1 távolság korlátára az állapot-eloszlásuk között 2 T beta_i-vel. Ez az oka annak, hogy a betasnek csökkenniük kell - miközben a szakértő még jelentős irányítási hozzáférésssel bír, az állapotok, amelyeket gyűjtesz, nem azok az állapotok, amelyeket a háziállamod termelt. Egyesítsd a lemmát a sajnálat korláttal és a fő eredmény következik: körülbelül T iteráció után, valamilyen háziállam a sorozatban helyettesítő veszteséget mutat saját eloszlása alatt O(1/T) epsilon_N-en belül. Táplálj ezt a lineáris korlátba és Theorem 3.2-re száll le.

Az empirikus oldal szerény a jelenlegi standardok szerint. A Super Tux Kart-ban a felügyelt alapmegoldás nem javította az átlagos bukásait lapp-onként, mivel több adat érkezett, DAgger olyan háziállamot ért el, amely soha nem esett le az útról tizenöt iteráció után, és SMILe után húsz még körülbelül kétszer bukott lapp-onként. A kézírás benchmarkon a karakterpontosság 82 százalék strukturálás nélkül, 83,6 százalék felügyelt, 85,5 százalék DAgger-rel. Ezek közül egyik sem manipulációs eredmény.

Mit nem ígér a bizonyítás

A tétel kijelentések feltételesek, és a feltételek terhelésesek.

A DAgger garancia, közelebbről olvasva
Mit ad neked
  • Lineáris helyett négyzetes T-ben korlát, az állapított feltételezések alatt.
  • Determinisztikus stacionárius háziállam helyett sztochasztikus keverék.
  • Egy valódi redukció: bármely no-regret online tanuló beilleszthető.
  • Konkrét iterációszám - körülbelül T fordulók, mielőtt a sajnálat tag nem számít.
  • Garancia legalább egy háziállamra a sorozatban, így a bezáró validálási pass.
Mit nem ad neked
  • Ez relatív epsilon_N-hez, az osztályban az utolsó legjobb veszteséghez, nem nulla-hoz. Ha az osztálytöd nem képes ábrázolni a szakértőt, az gyakorlatban üres.
  • Szükséges egy no-regret metódusra vagy erősen konvex helyettesítő veszteségre - erősebb, mint az osztályozási redukciók, amelyeken felépül, ahogy a szerzők megjegyzik.
  • Az u konstans O(T) lehet a legrosszabb esetben, a lineáris korlát visszaesik kvadratikusba.
  • Fordulókat köt, nem szakértő címkéket. Roboton a címkék a költségvetés.
  • Feltételezi, hogy a szakértő minden meglátogatott állapotban kérdezhetős meg és helyesen válaszol ott. Ez a feltételezés az egész költség.

Egy további eredményt gyakran idéznek felülbírálatként, és nem is. Rajaraman, Yang, Jiao és Ramachandran az imitáció tanulás minimax korlátait tanulmányozzák epizodikus MDP-kben véges állapotterület S-sel és horizontális H-vel, és bizonyítanak egy szuboptimalitási alsó korlátot |S| H négyzete osztva N-nel, amely még akkor is áll, amikor a tanuló proaktívan kérdezhet a szakértőt meglátogatott állapotokban. Ez egy legrosszabb eset az MDP-k egy osztálya felett egy rögzített epizód költségvetésben, és amit ez kizár, az az ötlet, hogy az interakció javítja a minimax rátát; a DAgger tétel egy másik kijelentés, az implementált háziállamot kötve ahhoz képest, amit saját háziállam osztálya elérhet.

Swamy, Choudhury, Bagnell és Wu később ezeket az algoritmusokat a szakértő viselkedésének mely momentumait illesztik, és bevezetett egy momentum helyreállíthatósági fogalmat, amely azt jeleníti meg, hogy minden család milyen jól csökkenti az összeadódó hibát. Az Osa és Celemin szervezete az algoritmus tájat és a humán-feedback interfészeket jelöli.

A számlát: olyan állapotok címkézése, amelyeket a szakértő soha nem termelt

Minden fent feltételez egy szakértőt, aki bárhol kérdezhetők meg. Szimulációban egy szinte ingyenes terv - a Mario kísérletek egy közel-optimális tervet használtak teljes hozzáféréssel a játék állapotához. Egy emberrel roboton ez a domináns költség, és egy különös: az embernek egy helyes akciót kell termesztenie olyan konfigurációban, amelyet a saját képessége soha nem teremtene.

Kelly, Sidrane, Driggs-Campbell és Kochenderfer egyenesen állítják az ellenvetést a HG-DAgger cikkben. A vanília DAgger megköveteli a szakértőtől, hogy akció címkéket adjon, miközben nem teljes irányítás alatt áll a rendszeren. Ez csökkenti a biztonságot, és emberi szakértőkkel valószínű, hogy rontja a gyűjtött címkék minőségét, amelyeket az érzékelt működtető késésre vezetnek vissza. Az a címke, amit visszakapsz, nem az az címke, amelyet az algoritmus feltételezett.

Laskey és munkatársai a másik oldalról támadják a problémát a DART-tal, és keretezésük direkt: az on-policy technikák fárasztóak a humán felügyelőknek, számítási terhet adnak, és veszélyes állapotokat látogathatnak meg a képzés során. Az alternatívájuk kalibrált zajt injektál a felügyelő saját bemutatóiba, így a helyreállítás bemutatásra kerül anélkül, hogy a robot soha megbízatlan háziállamot futtatna. A MuJoCo humanoidon DART a felügyelő kumulatív jutalomcsökkentéseit 5 százalékban jelenti a képzésben, miközben DAgger olyan háziállamokat futtat, amelyeknek a kumulatív jutalma 80 százalékkal kevesebb, mint a felügyelőé; a Toyota HSR-rel zavaros greifésben az átlagos 62 százalékos javulás a behavior cloninghoz képest.

Zhang és Cho SafeDAgger-je a referencia-háziállamra való lekérdezéseket kezeli a szűkös erőforrásként: egy külön biztonsági háziállam előrejelzi, anélkül hogy lekérdezne, hogy az elsődleges háziállam készül-e a referenciatól az azon túl eltérni, és csak ezek az állapotok kerülnek át. Mindhárom ugyanarra az tényre reagál - a DAgger elemzés nem számít az szakértő címkéknek, a valóság pedig nagyon sokat.

Az a része, amelyről senki nem figyelmeztet

Az off-disztribúciós állapotok címkézése szellemileg nehezebb, mint bemutatni a feladatot. A szokásos bemutató azt jelenti, hogy végrehajtasz egy motoros tervet, amelyednek már van. A háziállamot korrigálása, amely a fogót valahova helyezte, ahol sosem csinálnál, azt jelenti, hogy helyreállást szerkesztesz helyzetben, időnyomás alatt, még a robot mozog. Várj kevesebb hasznos percet munkamenetként, mint egy egyszerű felvételi munkamenetben, és figyelmed a saját korrekciós minőségénél kopj egy munkamenet során.

LeRobot adatsor szerkezet epizódokat, képkockákat és per-képkocka oszlopokat mutató, mint tárolt lemezen
A korrekciók csak akkor válnak adatsorá, ha az intervenciós képkockák jelölve vannak - a LeRobot formátumban, a per-képkocka oszlop a megfigyelés és a akció mellett.

Mit jelent ez az SO-100-hoz az asztalon

Fordítsa a horizontot saját egységeire. Egy húsz másodperces epizód 30 képkocka másodpercenként 600 döntési lépés, T minden korlátban az a szám. T = 600-nál, T-vel skálázódó tag és T-vel négyzetre skálázódó közötti különbség a különbség egy háziállam között, amely helyreáll a rossz megközelítésből, és egy amely nem.

Ez az oka, hogy az akció-csempézés segít: amikor egy háziállam rövid akciósorozatot bocsát ki inferencia lépésenként, a döntési pontok száma csökken, így az összeadódás esélye is. Zhao, Kumar, Levine és Finn az akció csempézést a transzformátorokkal nevezik az összeadódó hiba motivációjaként, és 80-90 százalékos sikert jelentenek hat nehéz valódi feladatban, alacsony költségű kétkarú hardveren, tíz perc értékű bemutató alapján. A csempézés nem távolítja el a covariate shiftet - az állapotok még mindig a háziállamé - de rövidíti az effektív horizontot. Lásd akció csempézés és a SO-100 imitáció tanulás útmutató.

A második fordítás a haladásmetrika. Nem mérheted az epsilont a háziállam saját eloszlása alatt közvetlenül - ez szükséges talaj-igazság szakértő akciók minden meglátogatott állapotban, az amit megpróbálsz kerülni termeszteni. Mit ad helyette a humán-gated hurok az intervenciós arány: az a képkockák frakciója egy futásban, amely alatt a humán átvette volna az irányítást. Ez egy proxy, és olyan okok miatt mozog, amelyek nem kapcsolódnak a háziállamhoz - a türelmes operátor kevesebbet avatkozik be. Konzisztensen használva, az az egy szám, amely azt mondja, hogy érte-e a fordulót a délután.

Az harmadik fordítás egy adatminőség figyelmeztetés, amelyet az elemzés nem fed le. Mandlekar és munkatársai hat offline tanulási algoritmust tanulmányoztak öt szimulált és három valódi világos többszakaszos manipulációs feladaton, és az algoritmus tervezési választások érzékenységét, a bemutatók minőségétől való függést, és a leállítási kritériumok okozta variabilitást jelentik. Belkhale, Cui és Sadigh azt érvelnek, hogy az adatsor minőségét az akció divergencia és az átmenet sokfélesége révén kellene formalizálni, és megjegylik, hogy az állapot sokfélesége nem mindig hasznos. Egy DAgger fordulóa olyan állapotokat ad, amelyeket senki nem választott tudatosan: néhány az helyreállítási adat, amelyire szükséged van, néhány a robot vergődése, miközben az átvételi vezérlőre tapogatódsz.

Mechanikusan egy fordulónak hat lépése van: inferenciát futtass rögzítéssel, vedd át a háziállamot, amikor rosszul viselkedik, tekintsd át a futást és jegyezd fel az epizódokat, szinkronizáld a korrekciók, helyezz össze egy vegyes adatsort eredeti és korrekciók közül kifejezett epizódválasztással forrásonként, és folytasd az edzést az előző ellenőrzőpontból helyett az alap modellből. Az ay-robots-on ezek a lépések gombokként vannak jelen, amely eltávolítja a vezetékeket, de nem az ítélkezést. Két figyelmeztetés: az ellenőrzőpontból folytatás az súlyokat inicializálja, nem az optimalizáló folytatása, és a vezető kar igazítása mozgása még kívül tesztelve hardveren. Lásd képzés és adatsorok.

A DAgger hurok, már bekötve

Átvétel egy élő inferenciafutás során, per-képkocka intervenciós jelölés, epizódok szervezése korrekciók vagy értékelések miatt, vegyes adatsor összeállítás kifejezett epizódválasztással forrásonként, és képzés folytatása egy meglévő ellenőrzőpontből mind beépített. Te még eldöntöd, mikor vegy át és mit tartass - az a rész nem automatizálja.

Lásd, hogyan működik a DAgger hurok

A családfa, egy táblázatban

MetódusKi választja az állapotokatMit adja a szakértőFő költség
Behavior cloningA szakértőTiszta bemutatókNincs helyreállítási adat; a hiba kvadratikusan összeadódhat T-ben
Előre tanításA tanuló, időlépésenkéntCímkék az indukált eloszlás menténT külön háziállamot; nem használható hosszú horizontoknál
SMILe / SEARNA szakértő és a tanuló sztochasztikus keverékeCímkék a keverék eloszlása menténA keverék összetevői minőségben eltérnek
DAggerA vegyes háziállam, beta nullára csökkenHelyes akció minden meglátogatott állapotbanAz állapotok címkézése, amelyeket a szakértő soha nem termelt, miközben nem irányítást alatt
DARTA szakértő, injektált zaj által zavarvaBemutatók kalibrált zaj alattA zajt a tanuló hibájához kell kalibrálni
HG-DAggerA tanuló, amíg az ember átveszKorrekciók csak humán-gated szegmensekbenAz ember beavatkozási időről szóló ítélkezésétől függ
SafeDAggerA tanuló, biztonsági kapuval szűrveCímkék csak akkor, ha a kapu kériA kapu magát tanítani és megbízni kell

Gyakran feltett kérdések

Tényleg meg fogom figyelni a négyzetes hiba növekedést a robotomon?

Nem tiszta görbeként. A korlát legrosszabb eset: szoros, hogy valamilyen probléma elérje, nem, hogy a tiéd elérje. Mit látsz az a következmény - egy háziállam, amely jól pontoz a tartott képkockákon, nem teljesít az igazi feladatban, nem javul, amikor több egyforma adatot rögzítesz. Ha több tiszta adat segíteni szűnik meg, az covariate shift, nem adatmennyiség-probléma.

Be kell-e valósítanom a beta keverést ahhoz, hogy DAgger-nek hívjam?

A paraméter-mentes verzió - szakértő az első fordulóban, tiszta tanuló azután - egy jogos speciális eset, és gyakran a legjobban teljesítette az eredeti kísérleteken. Mit nem tudsz eldobni az aggregáció: csak az újabb korrekciók újra tanítása megtöri a Follow-The-Leader értelmezést, amely ott van, ahonnan a no-regret érv származik. Csak korrekciók tanítása egy sokkal gyengébb eljárás.

Miért adja vissza az legjobb háziállamot egy validálási halmazon az utolsó helyett?

Mivel a tételek garantálják, hogy létezik egy jó háziállam valahol a sorozatban, nem hogy az utolsó iteráció - a korlát a sorozaton felüli minimumra vonatkozik. Azt szállítani, ami az utolsó fordulóból származott, eldobja az eredmény egy megállapított feltételét, az utolsó forduló nem megbízhatóan a legjobb.

Hány fordulót tervezzek?

Az elmélet T körüli fordulókat akar, amely egy 600 lépéses epizódnál nem szám, amelyet bárki futtat hardveren. Az eredeti kísérletek minden benchmarkon húsz fordulót futtattak. A gyakorlatban fordulókat futtatsz, amíg az intervenciós arány le nem csökken, sokkal az elemzés számítása alatt - a valódi rés az elmélet és a gyakorlat között.

Mi van, ha a háziállam osztály egyszerűen nem képes ábrázolni a szakértőt?

Akkor DAgger nem menthet meg, és a korlát azt mondja - az epsilon_N-hez, a legjobb veszteség az osztályban az utolsóban kifejezve. Ha az nagy, mivel rossz építészet, hiányzó megfigyelés vagy olyan kamera, amely nem látja a jelenetet, az aggregáció olyan háziállamot ad, amely az osztályban optimális, amely nem képes a feladatra. Futtass nyílt hurkú lejátszást a tartott epizódok ellen, mielőtt korrekciók gyűjtesz.

Hova menj innen

Ha még nem tanított háziállamot, ez az elmélet korai: először rögzíts egy adatsort, kezdve az első háziállamot tanítani és az asztali klienst használatával. Ha egy másik száz tiszta bemutató között válogatsz az indítási korrekciók indítása ellen: a tiszta bemutatók nem rögzítik az eloszlás problémáját. A mechanikához folytasd a humán-gated változattal majd az SO-100 útmutató.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started