
Behavior cloning hentar stefnu á stöðudreifingu sérfræðingsins og er síðan útfærð á sinni eigin. Bilið á milli þessara tveggja dreifinga er ástæðan fyrir því að stefna sem lítur vel út í staðfestingu gengur af borðinu á skrefi 300. Þetta er kenningarkafli okkar DAgger-flokks: hvar veldisvísir villunafnsins kemur frá, hvað Dataset Aggregation breytir, hvað endalaust regreturétti sönnunin gerir ráð fyrir, og hvaða hluta reikningsins manneskjan sérfræðingur þarf enn að greiða.
Það er sérkrafa bilun sem allir sem þjálfa meðhöndlunarstefnu mætir fyrr eða síðar. Stefnan nær til teningsins, kemst innan tveggja sentimetra, dvínar, skeiðir til hliðar, og gerir síðan eitthvað sem tengist ekki verkefninu. Staðfestingartap var fínt. Opin endurtaka á móti opnum þjóðnum var fín. Og ég myndi samt enda með bragað sem kemur ekkert fram í þjálfunargögnum, og þaðan hefur það ekkert skynsamlegt að segja.
Þessi bilun hefur nafn og staðfesta kenningu að baki henni. Þetta er fyrri af fjórum greinum um DAgger, og hún nær til röksemdanna sjálfrar: hvers vegna að falla stefnu á eigin braut sérfræðingsins framleiðir villu sem getur stærst með ferningi þess lengdar, hvað Dataset Aggregation breytir, og hvað endalaust regreturétti sönnunin loforðar ekki. Lykkjan á raunvirkri vélbúnaði er komin til running a DAgger loop on an SO-100, manneskjan-gáðir afbrigðið í HG-DAgger and human-gated interventions, og mælingaspurningin í measuring a DAgger loop.
Stutt útgáfan
- •Behavior cloning þjálfar á stöðudreifingu sérfræðingsins og er metin á eigin stefnu. Ósamsæmið bætist yfir epísóduna.
- •Ross og Bagnell sýndu að aukakostnaðurinn getur stækkað sem T ferningur sinnum villunni á skrefi; DAgger blöðin endurskýra þá mörk og athugðu að hún er þétt.
- •DAgger merki stöður sem stefnan sjálf heimsækir, og endurþjálfar á hverju gagnaupplýsingasafni sem aflað er hingað til, ekki bara þeim nýjustu.
- •Ábyrgðin er minnkun á endalaust regreturétti online learning: samsetning og endurþjálfun er Follow-The-Leader.
- •Það gengur miðað við bestu villuna sem er hægt að ná í stefnuflokki, ekki miðað við núll - og sérfræðingur þarf ennþá að merkja stöður sem hann myndi aldrei hafa framleiðir.
Forsendan sem behavior cloning stillir hljóðlega á
Sýnigagnasafn er fulgi af athugunar-aðgerðapörum. Behavior cloning hentar aðgerð við þá fulga með venjulegri bekkliðri námi og stoppar þar. Það er elsta hugmyndin á sviðinu. Pomerleau ALVINN, 1988, var þriggja-laga afturútbreiðslunet sem tók myndir frá myndavél og laser fjarlægðarfinningu og framleiddi stefnuna sem ökutækið átti að fara; það var þjálfað á eftirlíkun vegi og fylgdi raunverulegum vegum undir sumum skilyrðum. Uppskriftin hefur ekki breyst mikið; netunum hefur.
Hvað fæst sleppt er athugun á því hvar þessi pör komu frá. Hver einn þeirra liggur á braut sem sérfræðingur framleiddi. Stefnan sem þú dreifir framleiðir sína eigin. Þegar hún víkur, er hún spyrð um stöður sem voru ekki í þjálfunardreifingu, og svar hennar flytjir hana lengra út. Ross, Gordon og Bagnell opna DAgger blöðin með nákvæmlega þessu: raðaðar spá brýtur i.i.d. forsendu undir tölfræðilegri námi, vegna þess að spár þess aðilans ákvarða inntak sem það sér síðan.
Skýrðasta myndin í þeirri blaði er ekki róbot alls. Klóning nærri bestu áætlunaraðila fyrir Super Mario Bros. framleiddi stefnu sem endurtekið slóst á hindrun í stað þess að stökkva á hana. Ástæðan er allri röksemdina í einni setningu: sérfræðingur spratt alltaf frá þægilegu fjarlægð, þannig að gagnasafnið innihélt enga stöðu þar sem Mario var þrýsttur á hindrun, og því engin merki fyrir hvað á að gera þegar hann var.
Skipta Mario fyrir an SO-100 arm og uppbyggingin er eins. Þínar sýningir sýna hreina nálgun og reiðan gripandi, ekki griparinn lokast tveir sentimetrar stutt - svo stefnan hefur engin hugmynd um hvað á að gera þaðan, og hvað sem það giskar tekur það lengra út. Covariate shift er eign data collection procedure, ekki netsins.
Hvar veldisvísir hugtakið kemur frá
2010 AISTATS blöðin eftir Ross og Bagnell, Efficient Reductions for Imitation Learning, gerir samsetninguna nákvæm. Látum T vera verkefnahorizontið, látum verkefniskostnað bundinn í einingabili, og látum epsilon vera vogunarvillunni mælda undir expert's stöðudreifingin - talan sem staðfestingasafnið þitt greinir. Þá er aukakostnaður þess að keyra þá stefnu fyrir T skref, miðað við sérfræðinginn, bundinn af T ferningi sinnum epsilon. Ross, Gordon og Bagnell endurskýra þetta sem Setning 2.1 í DAgger blöðunum og bæta við setningunni sem skiptir máli: mörkin eru þétt. Vandamál eru til þar sem stefna með epsilon villu á dreifingu sérfræðingsins virkilega hefur aukakostnað sem vex fjórfalt í T.
Þéttur þýðir ekki dæmigert. Veldisvísir hugtakið er versta tilfelli yfir flokk vandamála, ekki spá um þinn pick-and-place verkefni. Hvað það setur á stall er að meiri sérfræðisýning getur ekki fjarlægt vandamálið: það skerpir aðeins matið á epsilon á dreifingu sem stefnan verður ekki prófuð á.
Flóalegrin eru í sömu blaði, endurskýrð sem Setning 2.2. Ef stefna nær villunni epsilon undir its own stöðudreifingin, og ein röng aðgerð kostar mest u í kostnaði-til-fara undir sérfræðinginn, þá er aukakostnaður bundinn af u sinnum T sinnum epsilon - línulegt á horizontinum. Stöðvinn u er áhugaverðu magnið: mest 1 fyrir 0-1 ósamtykki við sérfræðinginn, og O(1) þegar sérfræðingur getur endurheimt innan fárra skrefa. Í versta tilviki er það O(T), og línubundinni mörkin eru þá ekki betri en veldisvísir.
| Stilling | Mörk á aukakostnað yfir sérfræðinginn | Hvað það hvílir á |
|---|---|---|
| Behavior cloning (Ross & Bagnell 2010, endurskýrt sem Thm. 2.1 í Ross et al. 2011) | T ferningur sinnum epsilon | epsilon mælt á stöðudreifingu sérfræðingsins; kostnaður í [0,1]; mörk eru þétt |
| Hvaða stefna sem er með epsilon villu undir eigin dreifingu (Thm. 2.2) | u sinnum T sinnum epsilon | u takmarkar kostnaðinn-til-fara refsiverðu einni röngri aðgerð; mest 1 fyrir 0-1 tap, O(T) versta tilfelli |
| Forward training (Ross & Bagnell 2010) | u sinnum T sinnum epsilon | ein stefna á hvern tímaskref; þarf T stefnur og þekkta, endanlega T |
| SMILe (Ross & Bagnell 2010) | nærri-línulegt í T og epsilon á sumum vandamálaflokkum | alfa í O(1/T ferningur), N í O(T ferningur log T); framleiðir sannlýkindarblöndu |
| DAgger (Thm. 3.2, Ross et al. 2011) | u sinnum T sinnum epsilon_N, plús O(1) | N á stærðargráðunni af uT; sterklega köfuð bundin tap; endalaust regreturétti aðilandi; epsilon_N er best tap í aftursýn |

Tvær tilraunir sem komu fyrir DAgger
Forward training er heiðarleg en óhagkvæm svar. Þjálfa aðskilda stefnu fyrir hvern tímaskref, í röð, hverja á stöðudreifingu framkallaðri af þeim stefnum sem þegar eru fastir fyrir fyrri skref, þannig að hver stefna sér nákvæmlega drefinguna sem hún mun standa frammi fyrir. Hið er í lýsingunni: T stefnur, þjálfað þjál, engin snemm stöðvun. Fyrir meðhöndlun episode við 30 ramma á sekúndu, T er í hundruðum.
SMILe, frá sömu blaði, og SEARN, frá vinnu Daume, Langford og Marcu um uppbyggða spá, taka hinni leiðina: ein kyrrstæð stefna, en sannlýkind. Hver endurtekning þjálfar hluti og bætir henni á blöndu, færir líkindasmassa frá sérfræðingnum. Niðurstaðan er blanda þar sem sumir hlutir eru verri en aðrir - á efnislegu bragði, stýringi sem getur tekið sýnishorn á slæma hluti meðan á hreyfingu stendur. Það er tilgreind hvati fyrir vilji á kyrrstæðri deterministic stefna í staðinn.
DAgger: ein hugmynd, ein kassi
Dataset Aggregation heldur kyrrstæðri stefnu og færir lagið inn í gögn. Hverri umferð: útfærðu núverandi stefnu, skrá stöðurnar sem hún heimsækir, spyrja sérfræðinginn hver væru réttu aðgerð í hverjum, bæta þeim pörum við gagnasafnið sem þú átt þegar, endurþjálfa á sameiningunni. Nafnið er reiknirítunin - þú safnar saman, þú hætir aldrei.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setÞrjú smáatriði bera meiri þyngd en þeir líta út eins og þeir gera. Merkin eru fyrir stöður sem heimsækir með blönduðu stefnu, en aðgerðirnar koma frá sérfræðingnum - stefnan veitir spurningarnar, sérfræðingur svarirnar. Endurþjálfunin er á allri felmöguleikasafninu, sem gerir hverja umferð Follow-The-Leader skref: á umferð n þú velur bestu stefnu í aftursýn yfir allar brautir hingað til. Þeirri framing er hvað sönnunin hengs á. Og reiknirítunin endar með því að skila bestu stefnu röðarinnar eins og valin er á staðfestingarsafni, vegna þess að setningarnar loforða að some stefna í röðinni er góð, ekki að sú síðasta sé.
Beta schedule, og hvers vegna það er ekki tæktiknopi
Blandaða stefnan er beta_i sinnum sérfræðingur plús ein mínus beta_i sinnum námsmaðurinn. Punkturinn er hagnýt: fyrstu fáu lærðu stefnurnar eru þjálfaðar á mjög litlum gögnum, gera marga villur, og myndu annars eyða útskiptinu í stöðum sem verða óviðkomandi þegar stefnan bætist.
Kenningin setur nákvæmlega eitt skilyrði: hið keyra meðaltal beta verður að fara á núll. Greiningin virkar með beta_i bundnum af (1 - alfa) til máttar i-1, fyrir fast alfa óháðu T.
| Tímasetning | Hvað það gerir | Hvað blöðin tilkynna |
|---|---|---|
| beta_1 = 1 | Fyrri umferð er hreinn sérfræðisýning; engin fyrstu stefna þörf | Ráðlögð upphafspunktur í öllum afbrigðum |
| beta_i = 1 ef i = 1, annars 0 | Sérfræðingur bara í umferð ein; engin ókeypis breytu | Breytilaus útgáfa blöðanna, sem hún segir oft standa sig best í reynd; 2980 á Super Mario Bros. eftir 20 endurtekningar |
| beta_i = p^(i-1) með p = 0.5 | Sérfræðisannabil rofnar geometrískt | 3030 á sama viðmið, lítið fram úr breytilausu útgáfunni |
| beta_i = p^(i-1) með p = 0.9 | Sérfræðingur stendur í lykkjunni mun lengur | Merkilega hægari samleitni; ennþá að bætast þegar 20 endurtekningarnar enduðu |
Bilið á milli 2980 og 3030 á kvarða sem hleypur til um 4300 er lítið, en útskýring blöðanna á henni er gagnlegasti hagnýti athugasemdina í hlutanum. Með breytilausu dagskránni, Mario slóst fast í sama stað snemma og framleiddi þunga nærri-tvítekna gögn frá þeim einum stað; að láta sérfræðinginn keyra brot tímans bæði losnaði honum og víkkaði úrval stöðum. Dagskráin snýst síður um blandhlutfall en um hvort gögn þín haldi áfram að framleiða nýjar stöður eða sömu bilanir.
Sannlýkinda á tímaskref blanda þýðir að skipta stjórn yfirvaldi á stýrihraða, 30 sinnum á sekúndu á dæmigerðri SO-100 uppsetningu. Engin fjartengingu viðmót gerir það öruggt eða þýðingarmikið. Á raunvirkri vélbúnaði beta dagskráin víkur fyrir manneskju ákvörðun um hvað að taka yfir: annar reiknirita með annarri greiningu.
Ábyrgðin: minnkun á endalaust regreturétti online learning
Hér er flutningurinn sem gerir blöðina það sem hún er. Meðhöndla hverja DAgger umferð sem eitt dæmi í online learning vandamálinu, þar sem tapið á umferð i er vogunarvillunni undir stöðudreifingu stefnunnar sem notuð var á umferð i. Aðilandi skuldbindur sig til stefnunnar fyrir því að sjá það tap, og röðin er ekki kyrrstæð vegna þess að hún fer eftir stefnum sem framleidd eru hingað til.
Reikniritur er endalaust regreturétti ef meðaltal þess tap yfir N umferðir nálgast það af bestu einu stefnu í aftursýn. Follow-The-Leader á sterklega köfuð tapi er slíkur reikniritur, með meðaltalsskekkju sem krumpar á stærðargráðu 1/N - og endurþjálfun á allri felmöguleikasafninu er nákvæmlega Follow-The-Leader. Hvaða annar endalaust regreturétti númer myndi þjóna: greiningin er minnkun, ekki eiginleiki eins hagnaðaraðila.
Ein lemma brýtir bilið á milli blönduðu stefnunnar sem söfnuðu gögnunum og lærðu stefnunni sem verður til dreifingar: Lemma 4.1 takmarkar L1 fjarlægð á milli stöðudreifinga við 2 T beta_i. Þetta er hvers vegna beta verða að rotna - á meðan sérfræðingur heldur ennþá þess mats stjórn yfirvaldi, stöðurnar sem þú söfnar eru ekki stöðurnar sem þín stefna mun framleiða. Sameina lemma við skekkjumörk og aðal niðurstöðu fylgir: eftir um það bil T endurtekningar, sum stefna í röðinni hefur vogunarvillu undir eigin dreifingunni innan O(1/T) af epsilon_N. Þáðu það inn í línubundinni mörkin og þú lendir á Setning 3.2.
Reynsluangi er hófl eftir núverandi stöðlum. Í Super Tux Kart eftirlit grunnlínan gerðist ekki betri meðaltal fall á lopu þegar gögn komu, DAgger náði stefnu sem fór aldrei af brautinni eftir fimmtán endurtekningar, og SMILe eftir tuttugu fór samt um það bil tvisvar sinnum á lopu. Á handritakvarðanum var eigindi nákvæmni 82 prósent án byggingar, 83,6 prósent undir eftirliti, 85,5 prósent með DAgger. Engin þessara er meðhöndlun niðurstaða.
Hvað sönnunin loforðar ekki
Setning fullyrðingarnar eru skilyrðilegar, og skilyrðin eru burðaflýta.
- Mörk línulegt frekar en ferningur í T, undir tilgreindum forsendum.
- Kyrrstæð ákveðin stefna frekar en sannlýkindarblöndu.
- Endalaus minnkun: hvaða endalaust regreturétti online námsmaðurinn hleypir inn.
- Steyp endurtekning talning - um það bil T umferðir fyrir skekkjuhugtakið hættu að skipta máli.
- Ábyrgð fyrir að minnsta kosti ein stefna í röðinni, þar af leiðandi lokunarstaðfestingu stafi.
- Það er miðað við epsilon_N, best tap í flokki í aftursýn, ekki miðað við núll. Ef klassi þinn getur ekki myndað sérfræðinginn, er hann tómur í reynd.
- Það þarf endalaust regreturétti aðferð eða sterklega köfuð vogunarvilltu - sterkari en flokkunar minnkanir hún byggir á, eins og höfundar benda á.
- Stöðvinn u getur verið O(T) í versta tilfelli, og línubundinni mörkin þá hrynja aftur til fernings.
- Það takmarkar endurtekningar, ekki sérfræðismerki. Á róbótum eru merki fjárhagsáætlun.
- Það gerir ráð fyrir að sérfræðingur geti verið spurður á hverri heimsótt stöðu og svarar rétt þar. Sú forsenda er allri kostnaðurinn.
Ein frekari niðurstaða er oft tilvitnuð sem afsönnun og er ekki ein. Rajaraman, Yang, Jiao og Ramachandran rannsaka hámarksmörk eftirmyndunar náms í episódískum MDPs með endanlegum stöðurunu S og horizonti H, og sannar suboptimality neðri mörk á stærðargráðu |S| H ferningur yfir N sem heldur jafnvel þegar aðilandi getur með virkni spurt sérfræðinginn á heimsótt stöðum. Þetta er versta-tilfelli gengi yfir flokkum MDPs á fastri epísódíðferðaráætlun, og hvað það útilokar er hugmyndin um að samskipti bæti hámarksgengið; DAgger setning er önnur fullyrðing, mörk framkvæmd stefnu miðað við hvað eigin flokkur getur náð.
Swamy, Choudhury, Bagnell og Wu flokkaðu seinna þessa reikniritra um hvaða stunda sérfræðishegðun þeir passa, og kynntu hugtak um stunda endurheimtar sem afgreinir hversu vel hver fjölskylda dregur úr samsettri villu. Yfirlitsrit eftir Osa og af Celemin náðu reiknirílandi landslagi og manneskju-ábendingu viðmótum.
Reikningurinn: merking stöðum sérfræðingur framleiddi aldrei
Allt ofan gerir ráð fyrir sérfræðingur sem getur verið spurður hvar sem er. Í eftirlíkun með áætlunaraðila sem er næstum ókeypis - Mario tilraunirnar notuðu næstum bestu áætlunaraðila með fullum aðgangi að leikaðstærðum. Með manneskju á róbótum það er ríkjandi kostnaður, og einkennilegt: manneskjan þarf að framleiða rétta aðgerð í skilgreiningu sem eigin þekking myndu aldrei hafa búið til.
Kelly, Sidrane, Driggs-Campbell og Kochenderfer fullyrða andmælið beint í HG-DAgger blaðinu. Vanilla DAgger krefst sérfræðings til að veita aðgerðamerki á meðan ekki er að fullu stjórnað kerfinu. Þetta dregur úr öryggi, og með manneskju sérfræðingum það er líklegt að rýra gæði söfnuð merki, sem þeir setja niður til skynjað gjöfar. Merkið sem þú færð aftur er ekki merkið sem reiknirítunin gerði ráð fyrir.
Laskey og samstarfsmenn ráðast á vandamálið frá hinni hliðinni með DART, og rammi þeirra er sléttur: on-policy aðferðir eru leiðinlegar fyrir manneskju umsjónarmaður, bæta reiknirið álagi, og gæti heimsótt hættuleg stöður meðan þjálfa. Þeirra valkostur sprautar stilltu hávaða inn í umsjónarmanns eigin sýningum, svo endurheimt fer fyrir sýningu án þess að róbótinn gangi nokkurn tíma ótryggðu stefnu. Á MuJoCo Humanoid þeir tilkynna DART minnkandi umsjónarmanns uppsafnaðar verðlaun um 5 prósent meðan þjálfa, á meðan DAgger framkvæmir stefnur með 80 prósent minni uppsöfnuð verðlaun en umsjónarmaðurinn; á gripandi í óreiðu með Toyota HSR, meðaltal 62 prósent stækkun yfir behavior cloning.
Zhang og Cho SafeDAgger meðhöndlar spurningar á viðmiðun stefnunni sem dýrt auðlind: aðskilin öryggis stefna spá, án spurninga, hvort aðal stefna er um að villast frá viðmiðun umfram þröskuld, og bara þær stöður eru afhent. Allt þrjú bregðast við sama staðreyndum - DAgger greining rukkar ekki fyrir sérfræðismerki, og reyndin rukkar mikið.
Merking utan dreifingar stöðum er andlega erfiðari en sýna verkefnið. Venjuleg sýning þýðir að framkvæma hreyfingu áætlun sem þú átt nú þegar. Leiðrétting stefnu sem hefur sett griparinn einhvers staðar sem þú myndir aldrei meina að smíða endurkoma á augnablikinu, undir tímapýsl, með róbótnum ennþá hreyfst. Búast við færri nothæfum mínútum á setu en í einföldum skráningu setu, og horfa þinni eigin leiðréttingu gæðum rýrni yfir framgang ein.

Hvað þetta þýðir fyrir SO-100 á þínu borði
Þýða horizontið inn í þín eigin einingar. Tuttugu sekúndu epísóda við 30 ramma á sekúndu er 600 ákvarða skref, og T í öllum mörkum ofan er sú tala. Við T = 600, munurinn á hugtaki stærðargráðu T og einni stærðargráðu T ferningur er munurinn á stefnu sem endurheimt frá slæmri nálgun og ein sem gerir það ekki.
Þetta er hluti af því af hverju aðgerð chunking hjálpar: þegar stefna senda stutta röð aðgerðir á endurhlutanir skref, ætlið ákvarða punktar, og svo gerir fjöldi tækifæra til samsetningar. Zhao, Kumar, Levine og Finn nefna samsetta villu sem hvati fyrir Aðgerð Chunking með Transformers, og tilkynna 80 til 90 prósent árangur á sex erfiðum raunverulegum verkefnum, á lágu kostnaði tvíhliða vélbúnaði, frá tíu mínútum verðmætum sýningum. Chunking fjarlægir ekki covariate shift - stöðurnar eru ennþá stefnunnar eigin - en það styttir virka horizontinn. Sjá action chunking og SO-100 imitation learning guide.
Annar þýðing er framvindu mæling. Þú getur ekki mælt epsilon undir stefnu eigin dreifingunni beint - sem þarf jarðsannarlega sérfræðis aðgerðir fyrir hverja heimsótt stöðu, athleiðingin sem þú ert að reyna að forðast framleiðslu. Hvað manneskja-gáðir lykkja gefur þér í staðinn er íhlutun prósent: broti af rammum í tí meðan manneskjan hafði tekið yfir. Það er gegnumborunarmaður, og hún færist um ástir ótengdir stefnunni - þolinmódur stjórnandi grípur inn í minna. Notuð stöðugt, það er ein talan sem segir hvort umferð væru þess virði kvöldið.
Þriðji þýðing er gögn-gæði viðvörun sem greining nær ekki. Mandlekar og samstarfsmenn rannsaka sex ótengt námsreikniriti á fimm eftirlíkuð og þrjú raunveruleg fjölstig meðhöndlun verkefnum, og tilkynna næmni á reiknirítandi hönnunar vali, ósjálfstæði á gæðum sýninganna, og breytu af stöðvun viðmiðun. Belkhale, Cui og Sadigh halda því fram að gagnasafn gæði ættu að vera formfest í gegnum aðgerð fráviki og háðar fjölbreytileika, og notin að stöðu fjölbreytileiki er ekki alltaf gagnlegt. DAgger umferð bætir stöðum enginn kaus með ráðum: sum eru endurheimta gögn sem þú þarft, sum eru róbótinn flaugandi meðan þú klifið fyrir takeover stjórnun.
Vélrænar umferð er sex skref: keyra álykt með skráningu á, taka yfir þegar stefna illa óðir, fara yfir tí og leggja hverja epísóda, samstilla leiðréttingarnar, sameina blönduð gögn úr uppruna plús leiðréttingum með epísóda val gerð skýrt á köllum, og halda þjálfun frá fyrri checkpoint frekar en grunn líkan. Á ay-robots þessir skref eru eins og hnappar, sem fjarlægir pípuna en ekki dómur. Tvær réttlætissetningar: halda frá checkpoint skilgreining þyngd og er ekki hagnaðar endurkoma, og leiðari-bragð jöfnun færa er ennþá létt prófuð á vélbúnaði. Sjá training og datasets.
DAgger lykkja, nú þegar þráðuð upp
Takeover meðan á lifandi álykt keyrslu, á-ramma íhlutun merking, leggja epísóda sem leiðréttingar eða mat, sameina blönduð gögn með skýru epísóda val á köllum, og halda þjálfa frá núverandi checkpoint eru allir innbyggðir. Þú ákveðir ennþá þegar að taka yfir og hvað að halda - sú hluti gerir ekki sjálfvirkt.
Sjá hvernig DAgger lykkja virkarFjölskyldu tré, á einni töflu
| Aðferð | Hver velur stöðurnar | Hvað sérfræðingur útvegur | Aðal kostnaður |
|---|---|---|---|
| Behavior cloning | Sérfræðingurinn | Hreinar sýningir | Engin endurheimta gögn; villa geta samsetning ferningur í T |
| Forward training | Námsmaðurinn, á tímaskref | Merki meðfram framkallaðri dreifingu | T aðskilin stefnur; ónotnæm fyrir langan horizont |
| SMILe / SEARN | Sannlýkindar blanda af sérfræðingur og námsmaðurinn | Merki meðfram blöndu dreifingunni | Hlutir blöndu eru mismunandi gæðum |
| DAgger | Blandaða stefnan, beta rotna til núll | Rétt aðgerð fyrir hverja heimsótt stöðu | Merking stöðum sérfræðingur myndu aldrei framleiða, á meðan ekki í stjórn |
| DART | Sérfræðingurinn, truflað með sprautaðri hávaða | Sýningir undir stilltu hávaða | Hávaði verður að vera stilltur til námsmanns villa |
| HG-DAgger | Námsmaðurinn, til manneskja tekur yfir | Leiðréttingar aðeins manneskju-gáðir hluti | Ósjálfstæði á manneskju dómi um hvern að grípa inn |
| SafeDAgger | Námsmaðurinn, síað af öryggis gátu | Merki bara þegar gátan spyr | Gátan sjálf verður að vera þjálf og treystir |
Oft spurðu spurningar
Mun ég raunarlega athugasemd veldisvísir villa vöxt á mínu róbótum?▾
Ekki sem hreinn ferill. Mörkin er versta tilfelli: þéttur að sem sumir vandamál ná henni, ekki að þinn mun. Hvað þú sérð er afleiðingin - stefna sem skorar vel á opnum ramma, brosir á raunverulegu verkefni, og batnar ekki þegar þú skrá meira af sömu. Ef meiri hreinum gögnum stöðva hjálp, þetta er covariate shift, ekki gögn-rúmmál vandamál.
Þarf ég að framkvæma beta blöndu að kalla það DAgger?▾
Breytilaus útgáfan - sérfræðingur í umferð ein, hreinn námsmaður eftir - er löglegur sértilfelli og oft stóð sig best í upprunalegu tilraunum. Hvað þú getur ekki sleppt er samsetningin: endurþjálfa bara á nýjustu leiðréttingum brýtur Follow-The-Leader túlkun, sem er hvar endalaust regreturétti rök kemur frá. Þjálfa á leiðréttingum ein er miklu veikari aðferð.
Hvers vegna skila bestu stefnu á staðfestingarsafni í staðinn fyrir síðasta?▾
Vegna þess að setningarnar loforða góða stefnu er til einhvers staðar í röðinni, ekki að það sé endarloka endurtekning - mörkin er á lágmarks yfir röðina. Skipaðu hvað sem kom út af síðustu umferð hikir tilgreindu skilyrði niðurstaðan, og síðasta umferð er ekki áreiðanlegur bestu.
Hversu margar umferðir ætti ég að skipuleggja fyrir?▾
Kenningin vill endurtekningum á stærðargráðu T, sem fyrir 600-skref epísóda er ekki tala engin gangi á vélbúnaði. Upprunaleg tilraunir hlopið tuttugu endurtekningar á öllum viðmið. Í reynd þú gangi umferðir til íhlutun prósent stöðvar að falla, langt fyrir neðan talna greiningin gerir ráð fyrir - raunverulegur bilun á milli kenning og reynd.
Hvað ef mitt stefna flokkur getur einfaldlega ekki myndað sérfræðinginn?▾
Þá DAgger gerir ekki bata þig, og mörkin segir svo - það er tjáð miðað við epsilon_N, best tap í flokkinum í aftursýn. Ef þetta stór vegna ranglega arkitektur, týndu athugun eða myndavél sem getur ekki séð svæðið, samsetning gefur þér stefnu sem er bestu innan klassa sem getur ekki gert verkefnið. Gangu opin endurtaka á móti opnum þjóðnum fyrir því að safna leiðréttingum.
Hvar til gangi héðan
Ef þú hefur ekki þjálf stefnu ennþá, þessi kenning er fyrir tíma: skrá gagnasafn fyrst, byrjandi frá training your first policy og desktop client. Ef þú mæta annan hundrað hreinum sýningum gegn byrjandi leiðréttingum: hreint sýningir gera ekki dreifingu vandamál. Fyrir vélbúnaðinn, halda með the human-gated variant og þá the SO-100 walkthrough.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started