Human-gated DAgger, frá A til Ö

Taktu yfir þegar policy fer úrskeiðis, og þjálfaðu hana svo á leiðréttingunni.

Policy sem er þjálfuð með Behavior Cloning þekkir aðeins þær stöður sem sýnidæmin þín heimsóttu. DAgger lokar því bili með gögnum úr þeim stöðum sem policy-n sjálf nær til. AY-Robots keyrir alla lotuna á SO-100: aktu checkpoint, taktu yfir miðja keyrslu, haltu leiðréttu þáttunum til haga, settu saman blönduna og haltu þjálfun áfram frá þeim checkpoint sem þú varst að aka.

  • HG-DAgger, human-gated
  • SO-100 / SO-101
  • ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
  • Íhlutunarhlutfall á hverja lotu

Af hverju þjálfuð policy gerir eitthvað sem aldrei var sýnt

Behavior Cloning meðhöndlar stýringu sem venjulegt leiðsagt nám: athugun inn, liðamarkmið út, mátað við rammana sem manneskja tók upp. Það stenst aðeins meðan róbótinn helst á þeim stöðum sem manneskjan heimsótti, og það gerir hann ekki. Griptöng sem lokast fjörutíu millisekúndum of snemma ýtir teningnum tveimur millimetrum úr sýndri stöðu. Næsta athugun er þá ein sem þjálfunarsafnið inniheldur ekki, svo aðgerðin þar er framreikningur, og staðan þar á eftir liggur enn fjær. Þjálfunardreifingin og dreifingin sem lærða policy-n framkallar í raun eru tvennt ólíkt, og sú síðari fjarlægist þá fyrri eftir því sem líður á þáttinn.

Ross, Gordon og Bagnell lýstu nákvæmlega þessu misheppnaða framsali árið 2011 og mátu tjónið: flokkari sem skjátlast með líkindum e undir dreifingu sérfræðingsins getur gert á stærðargráðunni T í öðru veldi sinnum e mistök yfir horf af T skrefum undir sinni eigin framkölluðu dreifingu, því eitt mistak framleiðir athuganir sem sérfræðingurinn framleiddi aldrei og villurnar hlaðast upp. Lausn þeirra er reikniritið sem þessi síða fjallar um: keyra núverandi policy, safna merkingum sérfræðings fyrir þær stöður sem hún heimsækir, leggja þær saman við allt sem safnað hefur verið hingað til, þjálfa aftur, endurtaka. Fleiri sýnidæmi af sömu gerð hjálpa ekki, því þau taka aftur úr sömu dreifingu. Merkingar á þeim stöðum sem policy-n sjálf nær til gera það. Útgáfan sem hér er útfærð er human-gated (HG-DAgger, Kelly o.fl.): policy-n heldur stjórninni þar til manneskja ákveður að hún sé að fara úrskeiðis og tekur yfir, svo leiðréttingar verða aðeins til þar sem þeirra er þörf, og arminum er aldrei att inn í stöðu sem stjórnandinn myndi ekki leyfa.

  • Behavior Cloning gildir aðeins á þeirri stöðudreifingu sem það var þjálfað á.
  • Villan magnar sjálfa sig upp: lítið frávik skapar óþekkta stöðu, sem skapar stærra frávik.
  • Mótefnið eru ekki fleiri sýnidæmi, heldur merkingar úr þeim stöðum sem policy-n sjálf nær til.
  • Human-gated þýðir að stjórnandinn ákveður hvenær gripið er inn, ekki sjálfvirkt vissumat.

Af hverju villan hleðst upp

Breyttu skrefafjöldanum með sleðanum. Undir Behavior Cloning vex væntur aukakostnaður u.þ.b. með öðru veldi skrefafjöldans, því sérhver villa framleiðir stöður sem sýnidæmin náðu aldrei yfir; söfnunarlota heldur vextinum nálægt línulegum vexti (Ross o.fl., 2011).

200
1.0 %
Behavior Cloning
400
DAgger
2.00
200×
Behavior Cloning ÷ DAgger
0.000100200300400050100150200Væntur aukakostnaður (efri mörk)
Tímalengd verkefnis (skref)

Sýnikúrfur út frá mörkunum í Ross o.fl. (2011), ekki mælingar af þínum róbóta. Það sem skiptir máli er lögun ferilsins, ekki tölurnar sjálfar.

Ein DAgger-lota í sex skrefum

Svona keyrir lotan raunverulega á vettvangnum, ekki sem skýringarmynd. Hvert skref hér að neðan samsvarar stýringu í stjórnborðinu.

Farðu í gegnum lotuna skref fyrir skref

Sömu sex skrefin, eitt í einu, með því sem gerist á arminum og í gagnasafninu í hverju þeirra.

01

Keyra policy og taka upp

Ræstu ályktunarkeyrslu gegn checkpoint sem þú hefur þjálfað sjálf(ur). Keyrslan er tekin upp á meðan hún gengur, með verkefnistexta keyrslunnar sjálfrar, svo rammarnir nýtist síðar sem þjálfunargögn í stað þess að vera myndband sem aðeins má horfa á.

1 af 6

Það sem vettvangurinn sér um fyrir þig

Hver liður hér er skref í lotunni sem þú þyrftir annars að byggja og viðhalda á eigin spýtur.

Yfirtaka án leader-arms

Veldu lyklaborð eða sleða sem inntak í upphafi keyrslu, og þá dugar fartölva ein til að leiðrétta. Lyklaborðshreyfingar eru takmarkaðar í netþjóninum við tvær gráður á lið og fjórar á griptönginni; sleðamarkmið eru alger og netþjónninn hreyfir sig að hámarki sex gráður í átt að þeim í hverri köllun. Takmörkin eru framfylgd af netþjóninum, ekki af viðmótinu, svo föst lyklaborðsnótubending getur ekki kastað arminum úr jafnvægi.

Fjarstýringarskjölin

Íhlutanir merktar fyrir hvern ramma

Sérhver rammi sem er tekinn upp meðan þú heldur um arminn ber íhlutunarmerki, og action-dálkurinn ber fulla skipaða stöðu. Þú þarft hvorki að viðhalda merkjadálki í höndunum né samræma hann við rammavísitölur eftir á.

LeRobot-gagnasafnssnið

Flokkun: leiðrétting, mat eða tunna

Hver keyrsla fær eina ákvörðun á vistunarspjaldinu. Leiðréttingarkeyrslur fæða næstu þjálfunarlotu, matskeyrslur haldast utan þjálfunar og verða þannig áfram hrein mæling, og misheppnaðar keyrslur hverfa í stað þess að spilla blöndunni í hljóði.

Setur og þættir

Blandan sett saman á skýran hátt

Þjálfunarsafn lotu n setur þú saman sjálf(ur): upprunalegt gagnasafn auk leiðréttinga, með þáttum valdum eftir uppruna. Engin sjálfvirk blöndun, engin falin hermigögn, og samsetta niðurstaðan hegðar sér eins og hvert annað gagnasafn.

Gagnasöfn

Halda áfram frá checkpoint

Beindu þjálfunarkeyrslu á checkpoint sem þú varst nýbúin(n) að aka, í stað grunnlíkansins, svo hver lota byrjar þar sem sú síðasta endaði. Aðeins vogtölurnar eru frumstilltar; staða bestunaraðferðarinnar (optimizer) er ekki endurheimt, og þess vegna borgar sig að meðhöndla fyrstu lotuna sem hagkvæmniprófun.

Þjálfun

GPU-tæki leigð fyrir hverja lotu

ACT og SmolVLA á 4090, Pi0 og GR00T N1.5 eða N1.7 á A100 með 80 GB. Þú ræsir lotu, pod fer í gang, checkpoint-ar lenda í bucket-inu þínu, og þú greiðir fyrir þær klukkustundir sem lotan tók.

GPU-verð

Skipuleggðu loturnar þínar

Íhlutunarhlutfall er framvindumælikvarði lotunnar: leiðréttir rammar deilt með römmum keyrslunnar. Stilltu hvar þú byrjar og hversu mikið hver lota skilar, og sjáðu hversu margar lotur þarf til að ná markmiðinu.

30 %
25 %
3 000
LotaÍhlutunarhlutfallLeiðréttir rammar
1
30.0%
900
2
22.5%
675
3
16.9%
506
4
12.7%
380
5
9.5%
285
6
7.1%
214
Σ2 960

Líkan, ekki spá. Alvöru lotur eru misjafnar, og lota sem hreyfir ekki hlutfallið hefur skilað engu; það er einmitt merkið sem borgar sig að fylgjast með.

Að byggja lotuna sjálf(ur) eða keyra hana hér

Ekkert af þessu er ómögulegt í höndunum. Þetta snýst um hve mörg kvöld fara í pípulagnir í stað í lotur, og það er ein lína þar sem eigin vinna er augljóslega betri svörun.

Skref lotunnarSett upp í höndunumÁ AY-Robots
Að taka yfir miðja keyrsluLeader-armur, eða eigin kóði á servó-rútunni. Lyklaborðs- og sleðayfirtaka, ásamt öruggum mörkum, er eitthvað sem þú skrifar og aflúsar svo á alvöru vélbúnaði.Leader-armur, lyklaborð eða sleðar, valið þegar keyrslan hefst. Hornatakmörkin búa í netþjóninum.
Að merkja íhlutanirÞú bætir við merkjadálki, heldur honum samræmdum við rammavísitöluna og athugar hann aftur í hvert sinn sem upptökusniðið breytist.Sérhver rammi sem tekinn er upp í yfirtöku er sjálfkrafa merktur, með skipaða stöðu í action-dálkinum.
Að flokka keyrslurnarMöppuvenjur og shell-skriftur. Frosnu rammana í kringum afhendingu þarft þú sjálf(ur) að finna og sía frá.Ein ákvörðun á keyrslu á vistunarspjaldinu. Afhendingarrammar haldast í raw-möppunni.
Að byggja blandaða gagnasafniðSamruna-skriftur fyrir hverja sniðútgáfu. Að halda þáttavísitölum, lýsigögnum og myndbandstilvísunum samræmdum er þreytandi vinnan.Sett saman úr upprunalegu auk leiðréttinga með þáttavali eftir uppruna; niðurstaðan er venjulegt gagnasafn.
Að byrja næstu lotu á síðustu policyÞú tengir checkpoint sjálf(ur) inn í þjálfarann, og getur líka endurheimt stöðu bestunaraðferðarinnar ef þú vilt raunverulegt framhald.Eitt reit fyrir grunn-checkpoint. Aðeins vogtölur: frumstillt frá checkpoint, ekki framhald bestunaraðferðar.
Stjórn yfir þjálfunarlotunniFull stjórn. Þitt tapfall, þín áætlun, þínar ablation-prófanir, þín mælitæki, ekkert kerfi í vegi. Ef rannsóknarspurningin er sjálf þjálfunarlotan, gerðu það í höndunum.Fastmótuð leið með föstum lista af policies og þeim yfirbreytum sem eyðublaðið býður upp á, ekki frjáls kóði.

Ritverkin sem þetta byggir á

Lestu þessi áður en þú deilir um lotuna. Hver tengill fer á útdráttarsíðuna, ekki á bak við greiðsluvegg.

  1. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning

    Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)

    Upprunalega DAgger-greinin: hún setur fram vandamál uppsafnaðrar villu, gefur T-í-öðru-veldi mörkin fyrir hreina leiðsagða aðferð, og leggur til að safna gögnum úr þeim stöðum sem nemandinn sjálfur heimsækir.

  2. HG-DAgger: Interactive Imitation Learning with Human Experts

    Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019

    Human-gated útgáfan: sérfræðingurinn ákveður hvenær hann tekur við stjórn í stað þess að vera spurður um stöður sem policy-n valdi; þetta er sá háttur sem þessi vettvangur útfærir.

  3. EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning

    Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019

    Hin leiðin til að stýra íhlutunum: ósamræmi milli líkana í hópi (ensemble) sem vissumerki fyrir hvenær nemandinn má athafna sig einn. Gagnlegur andstæðupunktur við að láta manneskju dæma það.

  4. ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning

    Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021

    Meðhöndlar athygli mannsins sem takmarkaða auðlind og biður aðeins um hjálp í nýjum eða áhættusömum stöðum, sem er rétta nálgunin þegar ein manneskja hefur umsjón með arminum heilan eftirmiðdag.

  5. DART: Noise Injection for Robust Imitation Learning

    Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017

    Heiðarlegi kosturinn: í stað þess að leiðrétta policy-na í rauntíma, er sýnidæmunum raskað svo sérfræðingurinn sýni bataferli. Vert að þekkja áður en maður skuldbindur sig til íhlutana.

  6. Interactive Imitation Learning in Robotics: A Survey

    Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600

    Landakort fræðasviðsins: hvaða form mannlegrar endurgjafar eru til, hvaða viðmót flytja þau, og hvar íhlutun í DAgger-stíl stendur á meðal þeirra.

  7. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

    Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705

    ACT-greinin. Action chunking er ástæðan fyrir því að ódýr armur getur yfirhöfuð verið keyrður af eftirlíkingar-policy, og ACT er sú policy sem hraðast er að endurtaka DAgger-lotu með.

  8. π0: A Vision-Language-Action Flow Model for General Robot Control

    Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164

    VLA byggt á flow matching ofan á forþjálfað sjón-mál-líkan, og einn af þeim checkpoint-um sem þú getur fínstillt hér; greinin segir berum orðum að ný færni komi úr fínstillingu, ekki úr grunnlíkaninu einu og sér.

Spurningar sem fólk spyr í raun

Þarf ég leader-arm fyrir DAgger?

Nei. Veldu lyklaborð eða sleða sem inntak þegar keyrslan hefst, og þá er yfirtakan handvirk frá fyrsta ramma, stýrt úr vafranum. Leader-armur er þægilegri fyrir fínar hreyfingar, og er sá háttur þar sem armurinn samræmir sig sjálfur áður en hann afhendir, en lotan gengur líka án hans.

Hversu margar DAgger-lotur þarf ég?

Það er engin heiðarleg föst tala til. Fylgstu með íhlutunarhlutfallinu: falli það ekki frá einni lotu til þeirrar næstu, skilaði sú lota engu, og orsökin liggur oftast í uppsetningu verkefnisins, myndavélunum eða upprunalega gagnasafninu frekar en fjölda lota.

Er þetta alvöru DAgger eða eitthvað lauslegra?

Þetta er HG-DAgger, human-gated útgáfan. Klassískt DAgger spyr sérfræðinginn um stöður sem policy-n valdi, þar á meðal stöður sem enginn heilvita stjórnandi myndi leyfa raunverulegum armi að ná til. Hér ákveður manneskja hvenær er gripið inn, og aðeins þau brot verða að merkingum.

Þjálfa ég aðeins á leiðréttingunum?

Nei, og það ætti ekki að gera. Að þjálfa eingöngu á leiðréttingum gefur policy sem kann aðeins að bjarga sér til baka. Samsetta gagnasafnið er upprunalegu gögnin auk leiðréttinganna, með þáttum frá hverjum uppruna valdum meðvitað.

Heldur „halda áfram frá checkpoint" þjálfunarkeyrslunni sjálfri áfram?

Það frumstillir vogtölurnar úr þeim checkpoint. Staða bestunaraðferðarinnar er ekki endurheimt, svo í ströngum skilningi er þetta ekki framhald. Í reynd eru það vogtölurnar sem bera lærða hegðun áfram milli lota, en það er vert að vita hvort af þessu tvennu maður er í raun að fá.

Hvernig er íhlutunarhlutfallið reiknað?

Rammar merktir sem íhlutun deilt með heildarfjölda ramma í keyrslunni. Það birtist í yfirtökustöðunni, og er sú eina tala sem borgar sig að skrá niður fyrir hverja lotu, ásamt þeim checkpoint sem ekið var og þeirri blöndu sem þjálfað var á.

Með hvaða policies get ég keyrt þessa lotu?

ACT, SmolVLA, Pi0, og GR00T N1.5 eða N1.7. Lotan sjálf er óháð policy því hún framleiðir aðeins gagnasöfn og checkpoint-a; hagnýti munurinn liggur í því hversu lengi lota tekur og hvaða GPU hún þarf.

Get ég gert þetta án þess að eiga róbóta?

Þú getur tekið upp og þjálfað án róbóta með því að kaupa gagnasöfn á markaðstorginu eða fá stjórnendur til verksins, og þú getur ekið alvöru SO-100 í vafranum á live-síðunni. DAgger-lota er annað mál: hún þarf arm sem þú getur tekið yfir miðja keyrslu, svo fyrir lotuna sjálfa þarftu vélbúnað á eigin borði.

Drive a real arm

A real SO-100, live in the browser. No signup, no hardware needed.

Keyrðu fyrstu lotuna þína í þessari viku

Settu upp forritið, aktu checkpoint sem þú átt nú þegar, og taktu yfir í fyrsta sinn sem armurinn teygir sig framhjá teningnum. Sú eina keyrsla er DAgger-lota í smækkaðri mynd: allt sem á eftir kemur er að setja saman blönduna og greiða fyrir GPU-tímana.