Taktu yfir þegar policy fer úrskeiðis, og þjálfaðu hana svo á leiðréttingunni.
Policy sem er þjálfuð með Behavior Cloning þekkir aðeins þær stöður sem sýnidæmin þín heimsóttu. DAgger lokar því bili með gögnum úr þeim stöðum sem policy-n sjálf nær til. AY-Robots keyrir alla lotuna á SO-100: aktu checkpoint, taktu yfir miðja keyrslu, haltu leiðréttu þáttunum til haga, settu saman blönduna og haltu þjálfun áfram frá þeim checkpoint sem þú varst að aka.
- HG-DAgger, human-gated
- SO-100 / SO-101
- ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
- Íhlutunarhlutfall á hverja lotu
Af hverju þjálfuð policy gerir eitthvað sem aldrei var sýnt
Behavior Cloning meðhöndlar stýringu sem venjulegt leiðsagt nám: athugun inn, liðamarkmið út, mátað við rammana sem manneskja tók upp. Það stenst aðeins meðan róbótinn helst á þeim stöðum sem manneskjan heimsótti, og það gerir hann ekki. Griptöng sem lokast fjörutíu millisekúndum of snemma ýtir teningnum tveimur millimetrum úr sýndri stöðu. Næsta athugun er þá ein sem þjálfunarsafnið inniheldur ekki, svo aðgerðin þar er framreikningur, og staðan þar á eftir liggur enn fjær. Þjálfunardreifingin og dreifingin sem lærða policy-n framkallar í raun eru tvennt ólíkt, og sú síðari fjarlægist þá fyrri eftir því sem líður á þáttinn.
Ross, Gordon og Bagnell lýstu nákvæmlega þessu misheppnaða framsali árið 2011 og mátu tjónið: flokkari sem skjátlast með líkindum e undir dreifingu sérfræðingsins getur gert á stærðargráðunni T í öðru veldi sinnum e mistök yfir horf af T skrefum undir sinni eigin framkölluðu dreifingu, því eitt mistak framleiðir athuganir sem sérfræðingurinn framleiddi aldrei og villurnar hlaðast upp. Lausn þeirra er reikniritið sem þessi síða fjallar um: keyra núverandi policy, safna merkingum sérfræðings fyrir þær stöður sem hún heimsækir, leggja þær saman við allt sem safnað hefur verið hingað til, þjálfa aftur, endurtaka. Fleiri sýnidæmi af sömu gerð hjálpa ekki, því þau taka aftur úr sömu dreifingu. Merkingar á þeim stöðum sem policy-n sjálf nær til gera það. Útgáfan sem hér er útfærð er human-gated (HG-DAgger, Kelly o.fl.): policy-n heldur stjórninni þar til manneskja ákveður að hún sé að fara úrskeiðis og tekur yfir, svo leiðréttingar verða aðeins til þar sem þeirra er þörf, og arminum er aldrei att inn í stöðu sem stjórnandinn myndi ekki leyfa.
- Behavior Cloning gildir aðeins á þeirri stöðudreifingu sem það var þjálfað á.
- Villan magnar sjálfa sig upp: lítið frávik skapar óþekkta stöðu, sem skapar stærra frávik.
- Mótefnið eru ekki fleiri sýnidæmi, heldur merkingar úr þeim stöðum sem policy-n sjálf nær til.
- Human-gated þýðir að stjórnandinn ákveður hvenær gripið er inn, ekki sjálfvirkt vissumat.
Af hverju villan hleðst upp
Breyttu skrefafjöldanum með sleðanum. Undir Behavior Cloning vex væntur aukakostnaður u.þ.b. með öðru veldi skrefafjöldans, því sérhver villa framleiðir stöður sem sýnidæmin náðu aldrei yfir; söfnunarlota heldur vextinum nálægt línulegum vexti (Ross o.fl., 2011).
Sýnikúrfur út frá mörkunum í Ross o.fl. (2011), ekki mælingar af þínum róbóta. Það sem skiptir máli er lögun ferilsins, ekki tölurnar sjálfar.
Ein DAgger-lota í sex skrefum
Svona keyrir lotan raunverulega á vettvangnum, ekki sem skýringarmynd. Hvert skref hér að neðan samsvarar stýringu í stjórnborðinu.
Farðu í gegnum lotuna skref fyrir skref
Sömu sex skrefin, eitt í einu, með því sem gerist á arminum og í gagnasafninu í hverju þeirra.
Keyra policy og taka upp
Ræstu ályktunarkeyrslu gegn checkpoint sem þú hefur þjálfað sjálf(ur). Keyrslan er tekin upp á meðan hún gengur, með verkefnistexta keyrslunnar sjálfrar, svo rammarnir nýtist síðar sem þjálfunargögn í stað þess að vera myndband sem aðeins má horfa á.
Taka yfir og leiðrétta
Um leið og armurinn gerir eitthvað rangt: ýttu á Taka yfir. Keyrsluvélin gerir hlé og armurinn er þinn. Með leader-armi ekur hann fyrst á follower-stöðuna og afhendir svo; með lyklaborði eða sleða sem inntak, valið í upphafi keyrslunnar, er yfirtakan handvirk samstundis. Leiðréttu hreyfinguna, gefðu svo stjórnina aftur til policy-nnar. Rammar sem teknir eru upp meðan á yfirtöku stendur eru sjálfkrafa merktir sem íhlutun.
Sigta keyrsluna
Ákveddu fyrir hverja keyrslu hvað hún var: skráðu hana sem leiðréttingu, haltu henni sem matskeyrslu, eða fleygðu henni. Frosnu rammarnir í kringum afhendingu haldast í raw-möppunni og fara aldrei í gagnasafnið.
Samstilla leiðréttingargagnasafnið
Leiðréttingar safnast í sérstakt gagnasafn fyrir hverja policy og fara í bucket-ið þitt gegnum sjálfvirku skýjasamstillinguna. Á þessu stigi er engu blandað saman; leiðréttingarnar eru einfaldlega sitt eigið gagnasafn.
Setja blönduna saman sjálf(ur)
Notaðu Setja saman gagnasafn til að byggja þjálfunarsafn næstu lotu: upprunalega gagnasafnið auk leiðréttinganna, með þáttum valdum meðvitað eftir uppruna. Niðurstaðan er venjulegt gagnasafn sem samstillist og þjálfast eins og hvert annað. Engu er laumað inn í bakgrunni, og engin hermigögn bætast við sjálfkrafa.
Halda þjálfun áfram frá checkpoint
Þjálfaðu samsetta gagnasafnið með Halda áfram frá checkpoint í stað þess að byrja á grunnlíkaninu, svo lotan byrji á þeirri policy sem þú varst rétt í þessu að aka. Nákvæmlega sagt: þetta frumstillir vogtölurnar úr þeim checkpoint, þetta er ekki framhald bestunaraðferðar (optimizer resume).
Það sem vettvangurinn sér um fyrir þig
Hver liður hér er skref í lotunni sem þú þyrftir annars að byggja og viðhalda á eigin spýtur.
Yfirtaka án leader-arms
Veldu lyklaborð eða sleða sem inntak í upphafi keyrslu, og þá dugar fartölva ein til að leiðrétta. Lyklaborðshreyfingar eru takmarkaðar í netþjóninum við tvær gráður á lið og fjórar á griptönginni; sleðamarkmið eru alger og netþjónninn hreyfir sig að hámarki sex gráður í átt að þeim í hverri köllun. Takmörkin eru framfylgd af netþjóninum, ekki af viðmótinu, svo föst lyklaborðsnótubending getur ekki kastað arminum úr jafnvægi.
FjarstýringarskjölinÍhlutanir merktar fyrir hvern ramma
Sérhver rammi sem er tekinn upp meðan þú heldur um arminn ber íhlutunarmerki, og action-dálkurinn ber fulla skipaða stöðu. Þú þarft hvorki að viðhalda merkjadálki í höndunum né samræma hann við rammavísitölur eftir á.
LeRobot-gagnasafnssniðFlokkun: leiðrétting, mat eða tunna
Hver keyrsla fær eina ákvörðun á vistunarspjaldinu. Leiðréttingarkeyrslur fæða næstu þjálfunarlotu, matskeyrslur haldast utan þjálfunar og verða þannig áfram hrein mæling, og misheppnaðar keyrslur hverfa í stað þess að spilla blöndunni í hljóði.
Setur og þættirBlandan sett saman á skýran hátt
Þjálfunarsafn lotu n setur þú saman sjálf(ur): upprunalegt gagnasafn auk leiðréttinga, með þáttum valdum eftir uppruna. Engin sjálfvirk blöndun, engin falin hermigögn, og samsetta niðurstaðan hegðar sér eins og hvert annað gagnasafn.
GagnasöfnHalda áfram frá checkpoint
Beindu þjálfunarkeyrslu á checkpoint sem þú varst nýbúin(n) að aka, í stað grunnlíkansins, svo hver lota byrjar þar sem sú síðasta endaði. Aðeins vogtölurnar eru frumstilltar; staða bestunaraðferðarinnar (optimizer) er ekki endurheimt, og þess vegna borgar sig að meðhöndla fyrstu lotuna sem hagkvæmniprófun.
ÞjálfunGPU-tæki leigð fyrir hverja lotu
ACT og SmolVLA á 4090, Pi0 og GR00T N1.5 eða N1.7 á A100 með 80 GB. Þú ræsir lotu, pod fer í gang, checkpoint-ar lenda í bucket-inu þínu, og þú greiðir fyrir þær klukkustundir sem lotan tók.
GPU-verðSkipuleggðu loturnar þínar
Íhlutunarhlutfall er framvindumælikvarði lotunnar: leiðréttir rammar deilt með römmum keyrslunnar. Stilltu hvar þú byrjar og hversu mikið hver lota skilar, og sjáðu hversu margar lotur þarf til að ná markmiðinu.
| Lota | Íhlutunarhlutfall | Leiðréttir rammar |
|---|---|---|
| 1 | 30.0 % | 900 |
| 2 | 22.5 % | 675 |
| 3 | 16.9 % | 506 |
| 4 | 12.7 % | 380 |
| 5 | 9.5 % | 285 |
| 6 | 7.1 % | 214 |
| Σ | 2 960 | |
Líkan, ekki spá. Alvöru lotur eru misjafnar, og lota sem hreyfir ekki hlutfallið hefur skilað engu; það er einmitt merkið sem borgar sig að fylgjast með.
Að byggja lotuna sjálf(ur) eða keyra hana hér
Ekkert af þessu er ómögulegt í höndunum. Þetta snýst um hve mörg kvöld fara í pípulagnir í stað í lotur, og það er ein lína þar sem eigin vinna er augljóslega betri svörun.
| Skref lotunnar | Sett upp í höndunum | Á AY-Robots |
|---|---|---|
| Að taka yfir miðja keyrslu | Leader-armur, eða eigin kóði á servó-rútunni. Lyklaborðs- og sleðayfirtaka, ásamt öruggum mörkum, er eitthvað sem þú skrifar og aflúsar svo á alvöru vélbúnaði. | Leader-armur, lyklaborð eða sleðar, valið þegar keyrslan hefst. Hornatakmörkin búa í netþjóninum. |
| Að merkja íhlutanir | Þú bætir við merkjadálki, heldur honum samræmdum við rammavísitöluna og athugar hann aftur í hvert sinn sem upptökusniðið breytist. | Sérhver rammi sem tekinn er upp í yfirtöku er sjálfkrafa merktur, með skipaða stöðu í action-dálkinum. |
| Að flokka keyrslurnar | Möppuvenjur og shell-skriftur. Frosnu rammana í kringum afhendingu þarft þú sjálf(ur) að finna og sía frá. | Ein ákvörðun á keyrslu á vistunarspjaldinu. Afhendingarrammar haldast í raw-möppunni. |
| Að byggja blandaða gagnasafnið | Samruna-skriftur fyrir hverja sniðútgáfu. Að halda þáttavísitölum, lýsigögnum og myndbandstilvísunum samræmdum er þreytandi vinnan. | Sett saman úr upprunalegu auk leiðréttinga með þáttavali eftir uppruna; niðurstaðan er venjulegt gagnasafn. |
| Að byrja næstu lotu á síðustu policy | Þú tengir checkpoint sjálf(ur) inn í þjálfarann, og getur líka endurheimt stöðu bestunaraðferðarinnar ef þú vilt raunverulegt framhald. | Eitt reit fyrir grunn-checkpoint. Aðeins vogtölur: frumstillt frá checkpoint, ekki framhald bestunaraðferðar. |
| Stjórn yfir þjálfunarlotunni | Full stjórn. Þitt tapfall, þín áætlun, þínar ablation-prófanir, þín mælitæki, ekkert kerfi í vegi. Ef rannsóknarspurningin er sjálf þjálfunarlotan, gerðu það í höndunum. | Fastmótuð leið með föstum lista af policies og þeim yfirbreytum sem eyðublaðið býður upp á, ekki frjáls kóði. |
Ritverkin sem þetta byggir á
Lestu þessi áður en þú deilir um lotuna. Hver tengill fer á útdráttarsíðuna, ekki á bak við greiðsluvegg.
- A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)
Upprunalega DAgger-greinin: hún setur fram vandamál uppsafnaðrar villu, gefur T-í-öðru-veldi mörkin fyrir hreina leiðsagða aðferð, og leggur til að safna gögnum úr þeim stöðum sem nemandinn sjálfur heimsækir.
- HG-DAgger: Interactive Imitation Learning with Human Experts
Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019
Human-gated útgáfan: sérfræðingurinn ákveður hvenær hann tekur við stjórn í stað þess að vera spurður um stöður sem policy-n valdi; þetta er sá háttur sem þessi vettvangur útfærir.
- EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning
Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019
Hin leiðin til að stýra íhlutunum: ósamræmi milli líkana í hópi (ensemble) sem vissumerki fyrir hvenær nemandinn má athafna sig einn. Gagnlegur andstæðupunktur við að láta manneskju dæma það.
- ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021
Meðhöndlar athygli mannsins sem takmarkaða auðlind og biður aðeins um hjálp í nýjum eða áhættusömum stöðum, sem er rétta nálgunin þegar ein manneskja hefur umsjón með arminum heilan eftirmiðdag.
- DART: Noise Injection for Robust Imitation Learning
Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017
Heiðarlegi kosturinn: í stað þess að leiðrétta policy-na í rauntíma, er sýnidæmunum raskað svo sérfræðingurinn sýni bataferli. Vert að þekkja áður en maður skuldbindur sig til íhlutana.
- Interactive Imitation Learning in Robotics: A Survey
Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600
Landakort fræðasviðsins: hvaða form mannlegrar endurgjafar eru til, hvaða viðmót flytja þau, og hvar íhlutun í DAgger-stíl stendur á meðal þeirra.
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705
ACT-greinin. Action chunking er ástæðan fyrir því að ódýr armur getur yfirhöfuð verið keyrður af eftirlíkingar-policy, og ACT er sú policy sem hraðast er að endurtaka DAgger-lotu með.
- π0: A Vision-Language-Action Flow Model for General Robot Control
Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164
VLA byggt á flow matching ofan á forþjálfað sjón-mál-líkan, og einn af þeim checkpoint-um sem þú getur fínstillt hér; greinin segir berum orðum að ný færni komi úr fínstillingu, ekki úr grunnlíkaninu einu og sér.
Spurningar sem fólk spyr í raun
Þarf ég leader-arm fyrir DAgger?
Nei. Veldu lyklaborð eða sleða sem inntak þegar keyrslan hefst, og þá er yfirtakan handvirk frá fyrsta ramma, stýrt úr vafranum. Leader-armur er þægilegri fyrir fínar hreyfingar, og er sá háttur þar sem armurinn samræmir sig sjálfur áður en hann afhendir, en lotan gengur líka án hans.
Hversu margar DAgger-lotur þarf ég?
Það er engin heiðarleg föst tala til. Fylgstu með íhlutunarhlutfallinu: falli það ekki frá einni lotu til þeirrar næstu, skilaði sú lota engu, og orsökin liggur oftast í uppsetningu verkefnisins, myndavélunum eða upprunalega gagnasafninu frekar en fjölda lota.
Er þetta alvöru DAgger eða eitthvað lauslegra?
Þetta er HG-DAgger, human-gated útgáfan. Klassískt DAgger spyr sérfræðinginn um stöður sem policy-n valdi, þar á meðal stöður sem enginn heilvita stjórnandi myndi leyfa raunverulegum armi að ná til. Hér ákveður manneskja hvenær er gripið inn, og aðeins þau brot verða að merkingum.
Þjálfa ég aðeins á leiðréttingunum?
Nei, og það ætti ekki að gera. Að þjálfa eingöngu á leiðréttingum gefur policy sem kann aðeins að bjarga sér til baka. Samsetta gagnasafnið er upprunalegu gögnin auk leiðréttinganna, með þáttum frá hverjum uppruna valdum meðvitað.
Heldur „halda áfram frá checkpoint" þjálfunarkeyrslunni sjálfri áfram?
Það frumstillir vogtölurnar úr þeim checkpoint. Staða bestunaraðferðarinnar er ekki endurheimt, svo í ströngum skilningi er þetta ekki framhald. Í reynd eru það vogtölurnar sem bera lærða hegðun áfram milli lota, en það er vert að vita hvort af þessu tvennu maður er í raun að fá.
Hvernig er íhlutunarhlutfallið reiknað?
Rammar merktir sem íhlutun deilt með heildarfjölda ramma í keyrslunni. Það birtist í yfirtökustöðunni, og er sú eina tala sem borgar sig að skrá niður fyrir hverja lotu, ásamt þeim checkpoint sem ekið var og þeirri blöndu sem þjálfað var á.
Með hvaða policies get ég keyrt þessa lotu?
ACT, SmolVLA, Pi0, og GR00T N1.5 eða N1.7. Lotan sjálf er óháð policy því hún framleiðir aðeins gagnasöfn og checkpoint-a; hagnýti munurinn liggur í því hversu lengi lota tekur og hvaða GPU hún þarf.
Get ég gert þetta án þess að eiga róbóta?
Þú getur tekið upp og þjálfað án róbóta með því að kaupa gagnasöfn á markaðstorginu eða fá stjórnendur til verksins, og þú getur ekið alvöru SO-100 í vafranum á live-síðunni. DAgger-lota er annað mál: hún þarf arm sem þú getur tekið yfir miðja keyrslu, svo fyrir lotuna sjálfa þarftu vélbúnað á eigin borði.
A real SO-100, live in the browser. No signup, no hardware needed.
Keyrðu fyrstu lotuna þína í þessari viku
Settu upp forritið, aktu checkpoint sem þú átt nú þegar, og taktu yfir í fyrsta sinn sem armurinn teygir sig framhjá teningnum. Sú eina keyrsla er DAgger-lota í smækkaðri mynd: allt sem á eftir kemur er að setja saman blönduna og greiða fyrir GPU-tímana.