Rekstraraðili hefur eftirlit með vélmenniarm um fjartækaðar tengingar, hendur á stýringum og tilbúinn til að taka yfir
DAggerGagnvirk Imitation LearningHG-DAggerRobot PoliciesSO-100

HG-DAgger og Gated Variants: Hver ákveður hvenær á að taka stjórn á Robot Policy

AY-Robots ResearchAugust 27, 202615 mín lesning

Venjuleg DAgger biður manneskju um að merkja tilstæður meðan vélmenni er enn að keyra. Á raunvélbúnaði er það óöruggt og framleiðir slæm merki. Gated variantirnir skipta blindri merkingu út fyrir port sem einhver verður að halda: manneskjan í HG-DAgger, öryggisflokkunar í SafeDAgger, ósamþykki samnets í EnsembleDAgger, takmörkuð nýjungs- og áhættumat í ThriftyDAgger. Þessi grein ber þær saman eftir því hver á portið, hvaða merki opnar það og hvað hver og ein kostar — og af hverju mannlega stýrða formið er það sem lifir sambandi við raunverulegan arm.

Klónaða policy bitur þar sem þjálfunargögn kljaðust. Leysingin er að halda áfram að safna gögnum undir eigin tilstöðudreifingu policyins í stað dreifingar sýnishornaflokks, sem er það sem DAgger gerir og hvað the introduction to dataset aggregation nær frá fyrstu meginreglum. Það skilur eftir opið óþægilega hlutann í upprunalega reikniriti: meðan námunum stýrir, á sérfræðingur að segja hvað hann væri gert, fyrir hverja tilstöðu, án þess að vera við stjórnunina.

Í eftirlíkingu með handritað sérfræðingi sem er ókeypis. Á borði með raunvirkum arm er það hvorki ókeypis né öruggt. HG-DAgger höfundar tilgreindu andmælin nákvæmlega: slík sýnishornakerfi krefjast þess að sérfræðingur veiti aðgerðamerki án þess að hafa fulla stjórn á kerfinu, sem getur minnkað öryggið og, þegar menn eru notaðir sem sérfræðingar, munar til þess að slæma gæði innsamlaðra merkja vegna skynjunar dræggis á stýringu (Kelly et al., 2019). Tvær villur felast í þeirri setningu: policyið heldur áfram að keyra inn í tilstæður sem enginn vill að það gangi inn, og merkirnir sem keyptir eru með þeirri áhættu eru verri en þeir sem manneskja framleiðir meðan hún heldur stýringum. Hver útfærsla hér að neðan svarar sömu spurningu — settu port á stjórnun og leyfðu einhverjum að ákveða hvenær það opnast. Þeir eru ólíkir í því hver á portið.

Stutt útgáfa

  • Gated variantirnir skipta blindri merkingu út fyrir rofa á milli policyreglu og sérfræðingastýringar. Það sem skilur þá aðskilur er hver á rofanum.
  • HG-DAgger gefur rofann manneskjunni og safnar aðeins gögnum skráðum meðan manneskjan hafði óhindraða stjórn.
  • SafeDAgger gefur hann tvíundinni flokkunar sem spáir fyrir um frávik frá tilvísunarpolicy; EnsembleDAgger krefst lágrar sameindalikinda og lítils fjarlægðar til aðgerðar sérfræðings á sama tíma.
  • LazyDAgger bætir geymdri þannig að stjórnun hoppar ekki fram og til baka; ThriftyDAgger opnir á nýjung eða metnu áhættu undir skýrri inngripahámarksáætlun.
  • Robot-gated merki þarfnast eitthvað sem fín-skipulagðar VLA á áhugamanna-klassa vélmenni vantar venjulega: tilvísunarpolicy, ódýr samnet eða kvörðuð epistemic óvissa.
  • Portið er helmingur aðferðarinnar. Það sem gerist við inngripahluta síðar — blöndun, vægi, samansöfnun — ákveður hvort umferðin bætti eitthvað.

Mannleg og vélmennisgetstýrð: skiptingin sem skiptir máli

Gagnvirk imitation learning hefur eigin könnun; Celemin og samstarfsmenn skrá það eftir gerð endurvinnslu, viðmótum, námukerfi, notendum upplifun, forriti og viðmiðum. Aðgreiningin sem ákvarðar þjóðkerfið er einfaldari en einhver þessara ása og nýleg verk nefnir það beint: aðferð er mannleg-getstýrð þegar umsjónarmaðurinn ákveður hvenær á að grípa inn og vélmennisgetstýrð þegar umboðið ákveður hvenær á að biðja um aðstoð (Cai et al., 2025). Allt annað er gagnvirkni sem þjónar einni af þeim tveimur vali. Verslagið er sýnilegt frá byrjun: mannlegt port kostar stöðuga athygli og vélmennisport lofar að gefa þá athygli til baka — en aðeins ef merkið sem það opnar er áreiðanlegt og að byggja það merki er sitt eigið rannsóknarvandamál.

SafeDAgger: flokkunar sem spáir fyrir um sitt eigið frávik

Zhang og Cho's SafeDAgger (2016) er fyrsta af þessum portum. Að spyrja tilvísunarpolicy er dýri hlutinn, svo annað lítið net — öryggispolicyn — spáir fyrir um hvort það sé þess virði á yfirleitt að spyrja. Það skilar tvíundinni merkingu sem gefur til kynna hvort aðalpolicy er líklegt til að víkja frá tilvísunarpolicy án þess að spyrja hinn. Merkið er skilgreint gegn þeirri veldri L2 fráviki á milli aðgerða beggja policya með þverskurði tau og flokkunarinn er stilltur með tvívídri gatna-entropy. Á keyrslutíma ákveðu hún á tilstöðu hvort námunum heldur áfram að keyra eða tilvísun tekur við. Útdrátturinn tilgreinir færri tilvísunarmöt í bílkappakstri eftirlíkingu plús flýtivægi flýtis sem höfundar rekja til sjálfvirkrar námferls-áhrifa án þess að gefa tölu fyrir hvorugum.

Flámálið er í skilgreiningu, ekki niðurstöðum. Þjálfun flokkunarins krefst aðgerðar tilvísunarpolicy á hverri tilstöðu sem notuð er til að passa hann sem gerir ráð fyrir að tilvísun sé annað forrit. Ef tilvísunin þín er manneskja með leiðar-arm, þá merki sett er ekki ódýrt og aðferðin missir þann eiginleika sem henni var hannað fyrir.

EnsembleDAgger: efazlun og misbreyting, báðar

Menda, Driggs-Campbell og Kochenderfer (2019) meðhöndla portið sem líkindaspurning. EnsembleDAgger nálgast Gauss-ferli með samnetum neural net og les samnetafrávikið sem trausts fulltrúi: há dreifni þýðir svæði ólíkt þjálfunargögnum sem — miðað við að sérfræðingur komist fram úr bilunartilstöðum — hefur tilefni með nálægð að bilun. Reglan er samtenging. Námunum má aðeins vera þegar L2 fjarlægð á milli meðal-aðgerðar hans og aðgerðar sérfræðings helst undir einni þverskurði (misbreyting) og frávikið af spáðri aðgerð hans helst undir annarri (efazlun). Ef önnur brjótir, sérfræðingur tekur stjórn. Markmiðið er að hámarka hlut námunaðins á aðgerðum á meðan þvinguð er líkindum bilun; ritið gefur til kynna bætta öryggis og námungs á móti öðrum DAgger-útfærslum á öfugri pendúl og MuJoCo HalfCheetah.

Misbreyting hugtakið þarf aðgerð sérfræðings

Þetta stillir þögult burt alla regluna fyrir handfrey umsjón. Fjarlægð á milli aðgerðar námunaðins og aðgerðar sérfræðings krefst aðgerðar sérfræðings á þeirri tilstöðu, á því augnabliki. Með handritað sérfræðing, engu máli. Með manneskju verður manneskjan að framleiða aðgerðir stöðugt — einmitt sú byrði sem gated variantirnir áttu ætlað að fjarlægja. Doubt-hugtakið ein-er handfrey; samatengningin er ekki.

LazyDAgger: stöðvað rofann frá því að mella

Hoque og samstarfsmenn (2021) börðu á kostnaði sem fyrri ritskrifirnar mældu ekki: rofinn sjálf. Hvert inngrap truflar aðra vinnu sem manneskjan er að gera, hefur dræg með hverju samhengi skipti milli umsjónarmanns og sjálfstæðs stýringu og krefst tíma til að framkvæma. Port sem opnar og lokar tíu sinnum á mínútu er verra en sem opnar einu sinni í tíu sekúndur, á óbreyttri sjálfstæðu hlut. LazyDAgger útvíkkar SafeDAgger með ósamhverfum þverskurðum — erfiðara að fara inn í umsjónastýringu en að vera áfram henni — svo kerfið sveiflist ekki við landamærin. Í eftirlíkingu það getur minnkað samhengi skipti um að meðaltali 60% yfir SafeDAgger á 3 samfelldri stýringu verkum meðan aðalpólítík árangur helst óbreytt; í þokumeðhöndlun með ABB YuMi það minnkar samhengi skipti um 60% meðan ná 60% hærri árangri hlutfall en SafeDAgger á keyrslu tíma.

ThriftyDAgger: nýjung eða áhætta, undir hámarksáætlun

ThriftyDAgger (Hoque et al., CoRL 2021) byrjar frá hámarksáætlun umsjónarmanns frekar en policyins. Það notar lærðan rofapolicy til að biðja aðeins um inngripn á tilstöðum sem eru nægilega (1) nýjar, þar sem vélmennispolicy hefur ekkert tilvísunarbágindi til að herma eða (2) áhættusöm, þar sem vélmenni hefur lítið traust á verkefnum lokun, með nýrri mælikvarðinn fyrir að áætla þá áhættu. Hámarkið er inntak, ekki framlegð: þú tilgreinir hversu mikinn tíma manneskju þú munt eyða. Notað á keyrslu tíma aðferðin nær 100% árangri hlutfall á bæði eftirlíkingu og eðlislegum verkum og notandi rannsókn með tíu þátttakendum stýringu þriggja vélmennaflota við hlið styrkleika verkefnis tilkynni að það eykur mannleg og vélmennisárangur um 58% og 80% ítarlega samanber næsta best reiknirit meðan það minnkar umsjónastöð byrði. Floti stillingu er náttúrlegur heimkynni fyrir þetta verk; Fleet-DAgger seinna formlegt gagnvirk floti nám með mörgum vélmennum og umsjónarfólki, stungið upp á Return on Human Effort sem magnið til að fínstilla.

HG-DAgger: manneskjan heldur portinu

Kelly et al. (2019) fara aðra leiðina. Það er enginn rofapolicy. Námunum er elt út þar til sérfræðingur sér að nýlungi er farið inn í óörugga svæði tilstöðu rýmisins, á þeim tímapunkti sérfræðingur tekur stjórn og stýrir kerfinu til baka. Samansöfnun reglan er strangur hlutinn: Sérfræðinga aðgerðamerki eru aðeins söfnuð og bætt við gagnasafn meðan þessir endurheimtar leiðir, sem á manneskjan sérfræðingur hafði óhindraða stjórn á kerfinu. Ekkert er merkt meðan manneskjan er áhorfandi.

Það stöðvast ekki við rofann. HG-DAgger líka lærir öryggis þverskurð fyrir líkindamóti-byggt áhættu mæling sem er hægt að nota til að spá fyrir um frammistaðu fullþjálfaðs nýlings í ólíkum svæðum tilstöðu rýmisins: það skrár hversu óviss námunan var á augnablikum manneskjan greip inn og meðaltöl síðasta fertungi þessara skráninga, þar sem námunan líkist flestum lokamynd sinni. Það er ekki port sem vélmenni lætur á rekstri en ábending sem segir þér hvar lokinn policyð er búist við að halda. Matið nær til eftirlíkðu og raunheims akstur verkefna og tilkynna bætta frammistaðu yfir bæði DAgger og hegðun klóning.

Ein skyldu lína breytir því hvað telst sem merki. Spencer og samstarfsmenn's Expert Intervention Learning segir að hvers konar sérfræðing endurgjöf, hvort sem með inngripn eða ekki-inngripn gefir upplýsingar um gæði núverandi tilstöðu, bestu-auknar aðgerðar eða báðar, formlega sem þvingun á virðismati námunaðins og leyst með engar-eftirsjá netum nám. Undir því lesning, teygja þar sem manneskjan horfa og gerðu ekkert eru veik jákvæð sönnun frekar en tóm. EIL lærir árekstur forða frá um einni mínútu af sérfræðingi stjórnun.

Vélmenni arm vinnurými með myndavélum staðsetning fyrir gagnasöfnun meðan eftirlit með policy útfellingu
Mannleg-getstýrð umferð er venjuleg ályktun keyra með skrá tengist. Rammið sem rekstraraðili keypti eru hentugt; restin stendur eins og það var.

Variantirnir hlið við hlið

AðferðHver opnar portiðMerkiÞarf aðgengilegTilkynnt
DAgger (Ross et al., 2011)Enginn — námunan stýrir alltafEngin; sérfræðingur merkja öll heimsótt tilstæðuSérfræðingur fær getu til að merkja utanlands-stefnu tilstæðu meðan ekki við stjórnunEngar-eftirsjá lækkun með tryggingum undir nám tilstöðu dreifingu
HG-DAgger (Kelly et al., 2019)Mannleg umsjónarmaðurUmsjónarmaður dómur að tilstæðu er óöruggEinhver stöðvandi og hreinn yfirfærslu stýringuGistir DAgger og hegðun klóning á eftirlíkðu og raunheims akstur verkefni; líka lærir áhættu þverskurð
SafeDAgger (Zhang & Cho, 2016)VélmenniTvíunda flokkunar fyrir L2 frávik frá tilvísun fyrir ofan tauSpuranlegur tilvísun pólítík fyrir flokkunar merkisFærri tilvísun spurningar í kappakstri eftirlíkingu, hraðari samleitni (engin tala gefin)
EnsembleDAgger (Menda et al., 2019)VélmenniSamnet dreifni og fjarlægð til sérfræðing aðgerðar, báðar undir þverskurðSamnet nets plús sérfræðing aðgerðar á hverju skrefiBætt öryggis og nám á pendúl og HalfCheetah
LazyDAgger (Hoque et al., 2021)Vélmenni með geymdriSafeDAgger merki með aðskilinn inngöngu og útgöngu þverskurðHvað SafeDAgger þarf plús annarri þverskurði til að stilla~60% færri samhengi skipti á 3 verkum; 60% hærri árangri á YuMi tóku
ThriftyDAgger (Hoque et al., 2021)Vélmenni undir hámarksáætlunNýjung eða metnu áhættu á ekki lokun verkefniLærðu áhættu estemator og tilkynnt inngripn hámark100% árangri á keyrslu tíma; notandi rannsókn (N=10): 58% og 80% hagnaðir yfir næsta-best
EIL (Spencer et al., 2020)Manneskjan — ekki-inngripn telst líkaInngripn og einingu sem þvingunum á virðismatiNetum engar-eftirsjá nám yfir virðismati þvingunÁrekstur forða frá um einni mínútu af sérfræðingi stjórnun

Hvað hvert port kaupir og hvað það rukkar

Les niður "þarf" dálkin og mynstur fellur út: hver vélmennisgetstýrð merki þar er fulltrúi sem verður að vera framleiddur og hver fulltrúi hefur sitt eigið reikningsskil.

  • Misbreyting merki (SafeDAgger, LazyDAgger, helmingur af EnsembleDAgger reglan) þarfnast tilvísunarpolicy. Annað hvort þú ert með handritað sérfræðing, í því tilfelli áhugamála vandamálið er þegar leyst eða manneskju heldur framleiðandi aðgerðir í bakgrunni svo fjarlægð getur verið reiknuð.
  • Efazlun merki þarfnast kvörðuð epistemic óvissa. Samnet lítill stýringu net nálgast það; samnet þremur-milljarða-breyti vision-tungumál-aðgerð líkan er minni og dræg vandamál fyrst.
  • Nýjung og áhættu merki þarfnast lærðu estemator verkefni lokun falli á nógu árangri og brjóta útfellingu. Á verkefni þú ert enn að komast til að vinna það gögn er ekki til í umferð ein.
  • Mannleg port þarfnast athygli og ekkert annað — eina merki aðgengilegt á degi ein, á hvaða pólítík arkitektúr með engum aukalegum líknum til að þjálfa.
  • Engin vélmennisport fjarlægir manneskjunni frá herberginu. Þeir draga niður hversu oft manneskjan verður að virka ekki hvort þeir verða að vera viðstaddir.

Það er rólegri munur á hvað portið framleiðir. Vélmennisport elding mitt-leiður framvindu manneskju við hreifandi arm á handahófi pose. Mannleg port lætur rekstraraðili velja augnablikið — eftir ná fyrra fram, ekki grípa ekki mitt á sveif. Endurheimtar hluta frá tveir eru ekki jafn hreinn og þessir hluta eru all-verkefni umferðin.

Af hverju mannleg-getstýrð form vinnur á raunheimum vélbúnað

Þetta er verkfræðinga rifrildi, ekki viðmið niðurstöða — engin ritskrif við fundum keyrir öll fimm port á sama tilhögun með sama pólítík bekkur. Það hvílir á fjórum stigum.

Fyrst umsjónarmaðurinn er þar þegar. Enginn skilur eftir SO-100 arm sem keyra óúthlutað við hliðar hlutir það getur steypt. Þegar einhver er horfa, jaðarlegur kostnaður við að gefa þeim takeover hnappur er nálægt núll; byggingu kvörðuð áhættu estemator er verkefni.

Annar óvissa þú getur raunverulega mæld á nútíma pólítík er oft rangt magn. Dreifni eða flæði-samsvörun höfuð framleiðir dreifni í gegnum sýni aðgerðir flökkum og að dreifni endurspeglar multimodality höfuðið var þjálfað til að tákna ekki epistemic óvissa um tilstöðu. EnsembleDAgger efazlun tímabil notar samnet einmitt til að fanga síðastnefnda. Þessir tveir líta eins og sama tala og eru ekki; action chunking og flow matching færslur taka til hvernig þessir höfuðir losuð aðgerðir í fyrstu.

Þriðji bilun sem skipta er oft merkingarfræðilegur frekar en tölfræðilega óvenjulegur. Pólítík lokun grípari tveir þota sem kemur fram, eða nær sjálfstraustandi fyrir rangt ein af tveimur sömu teningum, er ekki há-dreifni tilstöðu — það er fulltraustandi og rangt. Engin dreifni þverskurð fangar það; manneskja horfa fangar það samstundis.

Fjórði merki gæði — upprunalegu HG-DAgger stað og þeim oftast sleppt. Merki söfnuð meðan manneskjan hefur óhindraða stjórn sigra merkis framtalin yfir hreyfandi kerfi. Ef markmiðið er brjálraðandi gögn virði samansöfnun burden af sönnun ligga með sjálfvirka portið.

Þar vélmennisport borga sig af

Myndin flipar þegar einn umsjónarmaður ber ábyrgð á mörgum vélmennum — regímið ThriftyDAgger notandi rannsókn og Fleet-DAgger formlegt miða. Með floti mannleg athygli er augga auðlind og ófullkominn úthlutvun gengur enginn. Með ein arm á ein skrifborð þú ert ekki í þeim regímið.

Mannleg-getstýrð lykkja þegar árið vír upp

Takeover við keyra ályktun samsetur með skrá tengist. Ramminn rekstraraðili keypti eru hentugt; restin stendur eins og það var.

Sjá hvernig DAgger lykkja rekur

Portið er helmingur aðferðarinnar; gögn meðhöndlun er hinn helmingurinn

Port ákveðu rammar manneskju keypti eru ekki hvað á að gera við þeim og hvað annarri ákvörðun er þar umferðum eru oftast sóað. Fyrri regla er þeim D í DAgger stendur fyrir: samansöfnun ekki skipta. Fín-stilling checkpoint eingöngu á nokkra hundruð brjálrað rammum gefur þér líkan sem hefur séð næstum ekkert en endurheimtar og hafið gleymt nafnlegi braut.

Annarri regla er að inngripn rammum eru ekki venjulegur rammum. Mandlekar et al. hafði tekið fjartækaðir-teleoperation kerfi fyrir 6-DoF tilhögun leyfa rekstraraðila eftirlit með pólítík og taka yfir á bilun þá þjálfuð iteratively með reiknirit sem hvetur pólítík til að læra hvernig á að fara bottleneck með inngripnum; umboð þjálfaðu á þeim gögnum yfirgongu umboð þjálfað á jöfnun fjölda venjulegur sýnishorn saman. Sirius ýtir hugmyndinni inn í dreifingu endur-væga þjálfun sýnishorn með nálguðu mannleg traust og framboð á pólítík með væg atferlis klóning. Báðir þarfnast rammi-merki hvað var manneskja-keyptu sem af því HG-DAgger taka til markmiðs þarf. Fyrir það ástæðu intervention hentugt skiptir meira en það lítur.

Þriðji regla er að sjálfvirk blöndun er gildra. Samsettar gagnasafn sem heimildir þú getur ekki talið upp er ein þú getur ekki debugged þegar næstu umferð verður verra. Á þessum vettvang samsetningu skrefi er skýr fyrir þá ástæðu — upprunalegu gagnasafn plús brjálrað, episode úrval á heimild og niðurstaðan er venjulegur LeRobot dataset sem syncs og þjálfun eins og hvaða annar; dataset documentation tekur til snið hlið.

Skrefi í umferðHvað það framleiðirAlgengasta leið það fer rangt
Keyra ályktun með skráningu áKeyra undir pólítík eigin tilstöðu dreifinguSkráðu sem einfalda teleoperation týnandi að pólítík var akstur
Taka yfir á bilunBrjálrað hluta með rammi-merki inngripn hentugtBrjálrað smutt ósamþykki hentugt stíl frekar en endurheimtar
Curate hver episodeBrjálrað, mat eða falla afHalda allt; botched takeover kostar meira en episode var virði
Samstilla brjálraðÚtgáfa gagnasafn við hlið upprunaleguBrjálrað sem aldrei fara Heimabær vélar
Samsetningu blöndaðri gagnasafnUpprunalegu plús brjálrað skýr úrvalÞögult sjálfvirk-blöndun svo seinni afturför getur ekki verið rekja til heimild
Halda frá checkpointCheckpoint frumstillt frá fyrri einBúist við optimizer endurvinna; þyngdir frumstilla líkan þeir gera ekki endurheimta optimizer tilstand

Stilling hentugt manneskja getur raunverulega halda

Manneskjan ákveður er ekki útfærslu. Tveir rekstraraðila með ólíkum þverskurðum framleiða samberlegt umferðir og drifinn þverskurður framleiðir þróun þú getur ekki les. Skrifaðu kveikjanir niður fyrir fyrri keyra.

  1. Nefndu skilyrði sem opna hentugt — aðkoma off um meira en fastar jaðar grípari lokun á engu hendur á samtenginingu stöðvun af meira en sekúndur eða tveir — og halda listinn óbreyttu fyrir umferðina.
  2. Nefndu hvað gerir ekki opna það. Ofskot pólítík endurheimtar frá á eigin er þjálfun merki; takeover þar eyðir endurheimtar það þegar veit.
  3. Taka yfir snemma nóg til hreinni yfirfærslu framvinda til og fljótt sem tilstæðu er recoverable.
  4. Skrá af hverju þú tókst yfir á episode. Þrjú umferð seinna það er eina skrá hvort sama bilun skilar.
  5. Halda myndavélar verkefni texti og rekstraraðili stöðugt yfir umferðum. Breyta ein og tölur hætta verið samberlegt.

Vélbúnaðarlega yfirfærslu hefur tveir afbrigði. Með leiðar-arm leiðar þarf að ná yfir eftirfarandi núverandi pose fyrir moment flutningur eða armur hoppa; þetta samsetning hreyfa er minnst-prófuð hluti keðja á raunheimum vélbúnað. Án leiðar-arm takeover er handvirkur frá fyrstu keypress: eftirfarandi er halda og rekstraraðili gnýr það samtenging með samtenging frá lyklaborði eða draga sliders við þjónn-hlið clamps halda hvert inntaka lítinn — nokkur gráða fyrir keypress handful fyrir slider uppfærslu því stór skrefi í halda pose er hvernig þú rýfur servo. Skrefi-fyrir-skrefi útgáfu með lykli bindings er í the walkthrough of a DAgger round on an SO-100; bakgrunnur á báðir teleoperation modes er í the teleoperation docs og leader-follower entry.

Samanburðu studdra pólítík arkitektúr með þjálfun og ályktun einkenni
Portið er arkitektúr-agnostic. Hvaða pólítík þú brjálrað breytir þjálfun kostnaðu umferð ekki hvernig takeover virkar.

Lesning hvort hentugt gerðu eitthvað

Mæling af mannleg-getstýrð umferð er inngripn taxti: inngripn rammum deilt með rammum keyra. Það hefur ein starf — ef það fellur ekki yfir umferðum umferðin keypti engu og næstu ein ætti að breyta eitthvað annarri en magn gögn.

Það er hlutdrægur mæling og þú ættir að vita hvernig. Það mælir rekstraraðili þverskurðu sem mikið og pólítík færni fyrir það ástæðu hentugt listinn helst fast; rekstraraðili sem slaka yfir samsetningu framleiðir fellandi ferill með engu bak það. Það líka hunsar alvarlegu — tíu rammum til að stöðva árekstur og tíu nudge grípu líta eins og. Para það með fastu mat sett engin brjálrað gögn var aldrei dregið frá. The article on measuring a DAgger loop virka gegnum mat hönnun þar með hvernig á að halda mat episode út úr þjálfun blöndun.

Mannleg hentugt heiðarlega
Hvað það gefur þér
  • Virkar á degi ein á hvaða pólítík arkitektúr með engum aukalegum líkanni til að kvörðu
  • Fangar sjálftraustandi-og-rangt bilun engin dreifni þverskurð greinir
  • Framleiðir brjálrað skráðu meðan rekstraraðili hafði full stjórn á augnabliki þeir vali
  • Gefur til rammi-merki sem inngripn-væg aðferðum eins og IWR og Sirius neyta
Hvað það gerir ekki
  • Kostnaðir stöðuga umsjón; það gerir ekki kvarði til ein manneskja og mörg vélmenni
  • Veltur á rekstraraðili samkvæmni — drifinn þverskurðu baldna inngripn taxti
  • Framleiðir engin áhættu líkan á eigin; HG-DAgger lærðu þverskurðu og ThriftyDAgger estemator eru aukalegum vélum
  • Telur rammum ekki afleiðingar
  • Getur ekki bjargað pólítík þess bilun er uppstraum stýringu eins og skiptu myndavél eða misleidd verkefni strengur

Opið spurningar virði halda í skoðun

Viðmið eru veik. Spencer og samstarfsmenn skoðuð þeir notaðir til þess að prófa hermir nám aðferðum og fundu þeim realizable og einfaldir og þess vegna ófullnægjandi fyrir fangandi erfiðari regímum villa samsetning séð í raunverulegum ákvörðun þess nám vandamál — og gegn umkringandi bókmenntir fundu venjulegur atferlis klóning gerðu vel á þeim. Það er ástæðu til að vera efins um hvaða röðun af DAgger variantir hvílir á þeim verkum þar með sumar tölur í töflu fyrir ofan.

Vélmennisgetstýrðir stærðar pólítík eru ekki leyst annaðhvort. AIM verk kemur óvissa með fulltrúa Q-virka eftirhermir mannleg inngripn reglan og tilkynna 40% bæting í over-kostnaðu og nám hagnaðir yfir ThriftyDAgger — í stöðugum og viðskiptin stýringu en á vision-tungumál-aðgerð líkan akstur tilhögun. Hvort annarri þessir getstýrðir flutningar til fín-skipulögð VLA er opið. Könnun gerir skyldu stað: svið orðin og uppbygging eru ekki sameining í gegn bókmenntir sem geri aðferðum erfitt að bera saman. Á þinn eigin arm þín skrár eru sönnun þú hefur.

Er HG-DAgger raunverulega DAgger ef manneskjan aðeins merki meðan inngripn?

Það heldur hluti sem skiptir máli — gögn söfnuð undir tilstöðu dreifingu námunan innleiddi samansöfnun með hvað kom fyrir — og dettur hluti sem gerir ekki lifið samband með vélbúnað. Kelly et al. present það sem afbrigði; 2011 engar-eftirsjá trygging gerir ekki framvinda óbreyttu.

Get ég notað vélmennisgetstýrð á fín-skipulögð VLA pólítík á SO-100?

Ekki straujandi. SafeDAgger flokkunar þarf spuranlegur tilvísun pólítík þú gert ekki hafa. EnsembleDAgger þarf samnet sem fyrir multi-milljarða-breyti líkan þýðir marga afrit í minni plús þeirra ályktun kostnaðu. ThriftyDAgger þarf áhættu estemator fitt á árangri og bilun sem gera ekki fyrir þín fyrri umferðum.

Hversu lengi ætti ein takeover vera?

Lengi nóg til að ná tilstöðu pólítík getur halda framvinda og engu annar: extended takeover sveif umferðin inn á sýnishorn samsetningu og flóð brjálrað sett með nafnlegi atferli. LazyDAgger leit kvissar niður líka — mörg mjög stutt skipti eru þeirra eigin kostnaðu.

Ætti ég að þjálfa einungis á brjálrað hluta?

Nei — það er algengasta leið til að sóa umferðu. Líkan fín-skipulögð aðeins á endurheimtar hefur séð næstum ekkert en endurheimtar. Blanda brjálrað inn í upprunalegu gagnasafn með heimildum valinn eindræg; að fara lengra blikra á inngripn-væg aðferðum eins og IWR eða Sirius sem upp-væga mannleg-keyptu rammum frekar en alls sinnis þeir.

Hvað ef inngripn taxti fellur ekki yfir umferðum?

Taka það á andliti virði: umferðin hjálpaði ekki. Áður samsetning brjálrað athuga ódýrari útskýringar — hefur rekstraraðili þverskurðu drífa voru brjálrað smutt gerðu samsetning gagnasafn raunverulega innihalda þær var þjálfun frumstillt frá ætlaðri checkpoint. Umferðu sem þögult byrjað frá grunn líkan lítur einmitt eins og umferðu sem bruggu til að læra.

Er ekki-inngripn flytja upplýsingar?

Undir Expert Intervention Learning já: teygja þar umsjónarmaður horfa og gerðu ekki vera lesið sem veik sönnun að tilstöðu og aðgerðu voru ásættanlegur formlega sem þvingun á virðismati. Flestir framlegð leiðslur þar með þessu taki aðeins hvað manneskjan keyptu.

Fyrir ein arm á skrifborði valið er gert: halda hentugt þinn sjálf skrifa niður hvað opnar það og eyða viðleitninni á gögn meðhöndlun fyrir aftan það frekar en á sjálfvirk skiptinn. Vettvangur hlið er lýst á the DAgger loop page þjálfun valkosti fyrir pólítík fjölskyldu undir training and pricing. Fyrir bakgrunnur byrjaðu með imitation learning og imitation learning on the SO-100; fyrir fyrstu keyra run your first policy er styttri leið.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started