Operaattori valvoo robottikäsivartta teleoperaatiorajapinnan kautta, kädet ohjauksilla ja valmiina ottamaan haltuun
DAggerInteraktiivinen Imitation LearningHG-DAggerRobotti-PolicytSO-100

HG-DAgger ja Portitetut Variantit: Kuka Päättää Milloin Ottaa Robottipolicy Haltuun

AY-Robots ResearchAugust 27, 202615 min luku

Tavallinen DAgger pyytää ihmistä merkitsemään tiloja robotti ohjaa silti. Oikealla laitteistolla se on vaarallista ja tuottaa huonoja merkintöjä. Portitetut variantit korvaavat sokean merkitsemisen portilla, jonka joku pitää auki: ihminen HG-DAggerissa, turvaluokittelija SafeDAggerissa, ensemble-eron EnsembleDAggerissa, budjetoitu uutuuden ja riskin arvio ThriftyDAggerissa. Tämä artikkeli vertaa niitä siihen, kuka omistaa portin, mikä signaali avaa sen ja mitä kukin maksaa — ja miksi ihmisen hallitsema muoto on se, joka selviää kosketuksesta todellisen käsivarren kanssa.

Kloonattu policy epäonnistuu siellä, missä sen harjoitusdata loppui. Korjaus on jatkaa datan keräämistä policyn omasta tilajakaumasta demonstraattorin sijaan, jota DAgger tekee ja mitä dataset aggregation -johdanto kattaa ensimmäisistä periaatteista. Se jättää avoimeksi alkuperäisen algoritmin kiusallisen osan: opettajan ajaessa expert on pitänyt sanoa, mitä olisi tehnyt, jokaisessa tilassa, ilman että olisi hallinnassa.

Simulaattorissa skriptoidun experton kanssa se on ilmaista. Pöydällä, jonka päällä on todellinen käsivarsi, se ei ole vapaa eikä turvallinen. HG-DAgger -kirjoittajat esittävät vastalauseen tarkasti: tällaiset näytteenottokaavat "vaativat expertin antamaan toimintomerkinnät ilman täydellistä hallintaa järjestelmästä", mikä "voi heikentää turvallisuutta ja, kun käytetään ihmisiä ekspertteina, todennäköisesti heikentää keräävien merkintöjen laatua havaitun toimilaitteen viiveen vuoksi" (Kelly et al., 2019). Kaksi epäonnistumista piiloutuu tuohon lauseeseen: policy ajaa edelleen tiloihin, joihin kukaan ei halua sitä, ja näillä riskeillä ostetut merkinnät ovat huonompia kuin ihmisen tuottamat kontrollia pitäessään. Jokainen alla oleva variantti vastaa samaan kysymykseen — aseta portti hallintaan ja anna jonkun päättää milloin se avautuu. Ne eroavat siinä, kuka tuo joku on.

Lyhyt versio

  • Portitetut variantit korvaavat sokean merkitsemisen kytkimellä policyn hallinnan ja expert-hallinnan välillä. Mitä niitä erottaa, on kuka omistaa kytkimen.
  • HG-DAgger antaa kytkimen ihmiselle ja kerää vain dataa, joka nauhoitettiin kun ihmisellä oli keskeytymätön hallinta.
  • SafeDAgger antaa sen binaaritutkijalle, joka ennustaa poikkeamaa referenssipolicystä; EnsembleDAgger vaatii alhaista ensemble-varianssia ja pientä etäisyyttä expert-toimintaan samanaikaisesti.
  • LazyDAgger lisää hystereesia niin että hallinta ei värähtele; ThriftyDAgger avaa portin uutuudelle tai arvioidulle riskille eksplisiitillä interventiobugjetilla.
  • Robotin hallitsematiedot tarvitsevat jotain, mitä hienosäätöä VLA harrastaja-luokan käsivarrella tavallisesti puuttuu: referenssipolicy, halpa ensemble tai kalibroitu episteeminen epävarmuus.
  • Portti on puolet metodista. Mitä tapahtuu interventiosegmenteille myöhemmin — sekoita, paina, koosta — ratkaisee, parantuiko kierros mitään.

Ihmisen hallitsema ja robotin hallitsema: erotus joka väliä

Interaktiivisella imitation learningilla on oma katsaus; Celemin ja kollegat luetteloivat sen palautetyypin, rajapinnan, oppimismallin, käyttäjäkokemuksen, soveltamisen ja vertailuarvon mukaan. Erotus joka ratkaisee tekniikan on yksinkertaisempi kuin mikään näistä akseleista, ja viimeaikaiset työt nimeävät sen suoraan: menetelmä on ihmisen hallitsema kun valvoja päättää milloin intervalla, ja robotin hallitsema kun agentti päättää milloin pyytää apua (Cai et al., 2025). Kaikki muu on koneistoa, joka palvelee yhtä näistä kahdesta valinnasta. Kauppa näkyy alusta: ihmisen portti maksaa jatkuvaa huomio, ja robotin portti lupaa saada tämän huomio takaisin — mutta vain jos signaali, jonka avulla se hallitsee, on luotettava, ja tämän signaalin rakentaminen on oma tutkimusongelma.

SafeDAgger: tutkija, joka ennustaa omaa poikkeamaansa

Zhangin ja Chon SafeDAgger (2016) on aikaisin näistä porteista. Referenssipolicyn kyseleminen on kallis osa, joten toinen, pieni verkko — turva-policy — ennustaa onko kyseleminen ollenkaan kannattavaa. Se "palauttaa binaarisen merkinnän osoittaen onko pääpolicy todennäköisesti poikkeava referenssipolicystä ilman että se kyselee sitä". Merkintä määritellään neliöllisen L2-poikkeaman neljä policyn toiminnot suhteen kynnyksen tau kanssa, ja luokittelija säädetään binaarisen ristiinentropian kanssa. Ajon aikana se päättää jokaisessa tilassa pitääkö oppija ajamaan vai ottaako viittaus haltuun. Tiivistelmä raportoi vähemmän viitteisyyskyselyjä auto-kilpa-simulaattorissa plus lähentymisnopeuden nopeutumisen, jonka kirjoittajat johtavat automatisoidun oppimusefektiin, antamatta lukua kummallekaan.

Kiinnitys on määritelmässä, ei tuloksissa. Luokittelijan harjoittaminen vaatii referenssipolicyn toiminnon jokaisessa tilassa, jota käytetään sen sovittamiseen, mikä olettaa referenssin olevan toinen ohjelma. Jos referenssisi on henkilö johtaja-käsivarrella, tämä merkintäsarja ei ole halpa ja menetelmä menettää ominaisuuden, jonka se suunniteltiin.

EnsembleDAgger: epäily ja ero, molemmat

Menda, Driggs-Campbell ja Kochenderfer (2019) kohtelevat porttia probabilistisena kysymyksenä. EnsembleDAgger "approksimoi Gaussin prosessia neuroverkon ensemblellä" ja lukee ensemble-varianssin luottamuksellisuuden väliksi: korkea varianssi tarkoittaa aluetta, joka tuntuu harjoitusdatasta, mikä — olettaen expert välttää epäonnistumisen tiloja — korreloi epäonnistumisen läheisyyteen. Sääntö on yhdistys. Oppija voi toimia vain kun L2-etäisyys sen keskitoiminnon ja experton toiminnon välillä pysyy kynnyksen alle (poikkeama) ja sen ennustetun toiminnon varianssi pysyy toisen kynnyksen alle (epäily). Jos joko epäonnistuu, expert ottaa haltuun. Tavoite on maksimioida oppijan toimintaosuus rajoitettaessa epäonnistumisen todennäköisyyttä; paperi raportoi parantuneesta turvallisuudesta ja oppimisesta muihin DAgger-variantteihin nähden käännetyllä heilurilla ja MuJoCo HalfCheetahilla.

Poikkeamatermi tarvitsee experton toiminnon

Tämä hiljaisesti karsii täysisäännön käsin pois jäävää valvontaa. Etäisyys oppijan toiminnon ja experton toiminnon välillä vaatii experton toiminnon siinä tilassa, siinä hetkessä. Skriptoidun experton kanssa, hyvä. Ihmisen kanssa, ihminen on tuotettava toiminnot jatkuvasti — aivan se kuorma jotka portitetut variantit olivat tarkoitetut poistamaan. Epäilytermi yksin on käsin pois; yhdistys ei ole.

LazyDAgger: pysäytä kytkin väristely

Hoque ja kollegat (2021) hyökkäsivät kustannuksen, jonka aikaisemmat paperit eivät mitanneet: kytkimen itse. Jokainen interventia "keskeyttää muun työn, jonka ihminen tekee, aiheuttaa latenssia jokaisen kontekstin vaihdossa valvojan ja autonomisen ohjauksen välillä, ja vaatii aikaa suorittaa". Portti, joka avautuu ja sulkeutuu kymmenen kertaa minuutissa, on huonompi kuin portti, joka avautuu kerran kymmeneksi sekunniksi, identtisellä autonomisella osuudella. LazyDAgger laajentaa SafeDAggerina epäsymmetristen kynnysarvoin — vaikeampaa siirtyä valvojan hallintaan kuin pysyä siinä — niin järjestelmä ei heilahdu rajalla. Simulaatiossa se "voi vähentää kontekstin vaihdoksia keskimäärin 60 % yli SafeDAgger 3 jatkuva kontrolli tehtävää; kangasta manipuloinnissa ABB YuMi kanssa se "vähentää kontekstin vaihdoksia 60 % samalla kun saavuttaa 60 % korkeamman onnistumisasteen kuin SafeDAgger suoritusaikana".

ThriftyDAgger: uutuus tai riski, budjetin alla

ThriftyDAgger (Hoque et al., CoRL 2021) alkaa valvojan budjetista pikemminkin kuin policysta. Se "käyttää opittua vaihtopolitiikkaa pyytääkseen interventiita vain tiloista, jotka ovat riittävän (1) uusia, joissa robottipolicylla ei ole vertailukelpoista käyttäytymistä jäljiteltävää, tai (2) riskillisiä, joissa robotilla on alhainen luottamus tehtävän suorittamiseen", uudella mittarilla arvioidakseen tämän riskin. Budjetti on syöte, ei tulos: sanot kuinka paljon ihmisaikaa käytät. Sovellettuna ajon aikana menetelmä "saavuttaa 100 % onnistumisasteen sekä simulaatiossa että fyysisillä tehtävillä", ja käyttäjätutkimus kymmenellä osallistujalla, joilla oli kolmen robotin laivasto valvottavaksi keskittymis-tehtävän rinnalla, raportoi että se "lisää ihmisen ja robotin suoritusta 58 % ja 80 % vastaavasti verrattuna seuraavaan parhaaseen algoritmiin samalla kun vähentää valvojan kuormitusta". Laivasto-asetus on luonnollinen koti tälle työlle; Fleet-DAgger myöhemmin virallisti interaktiivisen laivasto-oppimisen useiden robottien ja valvojien kanssa, ehdottaen Return on Human Effort optimoitavaksi määräksi.

HG-DAgger: ihminen pitää porttia

Kelly et al. (2019) mennään toiseen suuntaan. Ei ole vaihtopolitiikkaa. Oppija kierretään "kunnes expert havaitsee, että noviisi on tullut tilaavaruuden turvattomaan alueeseen", jolloin expert ottaa haltuun ja ohjaa järjestelmän takaisin. Aggregaatio-sääntö on tiukka osa: "Expert-toiminnon merkinnät kerätään ja lisätään aineistoon vain näiden palautus-liikeradojen aikana, kun ihmisen asiantuntijalla on keskeytymätön hallinta järjestelmässä." Mitään ei merkitä kun ihminen on katsoja.

Se ei pysähdy kytkimeen. HG-DAgger myös "oppii turva-kynnyksen mallin-epävarmuuteen-perustuneelle riskimittarille, jota voidaan käyttää ennustamaan täysin koulutetun noviisipolicyn suoritusta tilaavaruuden eri alueilla": se lokittaa kuinka epävarma oppija oli hetkillä kun ihminen intervalla ja laskee keskiarvon näiden tietueiden viimeiseltä neljännekseltä, missä oppija eniten muistuttaa lopullista muotoaan. Tuo ei ole portti robotin käytettäväksi vaan diagnostiikka joka kertoo sinulle missä valmis policy on odotettu pitävän. Evaluaatio kattaa simuloidun ja todellisen ajotehtävän sekä raportoi parantuneesta suorituksesta sekä DAgger- että käyttäytymiskloonaamista vastaan.

Yksi liittyvä linja muuttaa mitä lasketaan merkinnäksi. Spencerin ja kollegain Expert Intervention Learning toteaa että "mikä tahansa määrä asiantuntija-palautetta, olipa se interventia tai non-interventia, tarjoaa tietoa nykyisen tilan laadusta, toiminnon optimitasosta tai molemmista", formalisoitu rajoituksena oppijan arvo-funktioon ja ratkaistu ei-katumusoppimisen kanssa. Tuolla lukemisella väliset jaksot, joissa ihminen katsoi eikä tehnyt mitään, ovat heikko positiivinen todiste pikemminkin kuin tyhjä. EIL oppii törmäysten välttämisen noin yhden minuutin asiantuntija-hallinnan perusteella.

Robottikäsivarren työtila kameroin, jotka sijoitetetaan tiedon keräämistä varten valvotun policyn kierroksen aikana
Ihmisen hallitsema kierros on tavallinen päättelykierros tallentimella kiinnitetyllä. Kehykset, jotka operaattori ajoi, merkitään lipulla; loput pysyy kuten ne olivat.

Variantit rinnakkain

MenetelmäKuka avaa portinSignaaliTarvitsee saatavillaRaportoitu
DAgger (Ross et al., 2011)Kukaan — oppija ajaa ainaEi mitään; expert merkitsee jokaisen vieraillun tilanAsiantuntija, joka kykenee merkitsemään politiikasta poikkeavia tiloja ilman hallinnassa olemistaNo-regret-vähennys takuilla oppijan tilajakauman alle
HG-DAgger (Kelly et al., 2019)Ihmisen valvojaValvojan arvio siitä, että tila on turvatonJoku katsoo, ja puhdas hallinnanohjausVoittaa DAgger ja käyttäytymiskloonaamisen simuloidulla ja todellisella ajoilla; oppii myös riskikynnyksen
SafeDAgger (Zhang & Cho, 2016)RobottiBinaaritutkija L2-poikkeamalle viitteestä tau yliKyselykelpoinen viite-policy tutkijan merkinnöilläVähemmän viite-kyselyjä kilpa-simulaattorissa, nopeampi lähentyminen (lukua ei annettu)
EnsembleDAgger (Menda et al., 2019)RobottiEnsemble-varianssi ja etäisyys experton toimintoon, molemmat kynnyksen allaVerkon ensemble sekä experton toiminta jokaisella askeleellaParantunut turvallisuus ja oppiminen heilurilla ja HalfCheetahilla
LazyDAgger (Hoque et al., 2021)Robotti, hystereesillaSafeDAgger signaalin erillään sisään ja ulostulo-kynnyksinMitä SafeDAgger tarvitsee, sekä toinen kynnys virittää~60 % vähemmän kontekstissa vaihdoksia 3 tehtävällä; 60 % korkeampi onnistuminen YuMi kangasilla
ThriftyDAgger (Hoque et al., 2021)Robotti, budjetin allaUutuus, tai arvioitu riski tehtävän täyttämisen epäonnistumisestaOpittu riskiarviointija ja ilmoitettu intervention budjetti100 % onnistuminen suoritusaikana; käyttäjätutkimus (N=10): 58 % ja 80 % voitot seuraavaa parhaasta
EIL (Spencer et al., 2020)Ihminen — non-interventia laskee myösIntervalia ja sen puuttuminen rajoituksina arvo-funktiolleOnline no-regret oppiminen arvorajoituksen yliTörmäystenväittäminen noin yhdestä minuutista asiantuntija-hallinnan perusteella

Mitä kukin portti ostaa, ja mitä se maksaa

Lue alas "tarvitsee" -sarake ja kuvio putoaa ulos: jokainen robotin hallitsema signaali siellä on välityspalvelin, joka joudutaan valmistamaan, ja jokaisella välipalvelulla on oma lasku.

  • Poikkeama-signaalit (SafeDAgger, LazyDAgger, puoli EnsembleDAgger-säännöistä) tarvitsevat viite-policyn. Joko sinulla on skriptoidun expert, missä tapauksessa mielenkiintoinen ongelma on jo ratkaistu, tai ihminen pitää tuottamaan toimintoa taustalla niin etäisyys voidaan laskea.
  • Epäilysignaalit tarvitsevat kalibroitua episteemista epävarmuutta. Pieni kontrolli-verkon ensemble approksimoi sitä; kolmen miljardin parametrin vision-language-action -mallin ensemble on muisti ja latenssi-ongelma ensin.
  • Uutuus ja riski-signaalit tarvitsevat opitun tehtävän täydennys-estimaattorin, sovitetun tarpeeksi onnistuneille ja epäonnistuneille kierroksille. Tehtävässä jonka kanssa olet vielä työskennelyt, tämä tieto ei ole olemassa kierroksella yksi.
  • Ihmisen portti tarvitsee huomio ja mitään muuta — ainoa saatavilla oleva signaali päivä yksi, mistä tahansa policy-arkkitehtuurista, ilman lisämallia harjoitettavaksi.
  • Ei robotin portti poista ihmisen huoneesta. Ne vähentävät kuinka usein ihmisen täytyy toimia, ei sitä tulisiko heidän olla läsnä.

On hiljaisempi ero siinä mitä portti tuottaa. Robotin portti ampuu kesken liikeradan palauttaa ihmisen liikkuvalle käsivarrelle mielivaltaisella asenolla. Ihmisen portti antaa operaattorille valita hetken — saavutuksen jälkeen, ennen grasppia, ei heilahduksen puolessa. Palautus-segmentit kahdesta eivät ole yhtä puhtaat, ja nuo segmentit ovat kierroksen koko tuote.

Miksi ihmisen hallitsema muoto voittaa todellisella laitteistolla

Tämä on insinööriargumentti, ei vertailuarvon tulos — yksikään paperi jota löysimme ei aja kaikkia viittä porttia samalla manipulaattorilla samalla policy-luokalla. Se lepää neljällä pisteellä.

Ensiksi, valvoja on siellä joka tapauksessa. Kukaan ei jää SO-100 käsivarren juoksemaan ilman valvontaa esineiden vieressä, jotka se voi kaataa. Kun joku katsoo, antaa heille takeover-painiketta on lähes nolla marginaalikustannus; kalibroitu riskiarviointija on projekti.

Toiseksi, epävarmuus mitä voit todella mitata nykyaikaisessa policyssa on usein väärä määrä. Diffuusio tai flow-matching pää tuottaa varianssia näytteenotettujen toiminto-lohkojen yli, ja se varianssi heijastaa multimodaalisuuden pää oli harjoitettu edustamaan, ei episteeminen epäily tilasta. EnsembleDAgger epäilu-termi käyttää ensemblea juuri kaapimaan jälkimmäisen. Kaksi näyttää samalta numerolta ja eivät ole; toiminto-lohkitus ja flow matching merkinnät käsittelevät kuinka nuo päät lähettävät toimintoja ensimmäisen paikan.

Kolmanneksi, epäonnistumiset jotka väliä manipuloinnissa ovat usein semanttisia pikemminkin kuin tilastollisesti epätavallisia. Policy joka sulkee gripper kaksi senttimetriä aikaisin, tai tavoittelee luottavaisesti väärää kahdesta identtisistä kuutioista, ei ole korkean varianssin tilassa — se on luottavainen ja väärä. Ei varianssi kynnys pyydystää sitä; ihminen katsoo pyydystää sen välittömästi.

Neljänneksi, merkinnän laatu — alkuperäinen HG-DAgger piste, ja se jotka ohitettiin useimmiten. Merkinnät kerätyt kun ihmisellä on keskeytymätön hallinta voittaa merkinnät narratoitu liikkeelle järjestelmälle. Jos tavoite on korjaavaa dataa arvoista aggregoida, todistuksen taakka on automatisoidulla portilla.

Missä robotin portit maksavat

Kuva kääntyy kun yksi valvoja on vastuussa monista roboteista — hallinto ThriftyDAgger käyttäjätutkimuksen ja Fleet-DAgger formalisaation kohde. Laivastolla, ihmisen huomio on niukka resurssi ja epätäydellinen jakelu voittaa mitään. Yhdellä käsivarrella yhdellä pöydällä sinä et ole hallinnossa.

Ihmisen hallitsema silmukka, jo johdotettu

Takeover käynnissä olevan päättelysession aikana, per-kehys interventialiput korjatuissa segmenteissa, kuratoimme jokaisen kierroksen korjauksiksi tai evaluaatioksi, koostamme sekoitetun aineiston lähteistä valitsemme, ja jatketaan harjoitusta olemassa olevasta tarkistuspisteestä ovat sisäänrakennetut pikemminkin kuin käsijoilla skriptityt. Takeover toimii johtaja-käsivarrella, tai näppäimillä ja liukusäätimillä jos sinulla ei ole sellaista.

Katso kuinka DAgger silmukka juoksee

Portti on puolet metodista; data-käsittely on toinen puoli

Portti päättää mitkä kehykset ihminen ajoi, ei mitä tehdä niille, ja tuo toinen päätös on missä kierrokset useimmiten tuhlattiin. Ensimmäinen sääntö on se jonka D DAggerissa seisoo: aggregoi, älä korvaa. Hienosäätöä tarkistuspisteestä puhtaasti muutamalla sadalla korjaus-kehyksellä antaa sinulle mallin, joka on nähnyt lähes mitään mutta palautuksia ja on unohtanut nimellisen liikeradan.

Toinen sääntö on että interventia kehykset eivät ole tavallisia kehyksiä. Mandlekar et al. rakensivat kaukaisen teleoperaatio-järjestelmän 6-DoF manipulaatiolle antamalla operaattoreille valvoa politiikkaa ja ottaa haltuun epäonnistuksella, sitten harjoittivat iteratiivisesti algoritmilla joka "kannustaa politiikkaa oppimaan kuinka kulkea pullonkauloja interventioiden kautta"; agentit harjoitelleet tuolla datalla ylivoimaiset agentit harjoitelleet yhtä suurelle määrälle tavallisia esittely-näytteitä. Sirius painaa ideaa deploymentiin, "re-painottaa harjoitus-näytteitä lähentyneen ihmisen luottamuksen kanssa ja optimoivat politiikkaa painotetulla käyttäytymisklonoamisella". Molemmat tarvitsevat per-kehys merkintää siitä mitä ihminen ajo, miksi interventia lippu väliä enemmän kuin näyttää.

Kolmas sääntö on että automaattinen sekoitus on ansa. Koostettu aineisto jonka lähteitä et voi luetella on yksi et voi virheenkorjata kun seuraava kierros osoittaa huonommaksi. Tällä alustalla compose-vaihe on eksplisiittinen siitä syystä — alkuperäinen aineisto sekä korjaukset, episodi-valinta per lähde, ja tulos on tavallinen LeRobot aineisto joka synkkaa ja harjoittaa kuten mikä tahansa muu; aineiston dokumentaatio kattaa muoto-puolen.

Askel kierroksellaMitä se tuottaaYleisin tapa se menee väärään
Käy päättely tallentimella päälleKierros policyn omassa tilajakaumaTallennetaan tavallisena teleoperaationa, menettäen että policy oli ajamassa
Ota haltuun epäonnistuksellaKorjaus-segmentit per-kehys interventia-lipullaKorjaa kosmeettinen vapina, opeta tyyli pikemminkin kuin palautus
Kuratoi jokainen episodiKorjaukset, evaluaatio, tai hylkääPidä kaikki; huono takeover maksaa enemmän kuin episodi oli arvoinen
Synkkaa korjauksetVersioitu aineisto alkuperäisen vieressäKorjaukset jotka eivät koskaan poistu paikallisesta koneesta
Koosta sekoitettu aineistoAlkuperäinen sekä korjaukset, eksplisiittinen valintaHiljainen auto-sekoitus, niin jäljempänä regression ei voi jäljittää lähteeseen
Jatka tarkistuspisteestäTarkistuspiste alustettu edellisestäOdottaa optimisoija jatkoa; painot aluksi mallin, he eivät palauta optimisoija-tilaa

Asettaminen portti jonka ihminen voi todella pitää

"Ihminen päättää" ei ole spesifikaatio. Kaksi operaattoria erilaisin kynnyksin tuottaa vertailemattomia kierroksia, ja ajautua kynnys tuottaa trendi et et voi lukea. Kirjoita käynnistäjät alas ennen ensimmäistä juoksua.

  1. Nimeä ehdot jotka avaa portin — lähestyminen poissa enemmän kuin kiinteä marginaali, gripper sulkeutuu ei mihinkään, nivel ajautuu kohti rajaa, pysähdys yli sekunnin pari — ja pidä lista muuttumattomana kierroksella.
  2. Nimeä mitä ei avaa sitä. Yliarvo policyn palautuu itse on harjoitus-signaali; ota haltuun siellä poistaa palautus se jo tietää.
  3. Ota haltuun riittävän varhain puhtaalle käsienvaihdolle, anna takaisin heti kun tila on palautettavissa.
  4. Lokita miksi otit haltuun, per episodi. Kolme kierrosta myöhemmin se on ainoa tietue siitä palautuuko sama epäonnistuminen.
  5. Pidä kamerat, tehtävä teksti ja operaattori vakio kierrosten yli. Muuta yksi ja numerot lakkaavat olemasta vertailukelpoisia.

Mekaanisesti käsienvaihdolla on kaksi varianttia. Johtaja-käsivarrella, johtajalla täytyy saavuttaa seuraajan nykyinen asento ennen vääntömomentti siirtyy, tai käsivarsi hyppää; tämä linjaus-liike on vähiten-testattu ketjun osa todellisella laitteistolla. Ilman johtaja-käsivarren takeover on käsin ensimmäisestä näppäimenpainalluksesta: seuraaja pidetään ja operaattori keulii sitä nivel kerrallaan näppäimiltä tai vetää liukusäätimiä, palvelin-puolella puristaa pitäen jokaisen sisäänoton pienellä — pari astetta per näppäimenpainallus, kourallinen per liukusäätimen päivitys, koska suuri askel pidettyyn asentoon on kuinka naulia servo. Vaihe-vaihe versio näppäin-sidonnoin on DAgger kierroksen käveleminen SO-100:lla; tausta molempi teleoperaatio-moodissa on teleoperaatio dokumentit ja johtaja-seuraaja merkintä.

Tuetut policy-arkkitehtuurit niiden koulutus ja päättely ominaisuuksilla
Portti on arkkitehtuuri-agnostinen. Millä politiikalla korjaat muuttaa kierroksen koulutus kustannusta, ei kuinka takeover toimii.

Luemme ovatko portti teki mitään

Ihmisen hallitsevan kierroksen mittari on interventia-nopeus: interventia-kehykset jaetuna kierroksen kehyksillä. Se on yksi työ — jos se ei putoaa kierrosten yli, kierros osti mitään, ja seuraava pitää muuttaa jotain muuta kuin datan määrää.

Se on kallistunut mittari ja sinun pitäisi tietää miten. Se mittaa operaattorin kynnystä yhtä paljon policyn pätevyyttä, miksi käynnistäjä-lista pysyy kiinteä; operaattori joka rentoaa istunnon aikana tuottaa putoavan käyrän jossa on mitään takana. Se myös jättää huomiotta vakavuuden — kymmenen kehykset pysäyttää törmäyksen ja kymmenen liikuttamaan grasppia näyttää identtisiltä. Pari se kiinteä evaluaatio joukko ei korjaus-tieto koskaan vetänyt. Artikkeli DAgger silmukan mittaamisesta työskentelee läpi evaluaatio-suunnittelun, mukaan lukien kuinka pitää evaluaatio-episodit harjoitus-sekoituksesta ulos.

Ihmisen portti, rehellisesti
Mitä se antaa sinulle
  • Toimii päivä yksi, mitä tahansa policy-arkkitehtuuri, ei lisämallia kalibroida
  • Pyydystää luottavainen-ja-väärä epäonnistumiset ei varianssi kynnys havaitse
  • Tuottaa korjaukset nauhoitettuja operaattori oli täysi hallinta, hetki ne valitsivat
  • Tuottaa per-kehys merkintä jota interventia-painotettu menetelmät kuten IWR ja Sirius kulutetaan
Mitä se ei
  • Maksaa jatkuva valvonta; se ei skaalaa yhteen henkilön ja moniin robotteihin
  • Riippuu operaattori johdonmukaisuus — ajautuva kynnys korruptit interventia-nopeus
  • Tuottaa ei riski-mallia omalla; HG-DAgger opittu kynnys ja ThriftyDAgger arvioija ovat ylimääräinen koneisto
  • Laskee kehykset, ei seurauksista
  • Ei voi pelastaa politiikkaa jonka epäonnistuminen on ohjauksen ylävirtaan, kuten vaihdettu kamera tai väärin merkitty tehtävä-merkkijono

Avoimet kysymykset joita kannattaa pitää näkymässä

Vertailuarvot ovat heikot. Spencer ja kollegat tutkivat niitä käytetään imitation learning lähestymistapojen testata ja löysivät ne "realisoitavissa ja yksinkertaisesti ja siten riittämätön vangitsemaan kovemmin hallinnot virhe yhdistelystä nähdään todellisen maailman päätöksentekoon ongelmat" — ja, ympäröivää kirjallisuutta vastaan, löysivät tavallinen käyttäytymis-kloonaaminen teki hyvin niillä. Se on syy olla skeptinen jokainen ranking DAgger variantit nojaa näihin tehtäviin, kuten jotkin numerot taulukossa yli.

Robotin portit suurella politiikoilla eivät ole ratkaistu joko. AIM työ korvaa epävarmuus välityspalvelimen Q-funktiolla jäljittelevän ihmisen interventia sääntö ja raportit 40 % parannus ota-yli-kustannus ja oppiminen tehokkuus yli ThriftyDAgger — jatkuvassa ja erillisessä hallinnassa, ei vision-language-action mallilla joka ajo manipulaattoria. Onko mikään näistä porteista siirtää hienosäädettyyn VLA on avoin. Katsaus tekee liittyvän pisteen: alan terminologia ja rakenne eivät ole yhdistetyt kirjallisuudessa, mikä tekee menetelmät vaikeaa verrata. Omalla käsivarrella, omat lokit ovat todisteet sinulla on.

Onko HG-DAgger todella DAgger jos ihminen vain merkinnöt interventiiden aikana?

Se pitää osan jolla väliä — aineisto kerätään alle tilajakauma oppija aiheuttaa, aggregoidaan mitä tuli ennen — ja pudottaa osan jolla ei ole kosketukselta laitteistoon. Kelly et al. esittävät sitä varianttina; 2011 no-regret takuu ei siirrä muuttumattomana.

Voiko käyttää robotti porttia hienosäädettyyn VLA politiikkaan SO-100:lla?

Ei suoraviivaisesti. SafeDAgger luokittelija vaatii kyselykelpoinen viite politiikka sinulla ei ole. EnsembleDAgger tarvitsee ensemble, joka moniksi miljardi-parametri mallin tarkoittaa useita kopioita muistissa sekä niiden päättely kustannus. ThriftyDAgger tarvitsee riskiarviointija sovitettu onnistumiset ja epäonnistumiset jotka eivät ole olemassa ennen ensimmäiset kierrokset.

Kuinka pitkä olisi yksittäinen takeover?

Riittävä saavuttaa tila politiikka voi jatkaa, ja ei enää: jatkuu takeovers käännä juoksu esittely-istunnoksi ja tulva korjaus-joukko nominaali käyttäytymisellä. LazyDAgger löytö leikkaa toiselle tavalla myös — monet hyvin lyhyt kytkennät ovat oman kustannus.

Tulisiko minun harjoittaa vain korjaus-segmenteissä?

Ei — se on yleisin tapa tuhlata kierroksen. Malli hienosäädä vain palautuksissa on nähnyt lähes mitään mutta palautuksia. Sekoita korjaukset alkuperäiseen aineistoon kanssa lähteet valittu eksplisiittisesti; mennä pidemmälle, katso interventia-painotettu lähestymistapojen kuten IWR tai Sirius, jotka ylös-paino ihmisen-ajo kehykset pikemminkin kuin eristämällä ne.

Entä jos interventia-nopeus ei putoaa kierroksen jälkeen?

Ota se face arvo: kierros ei auttanut. Ennen korjausten lisäämistä, tarkista halvempi selitykset — operaattorin kynnys ajautuva, korjaukset kosmeettinen, koostettu aineisto todella sisälsi ne, oli harjoitus alustettua tarkoitetut tarkistuspiste. Kierros joka hiljaisesti alkoi perus-mallista näyttää aivan kuten kierros joka epäonnistui oppia.

Onko non-interventia kantoivat tietoa?

Alla Expert Intervention Learning, kyllä: väliset jaksot missä valvoja katsoi ja ei toimineet lukea heikko todisteet että tila ja toiminta olivat hyväksyttävät, formalisoitu rajoituksena arvo-funktio. Eniten käytännön putkella, mukaan lukien tämä, merkki vain mitä ihminen ajo.

Yksittäiselle käsivarrelle pöydällä valinta on tehty: pidä porttia itse, kirjoita mitä avaa sen, ja käytä ponnisteluun data-käsittely sen takaa pikemminkin kuin automatisointi kytkimen. Alusta puoli on kuvattu DAgger silmukka sivu, harjoitus valinnat per politiikka perhe alla harjoitus ja hinnoittelu. Tausta, aloita imitation learning ja imitation learning SO-100:lla; ensimmäinen juoksu, aja ensimmäinen politiikka on lyhyempi polku.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started