
Intervention rate - interventiokehykset jaettuna kierroksen kehyksillä - on halvin rehellinen edistymisen signaali, joka ihmisen hallinnoimalla DAgger-silmukalla on. Tämä artikkeli määrittelee sen siten, että kaksi ihmistä laskee saman arvon, näyttää kuinka kirjata se, ja käsittelee neljää tapaa, joilla se johtaa sinut harhaan: operaattorin tottumus, ajautuvaa arviointisetuppia, opiskelu pelkästään korjauksista ja ihminen, joka korjaa eri tavalla tiistaina kuin maanantaina.
DAgger-kierros tuntuu tuottavalta kun olet sen keskellä. Aja politiikkaa, ota hallinta kun se epäonnistuu otossa, tallenna korjaukset, kouluta uudelleen, ja seuraava ajo näyttää - voisi vannoa - hieman tasaisemmalta. Kaksi kierrosta myöhemmin et voi sanoa, muuttuiko mitään, koska "hieman tasaisempi" ei ole määrä.
Silmukka tarvitsee yhden numeron per kierros, ja ihmisen hallinnoimassa silmukassa tämä numero on melkein ilmainen: osuus ajosta, jonka aikana sinulla oli hallinta politiikan sijaan. Tämä artikkeli määrittelee sen siten, että kaksi ihmistä laskee saman arvon, kirjaa sen, lukee tuloksena olevan käyrän, ja nimeää neljä tapaa, joilla se johtaa sinut harhaan kun se seisoo yksin. Teorian osalta tämä kappale olettaa, katso DAgger-selitys ja ihmisen hallinnoimaa varianttia; käytännön vastine on DAgger-silmukan ajaminen SO-100-robotille.
Lyhyt versio
- •Intervention rate = interventiokehjykset / kierroksen kehykset. Kehykset, ei episodit, ja nimittäjä sisältää kehykset, jotka viettivät korjaamisen.
- •Tasainen käyrä kolmen kierroksen yli tarkoittaa, että kierrokset eivät osta mitään - muuta sekoitusta, tarkistuspistettä tai tehtävää sen sijaan, että keräisit neljännen.
- •Laskeva intervention rate ei ole nouseva onnistumisaste. Kynnys astua sisään ajautuu alaspäin luottamuksen kasvaessa.
- •Ilman jäädytettyä arviointiprotokollaa - samat aloitusasennot, objektit, kamerat, kokeilujen määrä - mittaat huonetta.
- •Opiskelu pelkästään korjauksista vinoutaa tilajakauman. IWR:n vastaus: piirrä intervention ja non-intervention näytteitä yhtä suuressa suhteessa.
Miksi kierros tarvitsee numeron ollenkaan
DAgger on olemassa jakeluongelman vuoksi, ja jakeluongelmat ovat näkymättömiä silmille. Ross ja Bagnell osoittivat, että imitaatiooppiminen kiinteässä esittelysarjassa johtaa yhdistelmävihheisiin ja katanrajan, joka kasvaa neliöllisesti aikahorisontissa: kun oppija poistuu tiloista, joissa demonstraattori vieraili, mitään tiedoissa ei kerro sille kuinka palata. DAgger korjaa tämän iteroimalla - aja politiikkaa, merkitse tilat joita se käy, kerää, kouluta uudelleen - jonka Ross, Gordon ja Bagnell kehystävät vähentämisenä ei-katanrajan online-oppimiseen.
Tällä kehystämisellä on seuraus, jonka ihmiset ohittavat. Takuu koskee politiikan sarjaa iteraatioiden yli, ei mitään yksittäistä ajoa. Se ei sano mitään siitä, auttoi sinun kierros kolme. Ainoa tapa tietää on mitata jokainen iteraatio. Kelly ja kollegat ottivat käyttöön HG-DAgger:n, koska klassinen DAgger pyytää asiantuntijaa toimintamerkinnöille kun noviisi on silti hallinnassa, jonka paperi väittää voivan heikentää turvallisuutta ja ihmisasiantuntijoille todennäköisesti heikentää etiketin laadusta aktuaattorin viiveen kautta. HG-DAgger myös opettelee turvallisuuskynnyksen malliin liittyvän epävarmuuden riskin mittarille ja raportoi parannetusta suorituksesta sekä DAgger:in että käyttäytymisen kloonauksen yli ajotehtävässä. Se ei julkaise interventiolaskuja; nuo tuotat itse.
Määrittelemme korko siten, että kaksi ihmistä saa saman numeron
Määritelmä on yksi rivi: interventiokehjykset jaettuna kierroksen kehyksillä. Kaikki vaikea piilotetaan siihen, mikä lasketaan kehykseksi ja mikä kierrokseksi.
Kehykset, ei episodit
Episodien laskeminen vähintään yhdellä interventiolla ei ole hyödyllistä: kymmenen episodia, joissa yksi liike ja kymmenen, joissa ajoit 80 prosenttia, molemmat antavat "10/10". Kehysluku erottaa ne, ja se on rakeisuus, joka tallennus jo omaa - LeRobot-tietojoukkomuodossa jokainen aikavaihe on rivi, joten interventiolippu on yksi boolen sarake tilan ja toiminnon vieressä. Tässä se kirjoitetaan per kehys sillä hetkellä kun haltuunotto alkaa ja poistetaan kun hallinta palaa.
Nimittäjä sisältää korjaukset
Kaksi nimittäjää ovat puolustettavia - kierroksen kokonaiskehykset tai kehykset politiikan ajo itsenäisesti - ja ne poikkeavat pahasti korkeilla interventiotasoilla. Ota hallinta 400:sta 1000 kehyksestä ja ensimmäinen antaa 40 prosenttia, toinen 67 prosenttia. Verrattaessa yhtä kierrosta mitattuna ensimmäisellä tavalla seuraavaan mitattuun toisella tavalla on kuinka todellinen parannus katoaa. Ota kokonaiskehykset ja älä palaa valintaan keskellä sarjaa.
Päätä kerran mitä tapahtuu siirtymäkehyksille
Siellä on aina sauma. Kun hallinta siirtyy, jotkin kehykset kuuluvat kummallekaan puolelle: varsi pidetään, johtaja kohdistaa, tallennus on jäädytetty. Tässä putkessa nämä siirtymäkehykset pysyvät raakavirtassa eivätkä koskaan siirry kuratoiduiksi episodiksi - ne eivät ole politiikan käyttäytymistä eikä korjausta, jota kannattaa opiskella. Laske sauma samalla tavalla joka kierros: 30 Hz:llä kuusi siirtymää, joilla on kahden sekunnin sauma, on 360 kehystä, tarpeeksi siirtää prosenttipiste.
Kehykset tai episodit; kokonaisajo tai vain itsenäinen; siirtymäkehykset sisään tai ulos. Mikä tahansa näistä kolmesta muutettu hiljaa kierrosten välillä tekee käyrästä merkityksettömän. Kirjoita kaikki kolme muistiin.
Kirjataan se siten, että numero selviää istunnon yli
Mittari käynnissä olevan prosessin tilapaneelissa on lukeminen: se katoaa uudelleenkäynnistyksen yhteydessä eikä sitä voi piirtää. Yksi vain liitettävä rivi per ajo kattaa koko sarjan - sisältäen mikä tarkistuspiste ajoit, koska se muuttuu joka kierros ja sekoittaminen mitätöi mitä seuraa.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Kaksi kenttää kantaa painon. train_mix on mitä syötit seuraavaan harjoitustyöhön; ilman sitä mitään ei voida katsoa kuuluvan. eval_protocol nimeää kiinteän testin, jonka ajoit sen jälkeen, ja on kenttä, joka jätetään useimmin tyhjäksi. ay-robots-ohjaajassa haltuunottotila raportoi kierroksen interventiokehjyslaskun, joten kirjaaminen on transkriptio pikemminkin kuin instrumentointi; tietojoukko-dokumentaatio kattaa sen, minne per-frame-sarakkeet laskevat.

Käyrän lukeminen: kolme kierrosta, yksi tuomio
Kolme kierrosta on vähimmäismäärä lukemiselle, koska kaksi pistettä ovat aina viiva. Alla oleva taulukko on kirjanpidon malli paikkamerkkeinumeroilla, ei mittauksia mistään ajosta. Etsit monotonista laskua, jota vastaa onnistumisten kasvu kiinteässä testissa.
| Kierros | Tarkistuspiste ajettu | Kehykset | Interventiokehjykset | Aste | Onnistumiset (20:stä) |
|---|---|---|---|---|---|
| 0 (perusta) | peruspolitiikka | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | kierros 0 sekoituksesta | 5 610 | 980 | 17,5 % | 10 |
| 2 | kierros 1 sekoituksesta | 5 412 | 611 | 11,3 % | 11 |
| 3 | kierros 2 sekoituksesta | 5 380 | 598 | 11,1 % | 12 |
Kierrokset yksi ja kaksi tekevät työtä. Kierros kolme ei: 11,3 11,1 prosenttia vastaan on harjoittelun-pyörivät vaihtelun sisällä mistään mitatusta fyysisellä varella, ja neljäs kierros samojen korjausten tuottaa iltapäivän mitään. Tasainen segmentti sanoo muuta jotain rakenteellista.
- Loput epäonnistumiset eivät ole korjattavissa teleoperaatiolla - objekti ulottumattoman ulkopuolella, otimen geometria, nivel rajassaan. Mikään korjaus data ei korjaa kinemaattista seinää.
- Korjaukset ovat liian harvat perusjakauman vastaan siirtää gradienttia, ja mitään ei painota niitä.
- Korjaukset ovat ristiriidassa toistensa kanssa, joten politiikka keskiarvot kaksi strategiaa ja laskeutuu niiden väliin.
- Virhe on ylävirtaan: kamera liikkui, valaistus muuttui, rannekalvon näkymä ei enää vastaa harjoittelua.
- Tehtävä on tämän politiikan luokan katon rajalla tällä laitteistolla, ja seuraava askel on enemmän perusdata.
Kaksi viimeistä eivät ole silmukan virheitä. Sirius-Fleet:ssä ihmisen laskenut tarve on suunniteltu tulos: robotti itsenäisyyden parantamisen myötä sen poikkeama ennakoivat mukauttavat ennustuskriteereitään, mikä johtaa harvempiin pyynnöihin ihmisen toimintaan ja vähittäin vähentää ihmisen työkuormaa ajan myötä. Siellä kriteeri mukauttaa tarkoitukseen. Manuaalisessa silmukassa sinun mukauttaa myös, äänettömästi - joten aste, joka litistyy koska tehtävä on sen katon rajalla näyttää samalta kuin aste litistyy koska operaattori lakkasi huomaamasta. Joka on seuraava ongelma.
Ansa 1: laskeva aste ei ole nouseva onnistumisaste
Intervention rate mittaa tarkalleen yhtä asiaa: kuinka paljon ajosta päätit omistaa. Tämä päätös on sinun, tehty reaaliajassa, ja se liikkuu. Kierros nolla ota hallinta ensimmäisessä huonossa lähestymiskulmassa; kierros kolme mennessä olet katsonut politiikan palautua tusina niistä ja antaa sen yrittää. Kynnys liikkui; politiikka ei ehkä. Aste putoaa joka tapauksessa.
Ihmisen luottamus on ainakin mallinnettu määrä kirjallisuudessa kuin oletettu vakio. Sirius painottaa harjoitusnäytteitä likimääräisellä ihmisen luottamuksella ja optimoi politiikan painotetulla käyttäytymisen kloonuksella, ja raportoi 8 prosentin noususta simulaatiossa ja 27 prosentissa todellisella laitteistolla nykyisen art-politiikan onnistumisenaste, kahdella konvergenssin nopeudella. Tämä käsittelee luottamusta painona datassa. Se ei korjaa kynnystä pääsi kierros nolla kierros kolme.
Et voi poistaa ajautumista, joten pari aste jotain mitä kynnys ei voi saavuttaa: kiinteä joukko tutkimuksia, joissa et puutu ollenkaan, arvostettu kriteerin mukaan kirjoitettu ennen kierrosta. Aste, joka putoaa, kun paritettu onnistumisenaste pysyy paikoillaan, on habituaation allekirjoitus - arvoinen pidettävä, koska silmukan sisältä se tuntuu edistykseltä.
| Intervention rate | Onnistumisaste kiinteällä protokollalla | Todennäköisin lukeminen |
|---|---|---|
| putoaa | nousee | Kierros toimi. Jatka. |
| putoaa | tasainen | Kynnys ajautui, tai korjaukset poistivat vaivaa poistamatta epäonnistumisia. |
| putoaa | putoaa | Korjaukset heikentävät politiikkaa. Tarkista seos ja heidän sisäinen johdonmukaisuus. |
| tasainen | tasainen | Kierros ei ostanut mitään. Muuta seos, tarkistuspiste tai tehtävä ennen enemmän keräämistä. |
| nousee | putoaa | Regression. Epäile harjoittelun sekoitusta, muuttunutta kameraa tai tarkistuspisteen sekoitusta ennen menetelmää epäilemistä. |
Ansa 2: ilman kiinteää protokollaa, mittaat huonetta
Todellinen robotti arviointi on kallista ja vaikea toistaa. SIMPLER-kirjoittajat motivoivat simuloitua arviointia havainnoilla, että todellisen maailman arviointi tällaisista politiikoista ei ole skaalattavissa ja kohtaa toistettavuushaasteet, jotka todennäköisesti pahenevat kun politiikat laajentavat tehtävä-spektrumaan. RoboArena hyökkää toisesta puolesta, yli 600 parittaisista todellisen robotin arviointiepisodeista seitsemän yleistä politiikkaa vastaan, ajamalla arvioimisilla seitsemän akateemisen laitoksen arvioimisella DROID-alustalla. Sen arvioimiset valitsevat omat tehtävät ja ympäristöt mutta niiden on tuomittava politiikan parit kaksoissokea; paperi raportoi, että tämä joukkoistaa sijoitus yleistävän politiikan suoritukseen tarkemmin kuin tavanomainen, keskitetty arviointi.
Et aja 600 parittaista episodia yhdelle SO-100 työpöytäpajassa. Mitä voit tehdä, poista vaihtelu, jonka hallitset - lista tarpeeksi tylsä että se yleensä ohitettava.
| Ulottuvuus | Jäädytä tämä | Mikä ajautuu jos et |
|---|---|---|
| Aloitusasento | Kirjoitettu kotisijainti, ajettu ennen jokaista kokeilu | Liikerata alkaa poikkeaman ulkopuolella |
| Objektit | Merkityt merkit, ja samat fyysiset objektit varattu arviointiin | Parempi politiikka on todella lähempänä objektia |
| Kamerat ja valo | Samat kiinnitykset, indeksit, altistus; sokaiset suljettu; valokuvaa asetup | Vaihdetut kamera-indeksit voivat yksin dominoida tulokset |
| Tutkimukset ja pysäytyssääntö | Kiinteä n, kiinteä aikakatkaisu, kriteeri kirjoitettu ennen kierrosta | Jälkikäteen asetetut kriteerit kääntävät lähellä-misses mihin tahansa sinulla on |
| Operaattorin käyttäytyminen | Ei interventioita arviointikokeisiin | Arviointi tulee toiseen korjaus-istuntoon |
Sitten aritmeettinen, armottomalla kokeilujen määrällä, jota työpaja varaa. Normaalisti approksimaation alle, 60 prosentin onnistuminen 20 tutkimuksissa kantaa vakiovirhe lähellä 11 prosenttia - neliöjuuri 0,6 kertaa 0,4 yli 20 - ja ero kahden tällaisen välillä kantaa noin 15. Hyppy 60:sta 70 prosenttiin on siten sopusoinnussa mitään ei ole tapahtunut. Viisikymmentä tutkimusta tuovat per-kierros kuvan noin 7 pisteeseen, ja maksaa iltapäivän.
Tämä epäsymmetria on argumentti intervention rate: lasketaan tuhansia kehyksiä pikemminkin kuin kaksikymmentä binaari tuloksia, se liikkuu aiemmin ja tasaisemmin. Varoitus on, että kehykset episodin sisällä ovat voimakkaasti korreloituneita - yksi huono otin tuottaa sata peräkkäinen intervention kehystä - niin tehokas näytteen koko on lähempänä siirtymisen määrää. Käsittele aste varhaisena indikaattorina ja onnistumisaste hitaana maantotukkina.
Arviointiepisodilla ei saa koskaan tulla koottuun harjoittelutietoon - muuten kierros n+1 arvioidaan datasta, jonka se koulutettiin, ja käyrä mittaa muistamista.
Ansa 3: vain korjausten opiskelu taipuu politiikkaa
Korjaukset ovat mielenkiintoisimpia tietoja, joten vaisto on opiskella niistä. Älä. Ne tulevat rakentukselta tilatahtavasta tilaavaruuden kapealista, missä politiikka jo epäonnistui ja sanovat melkein mitään suurimmasta osasta ajoa, joka toimi. Hienosäädä pelkästään kyseiseen osaan ja saat politiikan hyvä palautumaan epäonnistuneesta lähestymistavasta, joka on unohtanut kuinka tehdä puhtaasti.
Mandlekar ja kollegat rakensivat etäisen intervention järjestelmänsä tämän ympärille. Heidän kehystäminen: manipulaatio tehtävät sisältävät pullonkauloalueita, joilla vaaditaan tarkkaa toimintosarjaa - kahvikone kupin asettaminen on heidän esimerkki - missä pienet poikkeamat johtavat tiloihin, joita esittelyt ei koskaan peittäneet. Heidän algoritmi kouluttaa iteratiivisesti uusilla tiedoilla niin politiikka oppii traversoimaan näitä pullonkauloja, ja he raportoivat agentit koulutettavat intervention tiedoilla lyö agentit koulutettavilla vastaavalla määrällä näytteitä ei-interventio demonstraattoreista.
- Nopea: lyhyt ajo muutaman kymmenen episodin yli on halpa tarpeeksi toistaa
- Kohdennettu: gradientti hallitaan tiloilla, joista välitit
- Halpa testaamaan onko korjaustyyliä oppiminen ollenkaan
- Hienosäätö jakelu ei enää muistuta tehtävän jakelussa
- Nimellinen käyttäytyminen voi heikentää silminnäkyvät kierroksen sisällä
- Aste voi pudota kun onnistuminen putoaa sen kanssa - puhtaat segmentit vaihdettu palautukset
Sekoitussuhdetta on hyperparametri ja ansaitsee kirjoitettu alas. Seuraava tietojoukko kokoonpano on missä se päätetään: alkuperäinen esittelyt lisä korjaus sarja, episodin valinta eksplisiittinen per lähde pikemminkin kuin sääntö, joka hiljaa vetää mitä on saatavilla. Siellä on yksi kokoonpano askel ohjaamossa, ja tulos on tavallinen tietojoukko - katso harjoittelun dokumentaatio. Mitä ei mikään työkalu tee sinulle on kirjaaminen mikä suhde tuotti mikä käyrä.
Ansa 4: ihminen ei ole johdonmukainen asiantuntija
DAgger:in teoria olettaa asiantuntijaksi. Et ole yhdessä teknisessä mielessä: korjaukset eivät ole näytteitä kiinteistä ehdollisista jakeluista toiminnoista. ACT kirjoittajat nimeävät tämän kun listaa esteet hienoon manipulaatioon - virheet kasautuvat ajan, ja ihmisen esittelyt voivat olla epävakaita. Heidän järjestelmä silti saavuttaa 80 90 prosentin onnistuminen kuusi todellista tehtävää kymmentä minuuttia esittelystä, niin ongelma on traktioitava, ei poissa.
Robomimic tutkimus tekee pisteen datapuolelta. Kuuden offline-algoritmissa viidellä simuloitu ja kolmella todellisen maailman monivaihe tehtävillä, sen oppitunnit sisältävät herkkyys suunnittelu valinnoista, riippuvuus esittely laadusta, ja - yksi, joka sattuu eniten tässä - muuttujavuus johtuvat pysäytys kriteereihin, koska harjoittelu ja arviointi tavoitteet eroavat. Tarkistuspiste alhaisin menetys ei ole luotettavasti, jolla on korkein onnistumisaste.
Siellä on laitteiston versio tästä: sisääntulomuoto muotoaa korjaus. johtaja-seuraaja asetup tuottaa jatkuva, ihmisen-tahtinen liikeradat. Näppäimistö liikuttaa ovat kiinnikkeillä kova palvelimen - kaksi astetta varren niveliä, neljä otimella - niin sama aie tulee portaikko pieni askeleet. Liukusäädin lähettää absoluutti tavoitteet ja palvelin liikkuu korkeintaan kuusi astetta heihin kunkin puhelun. Kolme tilaa, kolme toiminta jakelussa; sekoittaa kaikki kolme saman korjaus sarjaan ja sitten ihmetellä miksi lähestymistapa osoittautui värisevä on itse tehty. teleoperaation dokumentaatio kattaa mitä jokainen muoto lähettää.
Intervention paino: IWR ja mitä tuli jälkeen
Jos korjaukset ovat arvokas vähemmistö, periaatteen korjaus on paino pikemminkin kuin poissulkeminen. Intervention Weighted Regression on viite toteutus: tieto on osio intervention ja non-intervention näytteisiin, ja kaksi osio on näytteistetty yhtä suuresti harjoittelun aikana. Korjaus sarja, joka on viisi prosenttia kehyksiä sitten osallistuu puoli gradientti, ilman nimellinen käyttäytyminen katoaa jakelussa.
Tasainen osuus on aloitus piste, ei laki. Sirius yleistää sen korvaamalla binaari osio jatkuva paino likimääräisellä ihmisen luottamuksella; Sirius-Fleet siirtää päätös ylävirtaan, käyttäen visuaalinen maailma malli ja poikkeama ennakoivat päätettävä kun ihminen pyydetään ollenkaan. Yhteinen ketju: intervention lippu on harjoittelu signaali, ei vain kirjanpito sarake.
| Menetelmä | Kuka päättää kun ihminen toimii | Kuinka intervention tieto käytetään | Raportoitu tulos |
|---|---|---|---|
| DAgger (2011) | Kiinteä aikataulu; asiantuntija merkinnät vieraillut tilat | Yksi kasvaa tietojoukko, painottamaton | Kehystävä vähentämisenä ei-katanraja online oppimiseen |
| HG-DAgger (2019) | Ihminen, haltuunottoa hallinnoiva todellinen järjestelmä | Aggregoitu; lisä opittu turvallisuus kynnys mallin epävarmuus | Parempi kuin DAgger ja BC ajossa; ei intervention laskuja annettu |
| IWR (2020) | Ihminen, etäisen teleoperaation kautta | Intervention ja non-intervention näytteet piirretty yhtä suuresti | Lyö ei-interventio esittelyt yhtä suurella näytteen määrällä |
| Sirius (2022) | Ihminen, käyttöönottamisen aikana | Painotettu BC, painot likimääräisestä ihmisen luottamuksesta | 8 % voitto simulaatiossa, 27 % todellisella laitteistolla; 2x nopeampi konvergenssissa |
| ThriftyDAgger (2021) | Järjestelmä, haltuunottoa novellisuus ja riski | Interaktiivinen keräys valvonta bujetin alla | Käyttäjätutkimus (N=10): 58 % korkeampi ihminen ja 80 % korkeampi robotti suorituskyky kuin seuraava paras menetelmä |
| Fleet-DAgger (2022) | Järjestelmä, kohentaa huomio yli laivasto | Laivasto oppiminen pisteyttää Return on Human Effort | Jopa 8,8x korkeampi ROHE kuin perusviivat |
| Sirius-Fleet (2024) | Poikkeama ennakoivat kanssa itse-sopeutuvat kriteerit | Monitehtävä oppiminen visuaalinen maailma mallin kanssa | Harvempia intervention pyyntöjä kun autonomia parantaa |

Neljä mittaria ansaitsee kirjaaminen seuraavasti aste
- Siirtymät per ajo. Kaksikymmentä lyhyt korjaukset ja yksi pitkä antaa samanlaiset korot ja kuvaa eri politiikat - yksi hermostunut, yksi yksi sokea piste.
- Keskinäinen intervention pituus. Nousevat pituus laskeva määrä tarkoittaa loput epäonnistumiset ovat kovasti ne, mitä myöhään edistys näyttää.
- Aika ensimmäinen intervention. Politiikka, joka saa kauemmas ennen neuvoa tarvitse parantaa jopa kun kokonais aste on tasainen.
- Missä interventiot klusterin. Bin lippu normalisoitu episodin edistymisen; vakaa huippu kierrosten näytteet yhteen pullonkaulaan.
Kierros protokolla voit todella ajo
Mitattu kierros on kuusi vaiheet ja tuottaa yksi rivi log. Ensimmäinen neljä ovat silmukka; viimeinen kaksi tehdä se mittaus.
- 1Jäädytä arviointi protokolla ennen kierros nolla
Kirjoita alas aloitus asento, objekti sijoitus, kamerat, tutkimus määrä, aikakatkaisu ja onnistuminen kriteeri. Valokuvaa pöytä. Jos asiakirja on muuttua, sarja uudelleen.
- 2Mitkaa perusviivan
Ajo protokolla ilman interventioita ja ennätys onnistumiset; sitten ajo yksi aseinteistetty istunto haltuunottona ja ennätys aste. Nämä kaksi numero ovat kierros nolla.
- 3Kerää korjaukset yksi johdonmukainen tyyli
Yksi panos muoto per kierros, yksi operaattori jos voit hallita. Ottaa hallintaa kriteeri voit tilaa ulos korkea - 'otsin enemmän kuin kahden sentimetrin ulos lähestymistavassa' - ja pidä se kierros.
- 4Triage jokainen episodi sama päivä
Korjaus, arviointi tai hylätä. Epäselvä episodi saada hylätä, ei tallennettu teoria, että enemmän tieto auttaa - korjaus joissa itse epäonnistui on huonompi kuin episodi.
- 5Kirjoita seos eksplisiittisesti
Alkuperäinen esittelyt lisä korjaukset, episodi valinta per lähde. Ennätys perus laskea, korjaus määrä ja mikä paino - tämä on kenttä sinä haluat kolme viikkoa.
- 6Jatka tarkistuspisteestä, sitten mitkaa uudelleen
Kouluttaa kokoonpantu tietojoukko edellisestä tarkistuspisteesta pikemminkin kuin perusmalli, ajo jäädytetty protokolla lisä yksi aseinteistetty istunto, liitä rivi, ja vertaa edelliseen kaksi kierros.
Kaksi raja muuttaa kuinka luet heikko kierros. Jatkaminen tarkistuspisteestä alustaa painot se - ei optimointi resume, niin aikataulu alkaa raikas ja lyhyt ajo konvergoitunut tarkistuspisteestä voi liikkua hyvin vähän. Ja johtaja kohdista liike alussa haltuunottoa on vähintään maileage todellinen laitteisto kaikista ketju; jos korjaukset alkaa pariton juoksija, katso siellä ennen sekoitus syyttävät.
Mitattu silmukka, jo johdotettu
ay-robots toteuttaa nämä kuusi vaiheet tuote ominaisuudet: ottaa hallintaa keskellä-ajo johtaja varsi, näppäimistö tai liukusäätimet, kanssa intervention kehykset merkitty automaattisesti; triage jokainen episodi korjaus, arviointi tai hylätä; kirjoita seuraava tietojoukko alkuperäisestä esittelystä lisä korjaukset, episodi valinta eksplisiittinen per lähde; ja aloita seuraava harjoittelu ajo edellisestä tarkistuspisteestä pikemminkin kuin perusmalli.
Katso kuinka DAgger silmukka toimiiMitä numeroita ei voi kertoa sinulle
Mitään tämä ei ole ratkaistu, ja kaunis käyrä ei saa vakuuttaa sinua muutoin. Intervention aste mittaa yhteinen järjestelmä - politiikka, laitteisto, operaattori, huone - ja katsoo mitään yksin. Se ei voi tuomita onko korjaukset olivat hyviä, ja se putoaa iloisesti tehtävä, joka tuli helpompi koska objekti ajautui kaksi sentimetriä lähempänä kolme viikko.
Mitä se tekee kääntyy epäselvä kuva sarake voit väitellä. Vaihtoehto ei ole parempi mittari; se on kolme viikkoa keräämisen korjaukset käyrä olisi kertonut sinulle, jälkeen kierros kolme, lopettaa keräämisen. Tutkimus kirjallisuus määritellään interaktiivinen imitaatiooppiminen ihmisen palaute annettu ajoittain robotti suoritus aikana, sallii online parannus käyttäytymisen; perhe on laaja, ja ei järjestely se toimii ilman numero per kierros. Katso myös SO-100 imitaatiooppimisen opas varten perus tietojoukko sekoita vastaan, ajaminen politiikka varten johtopäätös puoli, ja DAgger silmukka sivu varten toteutettu putkesta.
Onko intervention aste juuri yksi miinus onnistumisaste?▾
Ei. Aste mittaa kuinka paljon ajo sinä otit hallintaan; onnistumisaste mittaa onko tehtävä sai valmis ilman sinua. Ajo voi onnistua 30 prosentti intervention aste, ja ajo ilman interventioita voi epäonnistua kokonaan. Kuitenkin eroavat kohinassa: aste liikkuu tasaisesti tuhansia korreloitu kehykset, onnistumisaste hyppää välillä kourallinen binaari tulokset. Kirjaa molemmat.
Kuinka monta arviointi tutkimukset minulla on tarve onnistumisaste merkityksen mitään?▾
Enemmän kuin tuntuu kohtuullinen. Alle normaali approksimaatio, 20 tutkimukset klo totta 60 prosentti onnistumisaste kantaa vakiovirhe lähellä 11 prosenttia, niin 10 pisteen liike kierrosten välillä on erottamaton melusta; 50 tutkimukset tuoda kuvan noin 7. Jos et varaa 50, pidä tutkimus laskea sama kierrosten ja käsittele pieni liikkeet kuten selkeitä.
Mitä sekoitus suhde esittelystä korjaukset minulla on aloittaa?▾
Dokumentoitu aloitus piste on IWR:n: osio tieto intervention ja non-intervention näytteet ja vetää ne yhtä suuresti, niin korjaukset osallistuu puoli gradientti miten pieni osuus kehykset ne ovat. Jos asetup ei voi paino näyte, likiarvo se episodin laskea kokoon aineiston ja ennätys suhde. Opiskelu pelkästään korjaukset on vaihtoehto tilalle.
Minun intervention aste nousi jälkeen kierros. On kierros tuhlata?▾
Ei välttämättä, mutta tarkista tylsä selitykset ensin: ei tarkistuspiste sinä ajo vastaa yhden sinä koulutettava, oliko kamera indeksi tai kiinnitys muutos, oliko objekti sijoitus ajautua, oliko korjaus tyyli johdonmukainen. Jos kaikki neljä ovat puhdas ja paritettu onnistumisaste myös putoaa, epäile seos - liian vähän perus esittelystä vastaan korjaukset, tai korjaukset että ristiriidassa toisistaan. Genuiini regression kuuluu log, ei bin.
Voinko ohita kiinteä arviointi protokolla ja vain katsoa intervention aste?▾
Vain jos hyväksyt että sinä et voi kertoa parannus habituaatiosta. Aste riippuu sinun oman reaaliaikaisen kynnys astua, ja kynnys putoaa kun olet tottunut politiikan mukaan. Jäädytetty protokolla on osa mittaus sinun kynnys ei voi saavuttaa - naulattu merkinnät, kirjoitettu koti asento, kiinteä tutkimus laskea, kriteeri päätetty ennen kierros. Se on pysyä muuttamatta kierrosten.
Pidä log tietovarastossa, ei muistiinpanot: kierrokset ovat päivän erillään, laitteisto saadaan uusittu, ja henkilö lukeminen käyrä lokakuussa olet sinä ilman muistoa elokuusta. dokumentaatio FAQ kattaa operatiivisen yksityiskohdat jätetty tässä.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started