
Az intervention rate - intervention frame-ek osztva a futás frame-jeivel - a legolcsóbb őszinte haladási jel, amit egy emberi kapuval felügyelt DAgger-hurok rendelkezhet. Ez a cikk úgy definiálja, hogy két ember ugyanazt az értéket számítja ki, bemutatja, hogyan kell naplózni, és végigmegy a négy módon, ahogyan megtéveszti: operátor szokásosság, sodródó értékelési beállítás, csak korrektálással történő tanulás és egy olyan ember, aki hétfőn másként korrigál, mint kedden.
Egy DAgger-kör produktívnak érzi magát, amíg benne van. Vezet a policyt, átveszi az irányítást, amikor hibázik a fogást, menti a korrektálásokat, újratanítja, és a következő futás - esküdnél - egy kicsit simábbnak tűnik. Két kör múlva nem tudja azt mondani, hogy valami változott-e, mert "egy kicsit simább" nem mennyiség.
A huroknak egy szám szükséges körönként, és egy emberi kapuval felügyelt hurokban ez a szám szinte ingyenes: az az arány, amikor az irányítás alatt volt az irányítás alatt az irányítás alatt helyett a policy alatt. Ez a cikk úgy definiálja, hogy két ember ugyanazt az értéket számítsa ki, naplózza, olvassa az eredményül kapott görbét, és elnevezi a négy módot, ahogyan megtéveszti, ha önmagában áll. Az elmélethez, amelyet ez a darab feltételez, lásd a DAgger explainer és az emberi kapuval felügyelt variant; a praktikus megfelelő a DAgger-hurok futtatása SO-100-on.
A rövid verzió
- •Intervention rate = intervention frame-ek / futási frame-ek. Frame-ek, nem episódok, és a nevező magában foglalja a korrigálásra fordított frame-eket.
- •Sík görbe három körön keresztül azt jelenti, hogy a körök nem vásárolnak semmit - változtassa meg a keveréket, az ellenőrzőpontot vagy a feladatot negyedik gyűjtése helyett.
- •A csökkenő intervention rate nem növekvő sikeres ráta. A lépésbe lépés küszöbértéke csökken, ahogy az bizalom nő.
- •Fagyasztott értékelési protokoll nélkül - ugyanaz a kezdeti pózok, objektumok, kamerák, próbaszám - a szobát mérje.
- •Csak korrigálások alapján történő tanulás torzítja az állapot eloszlást. Az IWR válasza: húzzon intervention és non-intervention mintákat egyenlő arányban.
Miért szükséges egy körnek egy szám egyáltalán
DAgger azért létezik, mert van egy eloszlási probléma, és az eloszlási problémák láthatatlanok. Ross és Bagnell azt mutatták, hogy imitation learning egy rögzített bemutatási készletből vezet az összeadódó hibákhoz és egy regresszióhoz kötötthez, amely négyzetesen növekszik az időhorizontban: ha a tanuló elhagyja az állapotokat, amelyeket a demonstráns meglátogatott, semmi az adatban nem mondja meg, hogy hogyan jöjjön vissza. DAgger ezt az iterálással javítja - futtassa a policyt, címkézze fel az állapotokat, amelyeket meglátogat, összesítsen, újratanítsen - amely Ross, Gordon és Bagnell no-regret online tanulásra való csökkentésként keretezte.
Ennek a keretezetésnek van egy következménye, amelyet az emberek kihagynak. A garancia az iterációk politikáinak sorrendjére vonatkozik, nem egyetlen futásra. Semmi nem mondja meg, hogy az Ön körünk három segített-e. Az egyetlen módja annak, hogy tudjuk, az, hogy mérjük az egyes iterációkat. Kelly és munkatársai a HG-DAgger-t azért vezették be, mert a klasszikus DAgger az expertet akciócímkékre kéri, míg az újoncok még irányítás alatt vannak, amely a dolgozat szerint csökkenthet a biztonságot és, emberi szakértőkkel, valószínűleg degradálja a címke minőségét az észlelt aktuátor késleltetés miatt. HG-DAgger egy biztonsági küszöbértéket is tanul egy modell-bizonytalanság-alapú kockázati metrikához, és javított teljesítményt jelent DAgger és viselkedési klónozás felett egy vezetési feladaton. Nem tesz közzé intervention számítási; azok, amelyeket saját maga készít.
Az arány definiálása úgy, hogy két ember ugyanazt a számot kapja
A definíció egy sor: intervention frame-ek osztva a futás frame-jeivel. Mindent nehéz elrejt abban, amit egy frame-nek és egy futásnak számít.
Frame-ek, nem episódok
Az episódok számításával, amelyekben legalább egy intervention van, haszontalan: tíz epizód egy-egy tolással és tíz, amelyekben nyolcvan százalékig vezettél, mindkettő "10/10" adja. A frame szám elkülöníti őket, és ez az a granularitás, amely a felvételnek már rendelkezik - a LeRobot adatkészlet formátumban minden időlépés egy sor, így az intervention flag egy boolean oszlop az állapot és a cselekvés mellett. Itt írja az időkeretre azt a pillanatot, amikor átvétel kezdődik, és visszacsatolja az irányítást.
A nevező magában foglalja a korrektálásokat
Két nevező védhető - a futás teljes frame-jei, vagy a policy által autonóm módon felhajtott frame-ek - és rosszul eltérnek magas intervention szinteken. Vegyél be 400-ról 1000 frame-ből, az első 40 százalékot adja, a második 67 százalékot. Az egyik módon mért kör összehasonlítása a másodikként mért következővel szemben az, ahogy egy valós javulás eltűnik. Vegyél teljes frame-eket és soha ne vizsgálja meg újra a választást a sorozat közepén.
Döntse meg egyszer, hogy mi történik az átadási frame-ekkel
Mindig van varrás. Ha az irányítás átmegy, néhány frame semmilyen oldalhoz nem tartozik: a kar tartva van, a vezető igazít, a felvétel fagyasztott. Ebben a csővezetékben ezek az átadási frame-ek a nyers adatfolyamban maradnak, és soha nem lépnek be a kurátort epizód - sem policy viselkedés, sem tanulás érdemes korrigálás. A varrást ugyanúgy számolja ki minden körben: 30 Hz-en hat átvételenként két másodperces varrással, 360 frame-ek, elég a százalékpont megmozdításához.
Frame-ek vagy episódok; teljes futás vagy autonóm; átadási frame-ek be vagy ki. A három közül bármelyik csendesen megváltozott a körök között, a görbe értelmét veszti. Mindhárom írjon le.
Naplózása úgy, hogy a szám túléli a munkamenetet
Egy futó folyamat státusz paneljében szereplő metrika egy leolvasás: az újraindítás során eltűnik, és nem lehet ábrázolni. Egy hozzáfűzés-csak sor körönként fedezi az egész sorozatot - beleértve azt, hogy melyik ellenőrzőpont vezettél, mivel ez minden körben változik, és összekeveri az azt követő.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Két mező hordja a súlyt. train_mix az, amit a következő tanítási feladatra etettél; anélkül semmi nem attribútható. eval_protocol az elnevezése a rögzített teszt, amelyet később futtattál, és a legtöbbször üresen hagyott mező. Az ay-robots cockpitben az átvételi státusz az intervention frame szám a futó munkamenethez, így a naplózás transzkripció, nem pedig instrumentálás; az adatkészlet dokumentáció abban foglalkozik, ahol az per-frame oszlopok leszállnak.

A görbe olvasása: három körön belül, egy ítélet
Három körben van az olvasás minimuma, mert két pont mindig egy sor. Az alábbi táblázat egy naplózási sablon helyőrzőszámokkal, nem mérések egyetlen futásból. Egy monoton csökkenést keres, amelyet a sikeres növekedés egyez egy rögzített teszt.
| Körös | Ellenőrzőpont vezető | Frame-ek | Intervention frame-ek | Ráta | Sikerek (20-ból) |
|---|---|---|---|---|---|
| 0 (alap) | alap policy | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | 0. körből keverékből | 5 610 | 980 | 17,5 % | 10 |
| 2 | 1. körből keverékből | 5 412 | 611 | 11,3 % | 11 |
| 3 | 2. körből keverékből | 5 380 | 598 | 11,1 % | 12 |
Az első és második körben munka történik. A harmadik körben nem: 11,3% ellen 11,1% az egy fizikai karon mért bárminek a futás-fuss variációján belül, és a negyedik körét az azonos korrektálások semmi után való délután egy délután után. A sík szegmens azt mondja, hogy valami szerkezeti változtatást kell tenni.
- A fennmaradó kudarcok nem korrigálható teleoperation által - objektum elérhetetlenül, gripper geometria, egy közös határán. Nincs korrekciós adatok javítják a kinematikai falat.
- A korrektálások túl kevesek az alap adatkészlet ellen a gradiens megmozdításához, és semmi nem súlyozza őket.
- A korrektálások ellentmondanak egymásnak, így az politika átlag két stratégiát és földek között.
- A kudarc felfelé irányuló: kamera mozgatott, a megvilágítás megváltozott, a csuklónézet már nem felel meg az edzésnek.
- A feladat erre az politika osztályra erről a hardveren a mennyezetben van, és a következő lépés több alap adat.
Az utolsó kettő nem kudarcsai a huroknak. A Sirius-Fleet-ben az ember csökkenő szükségessége a tervezett kimenetel: ahogy a robot autonómiája javul, anomália prediktora alkalmazkodnak az előrejelzési kritériumaikhoz, ami kevesebb kéréshez vezet az emberi beavatkozásra és fokozatosan csökkenti az emberi munkaterhelést az idő múlásával. Ott a kritérium szándékosan alkalmazkodik. Egy kézi hurokban az Ön is alkalmazkodik, csendesen - így egy ráta, amely azért simul meg, mert a feladat van a mennyezetben nézd ki pontosan, mintha meg lett volna, mert az operátor abbahagyta a figyelmet. Melyik a következő probléma.
Csapda 1: csökkenő ráta nem növekvő sikeres ráta
Az intervention rate pontosan egy dologra mér: a futás mekkora részét döntötte el, hogy a saját. Ez a döntés az Ön, valós időben meghozva, és mozog. A nulladik körben átveszi az első rossz közelítési szögben; a harmadik körre és nézett az politika visszaállni tucatjáról, és hagyd, hogy próbálja meg. Az Ön küszöb mozgatott; az politika talán nem. A ráta mindkét módon esik.
Az emberi bizalom legalább egy modellezett mennyiség az irodalomban, nem pedig egy feltételezett állandó. Sirius súlyozódik ki a tanítási mintákat közelítő emberi bizalommal, és optimalizálja az politikát súlyozott viselkedési klónozással, jelentve egy 8 százalékos növekedést a szimulációban és 27 százalékot valódi hardveren a politika sikeres ráta művészetének állapota felett, a konvergencia sebességének kétszeresével. Ez úgy kezeli az bizalmat, mint a súlyt az adatokon. Nem korrigálja a küszöbértéket a fejedben a nulladik körben és a harmadik között.
Nem tudja eltávolítani az sodródást, így párosítsa az arányt valamivel, amit az Ön küszöb nem érhetne el: egy rögzített próbasorozat, amelyekben egyáltalán nem avatkozni; egy kritérium ellen pontozva kör előtt írva. Egy ráta, amely csökken, míg a párosított sikeres ráta helyén marad, az szokásosság aláírása - megéri, hogy megragadják, mert a hurok belsejéből ez előrehaladásnak érzi.
| Intervention rate | Sikeres ráta rögzített protokollon | Legvalószínűbb olvasás |
|---|---|---|
| csökken | emelkedik | A körök működött. Folytatás. |
| csökken | sík | Az Ön küszöb sodródott, vagy a korrektálások eltávolították az erőfeszítést anélkül, hogy eltávolítanák a kudarcokat. |
| csökken | csökken | A korrektálások degradálnak az politikát. Ellenőrizze a keveréket és azok belső konzisztenciáját. |
| sík | sík | A körben semmi sem volt. A keverék, az ellenőrzőpont vagy a feladat módosítása előtt több gyűjtés. |
| emelkedik | csökken | Regresszió. Gyanúság gyakorolhat képzési keveréket, megváltozott kamerát vagy ellenőrzőpont mix-up a módszer gyanúsítása előtt. |
Csapda 2: rögzített protokoll nélkül, a szobát mérje
A valós robot értékelése drága és nehéz megismételni. A SIMPLER szerzői a szimulált értékelést az megfigyeléssel motiválnak, hogy az ilyen politikák valós értékelése nem méretezhető, és megismételhetőségi kihívások szembesülnek, amely valószínűleg rosszabbodik, ahogy a politikák szélesítik a feladat spektrumát. Az RoboArena a másik oldalról támadja, több mint 600 páros valós robot értékelési episódok a hét általános politika között, hét akadémiai intézmény értékelői által a DROID platformon futtatva. Az értékelői kiválasztja saját feladataikat és környezeteiket, de az politikákat párosítva kell megítélni a vak; a dolgozat azt jelenti, hogy ez a tömegből rangsorolás nyomon követi az általános-politika teljesítményt pontosabban, mint a hagyományos, központi értékelés.
Nem fogsz 600 páros episódok futtatni egy SO-100 egy műhelyen. Mit lehet tenni az a variancia eltávolítása, amelyet kontroll - egy lista unalmas elég, hogy általában átugrott.
| Dimenzió | Fagyasztás ez | Mit sodródó ha nem |
|---|---|---|
| Kezdeti póz | Egy írott otthoni pozíció, vezetett minden próba előtt | A pálya eloszlásból indul |
| Objektumok | Szalagos jelek, és az ugyanaz fizikai objektumok értékelésre fenntartva | Egy 'jobb' politika valóban egy közelebbi objektum |
| Kamerák és fény | Ugyanaz a szerelések, indexek, expozíció; redőnyök zárva; fotografálja a beállítást | Az kamera indexek cseréje szinte lehet dominálni az eredményt |
| Próbák és leállítási szabály | Rögzített n, rögzített időtúllépés, kritérium körben kör előtt írva | Post-hoc kritériumok közel-tévesztések bármilyen szükséged |
| Operátor viselkedés | Nincs intervention az értékelési próbák során | Az értékelés egy másik korrekciós munkamenet lesz |
Majd az aritmetika, könyörtelen a próbaszámban egy műhely megengedhet. A normál közelítés alatt 60 százalék siker több mint 20 próba fő egy standard hiba közel 11 százalékpont - a négyzetgyök 0,6 szor 0,4 több mint 20 - és a különbség két ilyen körök között körülbelül 15 százalékpont. A 60-ról 70 százalékra ugró ezért összhangban van-e semmi sem történt. Ötven próba hozza az per-körös számot körülbelül 7 pont, és költségek egy délután.
Ez az aszimmetria az érv az intervention rate: kiszámított több mint ezrezer frame helyett azt csökken később és simábban. A fenntartás az a frame-ek egy epizód nagy korrelálódott - egy rossz fogás hozza száz egymást követő intervention frame-ek - így a hatékony minta mérete közelebb van a átvételek száma. Az arányt az korai indikátor és a sikeres ráta mint lassú föld igazság.
Az értékelési episódok soha sem léphetnek az összeállított edzési adatkészletbe - ellenkező esetben körén+1 értékelt az adatok, amelyeket edzést végeztek, és a görbe intézkedések memorizálása.
Csapda 3: csak korrektálásokkal történő tanulás hajlítja az politikát
A korrektálások az érdekes adatok, így az ösztön az rá tanulni. Ne. Azok járnak konstrukció szűk szeletéből az állapot tér ahol az politika már kudarc és mondja szinte semmi többség az futást, amely működött. Finomhangolás az szelet egyedül és kapsz egy politika jó helyreállítani egy hibásított megközelítés, amely elfelejtette, hogy hogyan készítsen egy tiszta egy.
Mandlekar és munkatársai, akik távolsági beavatkozási rendszerükre építette. Az keretezésük: manipuláció feladatok tartalmaznak szűk régió pontosan sorozat műveletek - beszúrása egy pod egy kávéfőző gépbe az azok példa - ahol apró eltérések vezetnek az állapotok a bemutatások soha nem fedezte. Az algoritmusuk azt tanítják ismételt az új adatok így az politika tanul átpásás ezeket szűk helyek, és azok jelentik azt ügynökök képzett az intervention adatok versenyzik ügynök képzett az egyenértékű számú minta-intervenciós demonstrators.
- Gyors: egy rövid futást több mint egy néhány tucat episódok olcsó elég ismételni
- Célzott: az gradiens dominál az állapot, amely gondol
- Olcsó tesztelés hogy egy korrekciós stílus tanul egyáltalán
- Az finomhangolás eloszlás több már hasonló az feladat eloszlás
- Névleges viselkedés lehet szakadékig, hogy az egyetlen körben
- Az ráta lehet esik míg siker csökken vele - tiszta szegmens kereskedett helyreállítás
Az keverés-arány egy hyperparameter és érdemel írva. Összeállítása az következő adatkészlet az ahol döntötte: eredeti bemutatások plusz az korrekciós készlet, epizód kiválasztás kifejezett számon-forrás helyett egy szabály amely csendesen húz bármi áll rendelkezésre. Ott az egy összeállítás lépés az cockpitben, és az eredménye normál adatkészlet - lásd az edzés dokumentáció. Mit nem eszköz csinál neked rögzítés amely arány termelésből mely görbe.
Csapda 4: az ember nem konzisztens szakértő
DAgger elmélet arra számít egy szakértő. Az Ön nem egy technikai értelemben: az Ön korrektálások nem minták egy rögzített feltételes eloszlásáról műveletek. Az ACT szerzői adják ezt nevez amikor listáz az akadályokat az apró manipuláció - hibák összeadódnak az idő, valamint az emberi bemutatások lehet non-stationary. Az rendszer még eléri 80-90 százalékos siker hat valódi feladatok tíz percből bemutatások, így a probléma levezethető, nem hiányzik.
Az robomimic tanulmány teszi az pont az adatok oldaláról. Átszállít hat offline algoritmusok öt szimulált valamint három valódi-világ többfázisú feladatok, az leckéit tartalmaz érzékenység tervezési választások, függés bemutatás minőség, valamint - az egy visszás fájdalom legtöbb itt - változékonyság felmerülés abbahagyva kritériumok, mivel edzés valamint értékelés célok eltérnek. Az ellenőrzőpont az legalacsonyabb veszteség nincs megbízhatóan az a legmagasabb sikeres ráta.
Ott van egy hardver verziót ez: az beviteli mód alakú az korrekciós. Egy leader-follower beállítás előállít folyamatos, emberi-tempó pályák. Billentyűzet tolópontok vannak szorított kemény által az szerver - kettő fok az kar közös, négy az gripper - így az azonos szándék érkezik mint egy lépcsősor apró lépések. Csúszkák küldenek abszolút célok valamint az szerver mozog nagy legfeljebb hat fok felé azok számon egy szám. Három módok, három cselekvés eloszlás; keverés minden három egyik korrekciós állították majd csodálkoztam miért az megközelítés fordult jerky van önérdekelt. Az teleoperation dokumentáció fedez mi minden módok küld.
Az intervention-ek súlyozása: IWR valamint mi jött után
Ha korrektálások vannak az értékes kisebbség, az elv javítás az súly helyett exkluzivitás. Intervention Súlyozott Regresszió van az referencia implementáció: az adatok particionáló intervention valamint nem-intervention mintákat, valamint az kettő partíciókat mintázott az egyenlő arányban során edzés. Egy korrekciós készlet amely van öt százalék az képkockák majd hozzájárulnak fele az gradiens, nélküle a névleges viselkedés eltűnik az eloszlásból.
Egyenlő arány van egy kezdve pont, nem egy törvény. Sirius általánosít azt helyettesítésével az bináris partícióval egy folyamatos súly az közelített emberi bizalom; Sirius-Fleet mozgatja az döntés felfelé, használva egy vizuális világ modell valamint anomália prediktora mely döntse amikor egy emberi fel. Az közös szál: az intervention zászló van egy edzés jel, nem csak egy könyvelés oszlop.
| Módszer | Ki dönt amikor az emberi cselekvések | Hogyan intervention adatok vannak használt | Jelentette eredmény |
|---|---|---|---|
| DAgger (2011) | Rögzített menetrend; szakértő címkék meglátogatva államok | Egy növő adatkészlet, súlyozatlan | Keretezte mint egy redukció nem-regret online tanulásra |
| HG-DAgger (2019) | Az emberi, kapuzás irányítás egy valódi rendszeren | Összesített; plusz egy tanult biztonsági küszöb az modell bizonytalanság | Jobb mint DAgger valamint BC az vezetésen; nincs intervention szám adott |
| IWR (2020) | Az emberi, keresztül távoli teleoperation | Intervention valamint nem-intervention mintákat felhőzárolódott az egyenlő arányban | Versenyzik nem-intervenciós bemutatások az egyenlő minta szám |
| Sirius (2022) | Az emberi, során telepítés | Súlyozott BC, súlyok az közelített emberi bizalom | 8 % nyereség az szimulációban, 27 % az valódi hardveren; 2x gyorsabb konvergencia |
| ThriftyDAgger (2021) | Az rendszer, kapuzás az újdonság valamint kockázat | Interaktív gyűjtés alatt egy felügyelet költségvetés | Felhasználó tanulmány (N=10): 58 % magasabb emberi valamint 80 % magasabb robot teljesítmény mint az következő legjobb módszer |
| Fleet-DAgger (2022) | Az rendszer, lefoglalása figyelem átszállít egy flotta | Flotta tanulás pontozva által Visszatérítés az Emberi Erőfeszítés | Fel való 8.8x magasabb ROHE mint alapok |
| Sirius-Fleet (2024) | Anomália prediktora az önönálló-alkalmazkodó kritériumok | Multi-feladat tanulás egy vizuális világ modell | Kevesebb intervention kérés mint autonómia javul |

Négy metrikák érdemesek naplózása mellett az ráta
- Átvételek száma egy futás. Húsz rövid korrektálások valamint egy hosszú egy adja hasonló arány valamint írja végig különböző politikák - egy jerky, egy egy vak helyet.
- Közép intervention hossza. Emelkedő hossza mellett csökkenő szám jelenti az fennmaradó kudarc vannak a kemény tagok, amely van mit késő haladás néz ki.
- Idő az első intervention. Egy politika mely kap messzire előtt szükséges segít van javító még amikor az össz ráta van sík.
- Ahol intervention-ek csoportot. Bin az zászló által normalizált epizód haladás; egy stabil pik átszállít körök mutat egy egy szűk helyet.
Egy körön protokoll mely tudod ténylegesen futtatni
Egy mért körön van hat lépések valamint előállít egy sor az napló. Az első négy vannak az hurok; az utolsó kettő készítse azt egy mérés.
- 1Fagyasztás az értékelési protokoll előtt körön nulla
Írás le kezdő póz, tárgy elhelyezés, kamerák, próba szám, időkorlát valamint siker kritérium. Fotózza meg az táblázat. Ha az dokumentum van megváltoztatni, az sorozat újra indul.
- 2Méréke az alap
Futás az protokoll nem intervention valamint rögzít az sikerek; majd futás egy műszeres munkamenet takeover engedélyezett valamint rögzít az ráta. Azok kettő száma vannak körön nulla.
- 3Gyűjtse össze korrektálások egy konzisztens stílus
Az beviteli mód körönként, egy operátor ha tudsz kezelni azt. Vegyél át egy kritérium mely tudod kijelent hangosan - 'gripper több mint kettő centiméter záró az megközelítés' - valamint drukk azt a körben.
- 4Szétválogatás minden epizód az azonos nap
Korrekciós, értékelés vagy elvetésre. Félreérthető epizódok kap elvetésre, nem mentett az elmélet mely több adat segít - egy korrekciós mely te saját magad hibázott van rosszabb mint nincs epizód.
- 5Összeállítása az keverék kifejezetten
Eredeti bemutatások plusz korrektálások, epizód kiválasztás számon-forrás. Rögzítés alap szám, korrekciós szám valamint bármi súlyozás - ez az a mező mely fog szükséges három hét.
- 6Folytatás az ellenőrzőpont, majd újra-mérje
Edzés az összeállított adatkészlet az előző ellenőrzőpont helyett az alap modell, futás az fagyasztott protokoll plusz egy műszeres munkamenet, hozzáfűz az sor, valamint összehasonlítás ellen az előző kettő körök.
Kettő korlátok megváltoz hogyan olvasnia gyenge körön. Folytatás az ellenőrzőpont initializes az súly az azt - nem egy optimiser újra, így az menetrend kezd friss valamint egy rövid futást az egy konvergens ellenőrzőpont lehet mozog nagyon kevés. valamint az vezetője-igazít mozgás az kezdet az egy takeover van az legkevesebb távolság az valódi hardver az bármi az láncban; ha korrektálások összes kezd egy furcsa átmeneti, nézd ott előtt hibáztassa az keverék.
Az mért hurok, már bekötött fel
ay-robots valósít meg ezek hat lépések mint termék jellemzői: vegyél át közepén-futás egy vezetője kar, billentyűzet vagy csúszkák, az intervention képkockák zászlózott automatikus; szétválogatás minden epizód mint korrekciós, értékelés vagy elvetésre; összeállítása az következő adatkészlet az eredeti bemutatások plusz az korrektálások, epizód kiválasztás kifejezett számon-forrás; valamint kezd az következő edzés futást az előző ellenőrzőpont helyett az alap modell.
Nézd meg hogyan az DAgger hurok működikMit az száma nem tudok mondani
Semmi ez valamint nem megoldott, valamint egy rendezett görbe nem szabad meg győztetik, ellenkező esetben. Az intervention ráta intézkedések egy közös rendszer - politika, hardver, operátor, szoba - valamint attribútumok semmi az maga. Ez nem tud ítélni hogy vagy az korrektálások voltak jó, valamint ez fog esik boldogan egy feladaton mely kapott könnyebb, mert az tárgy sodródott kettő centiméter közelebb több mint három hét.
Mit ez csinálja az csap egy vág benyomást egy oszlopba mely tudsz vitatkozni vele. Az alternatív van nem egy jobb metrika; ezt három hét az gyűjtése korrektálások az görbe közölné neked, után körön három, hogy abbahagyja a gyűjtése. Az felmérés irodalom definiál interaktív utánzás tanulás mint emberi visszajelzés adott időszakosan során robot végrehajtása, így egy online javulás az viselkedés; az család van széles, valamint nincs elrendezése azt működik anélkül hogy egy száma körönként. Nézz is az SO-100 utánzás tanulás útmutató az alap adatkészlet mely összeállítás ellen, futó egy politika az az következtetés oldalán, valamint az DAgger hurok oldal az az megvalósított csővezeték.
Van az intervention ráta csak egy mínusz az siker ráta?▾
Nem. Az ráta intézkedések hogyan sok egy futás mely te vette át; az siker ráta intézkedések hogy vagy az feladat megvan végezve anélkül te. Egy futás lehet sikeres egy 30 százalék intervention ráta, valamint egy futás nem intervention lehet nem sikerült szerzett. Azok is eltérnek az zajban: az ráta mozog simán több mint ezerezer korrelált képkockák, az siker ráta ugrások között egy maroknyi bináris kimenetel. Napló mind.
Hány értékelési próbák szükség-e az siker ráta való értelemben bármit?▾
Több mint érzi ésszerű. Alatt az normál közelítés, 20 próbák egy igaz 60 százalék siker ráta hordozni egy standard hiba közel 11 százalékpont, így egy 10 pont mozgás között körök van megkülönböztethetetlen zajból; 50 próbák hozza, mely ábra való körülbelül 7. Ha tudod nem megengedhet 50, tartsa az próba szám azonos átszállít körök valamint kezelni apró mozgások mint inconclusive.
Mit keverés arány az bemutatások való korrektálások szükséges én kezd vele?▾
Az dokumentált kiindulópont van IWR az: partícióló az adatok ben intervention valamint nem-intervention minták valamint húzz azok ben egyenlő arányban, így az korrektálások járulékos fele az gradiens azonban apró töredéke az képkockák azok vannak. Ha az beállítás nem lehet súlyozat mintavétel, közelítés azt keresztül epizód száma amikor összeállítása az adatkészlet valamint rögzítés az arány. Edzés szállít korrektálások egyedül van az opció való szabály ki.
Az intervention ráta felment fel után egy körön. Van az körön pazarolt?▾
Nem szükségszerűen, azonban ellenőrizze az unalmas magyarázatok első: csinál az ellenőrzőpont mely te vezettél egyezmény az egy mely te tanított, csinál egy kamera index vagy csatorna megváltoz, csinál tárgy elhelyezés sodródás, volt az korrekciós stílus konzisztens. Ha összes négy vannak tiszta valamint az párosított siker ráta is esik, gyanú az keverék - valamint kevés alap bemutatások ellen az korrektálások, vagy korrektálások mely ellentmondanak egymásnak. Egy valódi regresszió tartozik az napló, nem az szemeteskosár.
Tudok én kihagyni az rögzített értékelési protokoll valamint csak figyeld az intervention ráta?▾
Csak ha fogad mely nem tudsz mondani javulás az szokásosság. Az ráta függ az saját valódi idő küszöb az lépés ben, valamint azon küszöb csökken mint kapsz szokott valamint az politika quirk. Az fagyasztott protokoll van az rész az mérés az saját küszöb nem tudod elérni - szalagos jelek, egy írott otthoni póz, egy rögzített próba szám, egy kritérium döntötte előtt az körön. Ez van való maradjon megváltozott átszállít az sorozat.
Tartsd az napló az tárhelyen, nem ben egy jegyzetfüzet: körök vannak napok szállít, hardver kap újjáépítve, valamint az személy olvasva az görbe október az te nincs memória augusztus. Az dokumentáció GYIK fedez az üzemeltetési részleteket lemaradt itt.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started