Asztali robot munkaterület, az olyan típusú, amelyet rögzített értékelési beállításként használnak ismételt policy futásokhoz
DAggerEvaluációImitation LearningRobot adatokSO-100

DAgger-hurok mérése: Intervention Rate, Evaluációs protokoll és közötte lévő csapda

AY-Robots ResearchAugust 27, 202615 perc olvasás

Az intervention rate - intervention frame-ek osztva a futás frame-jeivel - a legolcsóbb őszinte haladási jel, amit egy emberi kapuval felügyelt DAgger-hurok rendelkezhet. Ez a cikk úgy definiálja, hogy két ember ugyanazt az értéket számítja ki, bemutatja, hogyan kell naplózni, és végigmegy a négy módon, ahogyan megtéveszti: operátor szokásosság, sodródó értékelési beállítás, csak korrektálással történő tanulás és egy olyan ember, aki hétfőn másként korrigál, mint kedden.

Egy DAgger-kör produktívnak érzi magát, amíg benne van. Vezet a policyt, átveszi az irányítást, amikor hibázik a fogást, menti a korrektálásokat, újratanítja, és a következő futás - esküdnél - egy kicsit simábbnak tűnik. Két kör múlva nem tudja azt mondani, hogy valami változott-e, mert "egy kicsit simább" nem mennyiség.

A huroknak egy szám szükséges körönként, és egy emberi kapuval felügyelt hurokban ez a szám szinte ingyenes: az az arány, amikor az irányítás alatt volt az irányítás alatt az irányítás alatt helyett a policy alatt. Ez a cikk úgy definiálja, hogy két ember ugyanazt az értéket számítsa ki, naplózza, olvassa az eredményül kapott görbét, és elnevezi a négy módot, ahogyan megtéveszti, ha önmagában áll. Az elmélethez, amelyet ez a darab feltételez, lásd a DAgger explainer és az emberi kapuval felügyelt variant; a praktikus megfelelő a DAgger-hurok futtatása SO-100-on.

A rövid verzió

  • Intervention rate = intervention frame-ek / futási frame-ek. Frame-ek, nem episódok, és a nevező magában foglalja a korrigálásra fordított frame-eket.
  • Sík görbe három körön keresztül azt jelenti, hogy a körök nem vásárolnak semmit - változtassa meg a keveréket, az ellenőrzőpontot vagy a feladatot negyedik gyűjtése helyett.
  • A csökkenő intervention rate nem növekvő sikeres ráta. A lépésbe lépés küszöbértéke csökken, ahogy az bizalom nő.
  • Fagyasztott értékelési protokoll nélkül - ugyanaz a kezdeti pózok, objektumok, kamerák, próbaszám - a szobát mérje.
  • Csak korrigálások alapján történő tanulás torzítja az állapot eloszlást. Az IWR válasza: húzzon intervention és non-intervention mintákat egyenlő arányban.

Miért szükséges egy körnek egy szám egyáltalán

DAgger azért létezik, mert van egy eloszlási probléma, és az eloszlási problémák láthatatlanok. Ross és Bagnell azt mutatták, hogy imitation learning egy rögzített bemutatási készletből vezet az összeadódó hibákhoz és egy regresszióhoz kötötthez, amely négyzetesen növekszik az időhorizontban: ha a tanuló elhagyja az állapotokat, amelyeket a demonstráns meglátogatott, semmi az adatban nem mondja meg, hogy hogyan jöjjön vissza. DAgger ezt az iterálással javítja - futtassa a policyt, címkézze fel az állapotokat, amelyeket meglátogat, összesítsen, újratanítsen - amely Ross, Gordon és Bagnell no-regret online tanulásra való csökkentésként keretezte.

Ennek a keretezetésnek van egy következménye, amelyet az emberek kihagynak. A garancia az iterációk politikáinak sorrendjére vonatkozik, nem egyetlen futásra. Semmi nem mondja meg, hogy az Ön körünk három segített-e. Az egyetlen módja annak, hogy tudjuk, az, hogy mérjük az egyes iterációkat. Kelly és munkatársai a HG-DAgger-t azért vezették be, mert a klasszikus DAgger az expertet akciócímkékre kéri, míg az újoncok még irányítás alatt vannak, amely a dolgozat szerint csökkenthet a biztonságot és, emberi szakértőkkel, valószínűleg degradálja a címke minőségét az észlelt aktuátor késleltetés miatt. HG-DAgger egy biztonsági küszöbértéket is tanul egy modell-bizonytalanság-alapú kockázati metrikához, és javított teljesítményt jelent DAgger és viselkedési klónozás felett egy vezetési feladaton. Nem tesz közzé intervention számítási; azok, amelyeket saját maga készít.

Az arány definiálása úgy, hogy két ember ugyanazt a számot kapja

A definíció egy sor: intervention frame-ek osztva a futás frame-jeivel. Mindent nehéz elrejt abban, amit egy frame-nek és egy futásnak számít.

Frame-ek, nem episódok

Az episódok számításával, amelyekben legalább egy intervention van, haszontalan: tíz epizód egy-egy tolással és tíz, amelyekben nyolcvan százalékig vezettél, mindkettő "10/10" adja. A frame szám elkülöníti őket, és ez az a granularitás, amely a felvételnek már rendelkezik - a LeRobot adatkészlet formátumban minden időlépés egy sor, így az intervention flag egy boolean oszlop az állapot és a cselekvés mellett. Itt írja az időkeretre azt a pillanatot, amikor átvétel kezdődik, és visszacsatolja az irányítást.

A nevező magában foglalja a korrektálásokat

Két nevező védhető - a futás teljes frame-jei, vagy a policy által autonóm módon felhajtott frame-ek - és rosszul eltérnek magas intervention szinteken. Vegyél be 400-ról 1000 frame-ből, az első 40 százalékot adja, a második 67 százalékot. Az egyik módon mért kör összehasonlítása a másodikként mért következővel szemben az, ahogy egy valós javulás eltűnik. Vegyél teljes frame-eket és soha ne vizsgálja meg újra a választást a sorozat közepén.

Döntse meg egyszer, hogy mi történik az átadási frame-ekkel

Mindig van varrás. Ha az irányítás átmegy, néhány frame semmilyen oldalhoz nem tartozik: a kar tartva van, a vezető igazít, a felvétel fagyasztott. Ebben a csővezetékben ezek az átadási frame-ek a nyers adatfolyamban maradnak, és soha nem lépnek be a kurátort epizód - sem policy viselkedés, sem tanulás érdemes korrigálás. A varrást ugyanúgy számolja ki minden körben: 30 Hz-en hat átvételenként két másodperces varrással, 360 frame-ek, elég a százalékpont megmozdításához.

A három döntés, amely megtöri az összehasonlíthatóságot

Frame-ek vagy episódok; teljes futás vagy autonóm; átadási frame-ek be vagy ki. A három közül bármelyik csendesen megváltozott a körök között, a görbe értelmét veszti. Mindhárom írjon le.

Naplózása úgy, hogy a szám túléli a munkamenetet

Egy futó folyamat státusz paneljében szereplő metrika egy leolvasás: az újraindítás során eltűnik, és nem lehet ábrázolni. Egy hozzáfűzés-csak sor körönként fedezi az egész sorozatot - beleértve azt, hogy melyik ellenőrzőpont vezettél, mivel ez minden körben változik, és összekeveri az azt követő.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Egy sor körönként. A nevező és az átadási megállapodás rögzítése a szám mellett fontosabb, mint a mező nevek.

Két mező hordja a súlyt. train_mix az, amit a következő tanítási feladatra etettél; anélkül semmi nem attribútható. eval_protocol az elnevezése a rögzített teszt, amelyet később futtattál, és a legtöbbször üresen hagyott mező. Az ay-robots cockpitben az átvételi státusz az intervention frame szám a futó munkamenethez, így a naplózás transzkripció, nem pedig instrumentálás; az adatkészlet dokumentáció abban foglalkozik, ahol az per-frame oszlopok leszállnak.

Tanítási konfigurációs mátrix, amely politikákat, adatkészleteket és ellenőrzőpontokat egymás mellett mutat
Minden kör megváltoztatja az ellenőrzőpontot és az adatkészlet keverékét. Egy olyan szám, amelynek kombinációja nem volt rögzítve, nem attribútható.

A görbe olvasása: három körön belül, egy ítélet

Három körben van az olvasás minimuma, mert két pont mindig egy sor. Az alábbi táblázat egy naplózási sablon helyőrzőszámokkal, nem mérések egyetlen futásból. Egy monoton csökkenést keres, amelyet a sikeres növekedés egyez egy rögzített teszt.

KörösEllenőrzőpont vezetőFrame-ekIntervention frame-ekRátaSikerek (20-ból)
0 (alap)alap policy5 9001 38023,4 %7
10. körből keverékből5 61098017,5 %10
21. körből keverékből5 41261111,3 %11
32. körből keverékből5 38059811,1 %12

Az első és második körben munka történik. A harmadik körben nem: 11,3% ellen 11,1% az egy fizikai karon mért bárminek a futás-fuss variációján belül, és a negyedik körét az azonos korrektálások semmi után való délután egy délután után. A sík szegmens azt mondja, hogy valami szerkezeti változtatást kell tenni.

  • A fennmaradó kudarcok nem korrigálható teleoperation által - objektum elérhetetlenül, gripper geometria, egy közös határán. Nincs korrekciós adatok javítják a kinematikai falat.
  • A korrektálások túl kevesek az alap adatkészlet ellen a gradiens megmozdításához, és semmi nem súlyozza őket.
  • A korrektálások ellentmondanak egymásnak, így az politika átlag két stratégiát és földek között.
  • A kudarc felfelé irányuló: kamera mozgatott, a megvilágítás megváltozott, a csuklónézet már nem felel meg az edzésnek.
  • A feladat erre az politika osztályra erről a hardveren a mennyezetben van, és a következő lépés több alap adat.

Az utolsó kettő nem kudarcsai a huroknak. A Sirius-Fleet-ben az ember csökkenő szükségessége a tervezett kimenetel: ahogy a robot autonómiája javul, anomália prediktora alkalmazkodnak az előrejelzési kritériumaikhoz, ami kevesebb kéréshez vezet az emberi beavatkozásra és fokozatosan csökkenti az emberi munkaterhelést az idő múlásával. Ott a kritérium szándékosan alkalmazkodik. Egy kézi hurokban az Ön is alkalmazkodik, csendesen - így egy ráta, amely azért simul meg, mert a feladat van a mennyezetben nézd ki pontosan, mintha meg lett volna, mert az operátor abbahagyta a figyelmet. Melyik a következő probléma.

Csapda 1: csökkenő ráta nem növekvő sikeres ráta

Az intervention rate pontosan egy dologra mér: a futás mekkora részét döntötte el, hogy a saját. Ez a döntés az Ön, valós időben meghozva, és mozog. A nulladik körben átveszi az első rossz közelítési szögben; a harmadik körre és nézett az politika visszaállni tucatjáról, és hagyd, hogy próbálja meg. Az Ön küszöb mozgatott; az politika talán nem. A ráta mindkét módon esik.

Az emberi bizalom legalább egy modellezett mennyiség az irodalomban, nem pedig egy feltételezett állandó. Sirius súlyozódik ki a tanítási mintákat közelítő emberi bizalommal, és optimalizálja az politikát súlyozott viselkedési klónozással, jelentve egy 8 százalékos növekedést a szimulációban és 27 százalékot valódi hardveren a politika sikeres ráta művészetének állapota felett, a konvergencia sebességének kétszeresével. Ez úgy kezeli az bizalmat, mint a súlyt az adatokon. Nem korrigálja a küszöbértéket a fejedben a nulladik körben és a harmadik között.

Nem tudja eltávolítani az sodródást, így párosítsa az arányt valamivel, amit az Ön küszöb nem érhetne el: egy rögzített próbasorozat, amelyekben egyáltalán nem avatkozni; egy kritérium ellen pontozva kör előtt írva. Egy ráta, amely csökken, míg a párosított sikeres ráta helyén marad, az szokásosság aláírása - megéri, hogy megragadják, mert a hurok belsejéből ez előrehaladásnak érzi.

Intervention rateSikeres ráta rögzített protokollonLegvalószínűbb olvasás
csökkenemelkedikA körök működött. Folytatás.
csökkensíkAz Ön küszöb sodródott, vagy a korrektálások eltávolították az erőfeszítést anélkül, hogy eltávolítanák a kudarcokat.
csökkencsökkenA korrektálások degradálnak az politikát. Ellenőrizze a keveréket és azok belső konzisztenciáját.
síksíkA körben semmi sem volt. A keverék, az ellenőrzőpont vagy a feladat módosítása előtt több gyűjtés.
emelkedikcsökkenRegresszió. Gyanúság gyakorolhat képzési keveréket, megváltozott kamerát vagy ellenőrzőpont mix-up a módszer gyanúsítása előtt.

Csapda 2: rögzített protokoll nélkül, a szobát mérje

A valós robot értékelése drága és nehéz megismételni. A SIMPLER szerzői a szimulált értékelést az megfigyeléssel motiválnak, hogy az ilyen politikák valós értékelése nem méretezhető, és megismételhetőségi kihívások szembesülnek, amely valószínűleg rosszabbodik, ahogy a politikák szélesítik a feladat spektrumát. Az RoboArena a másik oldalról támadja, több mint 600 páros valós robot értékelési episódok a hét általános politika között, hét akadémiai intézmény értékelői által a DROID platformon futtatva. Az értékelői kiválasztja saját feladataikat és környezeteiket, de az politikákat párosítva kell megítélni a vak; a dolgozat azt jelenti, hogy ez a tömegből rangsorolás nyomon követi az általános-politika teljesítményt pontosabban, mint a hagyományos, központi értékelés.

Nem fogsz 600 páros episódok futtatni egy SO-100 egy műhelyen. Mit lehet tenni az a variancia eltávolítása, amelyet kontroll - egy lista unalmas elég, hogy általában átugrott.

DimenzióFagyasztás ezMit sodródó ha nem
Kezdeti pózEgy írott otthoni pozíció, vezetett minden próba előttA pálya eloszlásból indul
ObjektumokSzalagos jelek, és az ugyanaz fizikai objektumok értékelésre fenntartvaEgy 'jobb' politika valóban egy közelebbi objektum
Kamerák és fényUgyanaz a szerelések, indexek, expozíció; redőnyök zárva; fotografálja a beállítástAz kamera indexek cseréje szinte lehet dominálni az eredményt
Próbák és leállítási szabályRögzített n, rögzített időtúllépés, kritérium körben kör előtt írvaPost-hoc kritériumok közel-tévesztések bármilyen szükséged
Operátor viselkedésNincs intervention az értékelési próbák soránAz értékelés egy másik korrekciós munkamenet lesz

Majd az aritmetika, könyörtelen a próbaszámban egy műhely megengedhet. A normál közelítés alatt 60 százalék siker több mint 20 próba fő egy standard hiba közel 11 százalékpont - a négyzetgyök 0,6 szor 0,4 több mint 20 - és a különbség két ilyen körök között körülbelül 15 százalékpont. A 60-ról 70 százalékra ugró ezért összhangban van-e semmi sem történt. Ötven próba hozza az per-körös számot körülbelül 7 pont, és költségek egy délután.

Ez az aszimmetria az érv az intervention rate: kiszámított több mint ezrezer frame helyett azt csökken később és simábban. A fenntartás az a frame-ek egy epizód nagy korrelálódott - egy rossz fogás hozza száz egymást követő intervention frame-ek - így a hatékony minta mérete közelebb van a átvételek száma. Az arányt az korai indikátor és a sikeres ráta mint lassú föld igazság.

Az értékelési episódok felhőzárolnak az edzési készletből

Az értékelési episódok soha sem léphetnek az összeállított edzési adatkészletbe - ellenkező esetben körén+1 értékelt az adatok, amelyeket edzést végeztek, és a görbe intézkedések memorizálása.

Csapda 3: csak korrektálásokkal történő tanulás hajlítja az politikát

A korrektálások az érdekes adatok, így az ösztön az rá tanulni. Ne. Azok járnak konstrukció szűk szeletéből az állapot tér ahol az politika már kudarc és mondja szinte semmi többség az futást, amely működött. Finomhangolás az szelet egyedül és kapsz egy politika jó helyreállítani egy hibásított megközelítés, amely elfelejtette, hogy hogyan készítsen egy tiszta egy.

Mandlekar és munkatársai, akik távolsági beavatkozási rendszerükre építette. Az keretezésük: manipuláció feladatok tartalmaznak szűk régió pontosan sorozat műveletek - beszúrása egy pod egy kávéfőző gépbe az azok példa - ahol apró eltérések vezetnek az állapotok a bemutatások soha nem fedezte. Az algoritmusuk azt tanítják ismételt az új adatok így az politika tanul átpásás ezeket szűk helyek, és azok jelentik azt ügynökök képzett az intervention adatok versenyzik ügynök képzett az egyenértékű számú minta-intervenciós demonstrators.

Korrektálások-csak finomhangolás szemben egy összeállított keveréket
Mit korrektálások-csak kapsz
  • Gyors: egy rövid futást több mint egy néhány tucat episódok olcsó elég ismételni
  • Célzott: az gradiens dominál az állapot, amely gondol
  • Olcsó tesztelés hogy egy korrekciós stílus tanul egyáltalán
Mit ez költségek
  • Az finomhangolás eloszlás több már hasonló az feladat eloszlás
  • Névleges viselkedés lehet szakadékig, hogy az egyetlen körben
  • Az ráta lehet esik míg siker csökken vele - tiszta szegmens kereskedett helyreállítás

Az keverés-arány egy hyperparameter és érdemel írva. Összeállítása az következő adatkészlet az ahol döntötte: eredeti bemutatások plusz az korrekciós készlet, epizód kiválasztás kifejezett számon-forrás helyett egy szabály amely csendesen húz bármi áll rendelkezésre. Ott az egy összeállítás lépés az cockpitben, és az eredménye normál adatkészlet - lásd az edzés dokumentáció. Mit nem eszköz csinál neked rögzítés amely arány termelésből mely görbe.

Csapda 4: az ember nem konzisztens szakértő

DAgger elmélet arra számít egy szakértő. Az Ön nem egy technikai értelemben: az Ön korrektálások nem minták egy rögzített feltételes eloszlásáról műveletek. Az ACT szerzői adják ezt nevez amikor listáz az akadályokat az apró manipuláció - hibák összeadódnak az idő, valamint az emberi bemutatások lehet non-stationary. Az rendszer még eléri 80-90 százalékos siker hat valódi feladatok tíz percből bemutatások, így a probléma levezethető, nem hiányzik.

Az robomimic tanulmány teszi az pont az adatok oldaláról. Átszállít hat offline algoritmusok öt szimulált valamint három valódi-világ többfázisú feladatok, az leckéit tartalmaz érzékenység tervezési választások, függés bemutatás minőség, valamint - az egy visszás fájdalom legtöbb itt - változékonyság felmerülés abbahagyva kritériumok, mivel edzés valamint értékelés célok eltérnek. Az ellenőrzőpont az legalacsonyabb veszteség nincs megbízhatóan az a legmagasabb sikeres ráta.

Ott van egy hardver verziót ez: az beviteli mód alakú az korrekciós. Egy leader-follower beállítás előállít folyamatos, emberi-tempó pályák. Billentyűzet tolópontok vannak szorított kemény által az szerver - kettő fok az kar közös, négy az gripper - így az azonos szándék érkezik mint egy lépcsősor apró lépések. Csúszkák küldenek abszolút célok valamint az szerver mozog nagy legfeljebb hat fok felé azok számon egy szám. Három módok, három cselekvés eloszlás; keverés minden három egyik korrekciós állították majd csodálkoztam miért az megközelítés fordult jerky van önérdekelt. Az teleoperation dokumentáció fedez mi minden módok küld.

Az intervention-ek súlyozása: IWR valamint mi jött után

Ha korrektálások vannak az értékes kisebbség, az elv javítás az súly helyett exkluzivitás. Intervention Súlyozott Regresszió van az referencia implementáció: az adatok particionáló intervention valamint nem-intervention mintákat, valamint az kettő partíciókat mintázott az egyenlő arányban során edzés. Egy korrekciós készlet amely van öt százalék az képkockák majd hozzájárulnak fele az gradiens, nélküle a névleges viselkedés eltűnik az eloszlásból.

Egyenlő arány van egy kezdve pont, nem egy törvény. Sirius általánosít azt helyettesítésével az bináris partícióval egy folyamatos súly az közelített emberi bizalom; Sirius-Fleet mozgatja az döntés felfelé, használva egy vizuális világ modell valamint anomália prediktora mely döntse amikor egy emberi fel. Az közös szál: az intervention zászló van egy edzés jel, nem csak egy könyvelés oszlop.

MódszerKi dönt amikor az emberi cselekvésekHogyan intervention adatok vannak használtJelentette eredmény
DAgger (2011)Rögzített menetrend; szakértő címkék meglátogatva államokEgy növő adatkészlet, súlyozatlanKeretezte mint egy redukció nem-regret online tanulásra
HG-DAgger (2019)Az emberi, kapuzás irányítás egy valódi rendszerenÖsszesített; plusz egy tanult biztonsági küszöb az modell bizonytalanságJobb mint DAgger valamint BC az vezetésen; nincs intervention szám adott
IWR (2020)Az emberi, keresztül távoli teleoperationIntervention valamint nem-intervention mintákat felhőzárolódott az egyenlő aránybanVersenyzik nem-intervenciós bemutatások az egyenlő minta szám
Sirius (2022)Az emberi, során telepítésSúlyozott BC, súlyok az közelített emberi bizalom8 % nyereség az szimulációban, 27 % az valódi hardveren; 2x gyorsabb konvergencia
ThriftyDAgger (2021)Az rendszer, kapuzás az újdonság valamint kockázatInteraktív gyűjtés alatt egy felügyelet költségvetésFelhasználó tanulmány (N=10): 58 % magasabb emberi valamint 80 % magasabb robot teljesítmény mint az következő legjobb módszer
Fleet-DAgger (2022)Az rendszer, lefoglalása figyelem átszállít egy flottaFlotta tanulás pontozva által Visszatérítés az Emberi ErőfeszítésFel való 8.8x magasabb ROHE mint alapok
Sirius-Fleet (2024)Anomália prediktora az önönálló-alkalmazkodó kritériumokMulti-feladat tanulás egy vizuális világ modellKevesebb intervention kérés mint autonómia javul
Rangsor nézet összehasonlítása robot politikák által mért szám
Rangsor politikák ellen egymást jelent valami csak amikor minden bejegyzés futott az azonos protokoll. Az vonatkozik az saját három körök valamint.

Négy metrikák érdemesek naplózása mellett az ráta

  • Átvételek száma egy futás. Húsz rövid korrektálások valamint egy hosszú egy adja hasonló arány valamint írja végig különböző politikák - egy jerky, egy egy vak helyet.
  • Közép intervention hossza. Emelkedő hossza mellett csökkenő szám jelenti az fennmaradó kudarc vannak a kemény tagok, amely van mit késő haladás néz ki.
  • Idő az első intervention. Egy politika mely kap messzire előtt szükséges segít van javító még amikor az össz ráta van sík.
  • Ahol intervention-ek csoportot. Bin az zászló által normalizált epizód haladás; egy stabil pik átszállít körök mutat egy egy szűk helyet.

Egy körön protokoll mely tudod ténylegesen futtatni

Egy mért körön van hat lépések valamint előállít egy sor az napló. Az első négy vannak az hurok; az utolsó kettő készítse azt egy mérés.

  1. 1
    Fagyasztás az értékelési protokoll előtt körön nulla

    Írás le kezdő póz, tárgy elhelyezés, kamerák, próba szám, időkorlát valamint siker kritérium. Fotózza meg az táblázat. Ha az dokumentum van megváltoztatni, az sorozat újra indul.

  2. 2
    Méréke az alap

    Futás az protokoll nem intervention valamint rögzít az sikerek; majd futás egy műszeres munkamenet takeover engedélyezett valamint rögzít az ráta. Azok kettő száma vannak körön nulla.

  3. 3
    Gyűjtse össze korrektálások egy konzisztens stílus

    Az beviteli mód körönként, egy operátor ha tudsz kezelni azt. Vegyél át egy kritérium mely tudod kijelent hangosan - 'gripper több mint kettő centiméter záró az megközelítés' - valamint drukk azt a körben.

  4. 4
    Szétválogatás minden epizód az azonos nap

    Korrekciós, értékelés vagy elvetésre. Félreérthető epizódok kap elvetésre, nem mentett az elmélet mely több adat segít - egy korrekciós mely te saját magad hibázott van rosszabb mint nincs epizód.

  5. 5
    Összeállítása az keverék kifejezetten

    Eredeti bemutatások plusz korrektálások, epizód kiválasztás számon-forrás. Rögzítés alap szám, korrekciós szám valamint bármi súlyozás - ez az a mező mely fog szükséges három hét.

  6. 6
    Folytatás az ellenőrzőpont, majd újra-mérje

    Edzés az összeállított adatkészlet az előző ellenőrzőpont helyett az alap modell, futás az fagyasztott protokoll plusz egy műszeres munkamenet, hozzáfűz az sor, valamint összehasonlítás ellen az előző kettő körök.

Kettő korlátok megváltoz hogyan olvasnia gyenge körön. Folytatás az ellenőrzőpont initializes az súly az azt - nem egy optimiser újra, így az menetrend kezd friss valamint egy rövid futást az egy konvergens ellenőrzőpont lehet mozog nagyon kevés. valamint az vezetője-igazít mozgás az kezdet az egy takeover van az legkevesebb távolság az valódi hardver az bármi az láncban; ha korrektálások összes kezd egy furcsa átmeneti, nézd ott előtt hibáztassa az keverék.

Az mért hurok, már bekötött fel

ay-robots valósít meg ezek hat lépések mint termék jellemzői: vegyél át közepén-futás egy vezetője kar, billentyűzet vagy csúszkák, az intervention képkockák zászlózott automatikus; szétválogatás minden epizód mint korrekciós, értékelés vagy elvetésre; összeállítása az következő adatkészlet az eredeti bemutatások plusz az korrektálások, epizód kiválasztás kifejezett számon-forrás; valamint kezd az következő edzés futást az előző ellenőrzőpont helyett az alap modell.

Nézd meg hogyan az DAgger hurok működik

Mit az száma nem tudok mondani

Semmi ez valamint nem megoldott, valamint egy rendezett görbe nem szabad meg győztetik, ellenkező esetben. Az intervention ráta intézkedések egy közös rendszer - politika, hardver, operátor, szoba - valamint attribútumok semmi az maga. Ez nem tud ítélni hogy vagy az korrektálások voltak jó, valamint ez fog esik boldogan egy feladaton mely kapott könnyebb, mert az tárgy sodródott kettő centiméter közelebb több mint három hét.

Mit ez csinálja az csap egy vág benyomást egy oszlopba mely tudsz vitatkozni vele. Az alternatív van nem egy jobb metrika; ezt három hét az gyűjtése korrektálások az görbe közölné neked, után körön három, hogy abbahagyja a gyűjtése. Az felmérés irodalom definiál interaktív utánzás tanulás mint emberi visszajelzés adott időszakosan során robot végrehajtása, így egy online javulás az viselkedés; az család van széles, valamint nincs elrendezése azt működik anélkül hogy egy száma körönként. Nézz is az SO-100 utánzás tanulás útmutató az alap adatkészlet mely összeállítás ellen, futó egy politika az az következtetés oldalán, valamint az DAgger hurok oldal az az megvalósított csővezeték.

Van az intervention ráta csak egy mínusz az siker ráta?

Nem. Az ráta intézkedések hogyan sok egy futás mely te vette át; az siker ráta intézkedések hogy vagy az feladat megvan végezve anélkül te. Egy futás lehet sikeres egy 30 százalék intervention ráta, valamint egy futás nem intervention lehet nem sikerült szerzett. Azok is eltérnek az zajban: az ráta mozog simán több mint ezerezer korrelált képkockák, az siker ráta ugrások között egy maroknyi bináris kimenetel. Napló mind.

Hány értékelési próbák szükség-e az siker ráta való értelemben bármit?

Több mint érzi ésszerű. Alatt az normál közelítés, 20 próbák egy igaz 60 százalék siker ráta hordozni egy standard hiba közel 11 százalékpont, így egy 10 pont mozgás között körök van megkülönböztethetetlen zajból; 50 próbák hozza, mely ábra való körülbelül 7. Ha tudod nem megengedhet 50, tartsa az próba szám azonos átszállít körök valamint kezelni apró mozgások mint inconclusive.

Mit keverés arány az bemutatások való korrektálások szükséges én kezd vele?

Az dokumentált kiindulópont van IWR az: partícióló az adatok ben intervention valamint nem-intervention minták valamint húzz azok ben egyenlő arányban, így az korrektálások járulékos fele az gradiens azonban apró töredéke az képkockák azok vannak. Ha az beállítás nem lehet súlyozat mintavétel, közelítés azt keresztül epizód száma amikor összeállítása az adatkészlet valamint rögzítés az arány. Edzés szállít korrektálások egyedül van az opció való szabály ki.

Az intervention ráta felment fel után egy körön. Van az körön pazarolt?

Nem szükségszerűen, azonban ellenőrizze az unalmas magyarázatok első: csinál az ellenőrzőpont mely te vezettél egyezmény az egy mely te tanított, csinál egy kamera index vagy csatorna megváltoz, csinál tárgy elhelyezés sodródás, volt az korrekciós stílus konzisztens. Ha összes négy vannak tiszta valamint az párosított siker ráta is esik, gyanú az keverék - valamint kevés alap bemutatások ellen az korrektálások, vagy korrektálások mely ellentmondanak egymásnak. Egy valódi regresszió tartozik az napló, nem az szemeteskosár.

Tudok én kihagyni az rögzített értékelési protokoll valamint csak figyeld az intervention ráta?

Csak ha fogad mely nem tudsz mondani javulás az szokásosság. Az ráta függ az saját valódi idő küszöb az lépés ben, valamint azon küszöb csökken mint kapsz szokott valamint az politika quirk. Az fagyasztott protokoll van az rész az mérés az saját küszöb nem tudod elérni - szalagos jelek, egy írott otthoni póz, egy rögzített próba szám, egy kritérium döntötte előtt az körön. Ez van való maradjon megváltozott átszállít az sorozat.

Tartsd az napló az tárhelyen, nem ben egy jegyzetfüzet: körök vannak napok szállít, hardver kap újjáépítve, valamint az személy olvasva az görbe október az te nincs memória augusztus. Az dokumentáció GYIK fedez az üzemeltetési részleteket lemaradt itt.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started