Operátor, aki egy robot kart felügyel egy teleoperation interfészen keresztül, a kezei a vezérlésen és kész az átvételre
DAggerInteraktív imitációs tanulásHG-DAggerRobot policySO-100

A HG-DAgger és a kapu variánsai: Ki dönt a robot policy átvételéről

AY-Robots ResearchAugust 27, 202615 perces olvasás

A sima DAgger azt kéri, hogy egy ember címkézze a államokat, miközben a robot még vezet. Valódi hardveren ez nem biztonságos és rossz címkéket termel. Az adapost variánsai az őszinte címkézést egy kapu helyettesítik, amelyet valakinek meg kell tartania: a humán a HG-DAggerben, egy biztonsági osztályozó a SafeDAggerben, egy ensemble ellentmondása az EnsembleDAggerben, egy költségvetés-korlátozott újdonság- és kockázatbecslés a ThriftyDAggerben. Ez a cikk összehasonlítja őket aszerint, hogy ki tulajdonosa a kapunak, milyen jel nyitja meg, és mennyibe kerül mindegyik — és miért a humán-felügyelt forma az, amely túlél a valódi kar kontaktusát.

Egy klónozott policy ott bukik meg, ahol a betanítási adatai kifogynak. A megoldás az, hogy továbbra is az policy saját állapot-eloszlása alatt gyűjtse az adatokat a demonstrátor helyett, amit a DAgger tesz és amit az adatagyújtés bevezetése az alapelvekből felsorol. Nyitva hagyja az eredeti algoritmus kínos részét: amíg a tanuló vezet, az expertek azt kellene, hogy mondják, mit csinálnának, minden államban, anélkül, hogy irányítás alatt lennének.

Egy szimulátorban egy scripted experthel, amely ingyenes. Egy asztalon egy valódi karral rajta nem ingyenes, és nem biztonságos. A HG-DAgger szerzői pontosan megfogalmazzák az ellenvetést: az ilyen mintavételi sémák "megkövetelik az experttől, hogy akciókat jelöljön meg anélkül, hogy teljesen irányítás alatt lenne", amely "csökkentheti a biztonságot, és ha embereket használnak expertkén, valószínűleg rontja az összegyűjtött címkék minőségét az érzékelt aktuátor-késedelem miatt" (Kelly et al., 2019). Két hiba rejtőzik ebben a mondatban: a policy továbbra is olyan államokba vezet, amelyeket senki sem akar, és az ezzel a kockázattal megvásárolt címkék rosszabbak, mint azok, amelyeket egy ember előállít, miközben a vezérléseket tartja. Minden alabbbbi variáns ugyanazt a kérdést válaszolja meg — kapu felügyelet és hagyja, hogy valaki eldöntse, mikor nyílik meg. Abban különböznek, hogy ki az valaki.

A rövid verzió

  • Az adapost variánsok az őszinte címkézést a policy vezérlés és az expert vezérlés közötti kapcsolóval helyettesítik. Az, ami elválasztja őket, az, hogy ki tulajdonosa a kapcsolónak.
  • A HG-DAgger a kapcsolót az embernek adja, és csak azokat az adatokat aggregálja, amelyeket a humánnak volt zavartalan irányítása alatt rögzített.
  • A SafeDAgger azt egy bináris osztályozónak adja, amely egy referenciapoktól való eltérést jelöz; az EnsembleDAgger alacsony ensemble varianciát és kis távolságot az expert akcióhoz egy időben követel meg.
  • A LazyDAgger hiszterézist ad hozzá, így a vezérlés nem pingpongol; a ThriftyDAgger egy explicit intervenciós költségvetés alatt újdonságra vagy becsült kockázatra kaput nyit.
  • A robot-felügyelt jelek valamit igényelnek, amit egy jól finomhangolt VLA egy hobby-klazályu karon általában hiányzik: egy referenciapokt, egy olcsó ensemble, vagy kalibrált episztémikus bizonytalanságot.
  • A kapu a módszer fele. Mi történik az intervenciós szegmensekkel azután — keverés, súlyozás, aggregálás — eldönti, hogy a kör javított-e valamit.

Humán-felügyelt és robot-felügyelt: a szétválás, amely számít

Az interaktív imitációs tanulásnak van saját felmérése; Celemin és kollégái az visszajelzés típusa, interfész, tanulási modell, felhasználói élmény, alkalmazás és benchmark szerint katalogizálják. Az a szétválás, amely eldönti az Ön mérnöki munkáját, egyszerűbb bármelyik tengelynél, és a közelmúltbeli munka közvetlenül nevezi el: egy módszer humán-felügyelt amikor a felügyelő dönt az intervenció időpontjáról, és robot-felügyelt amikor az ügynök dönt arról, mikor kérjen segítséget (Cai et al., 2025). Minden más a gépezet az egyik vagy a másik választás kiszolgálásában. Az adásvétel látható az elejétől: a humán kapu folyamatos figyelmet igényel, és a robot kapu azt ígéri, hogy ezt a figyelmet visszaadja — de csak akkor, ha az a jel, amely rá kaput nyit, megbízható, és az jel felépítése a maga kutatási problémája.

SafeDAgger: egy osztályozó, amely a saját eltéréseit jelözi

Zhang és Cho SafeDAggerje (2016) az e kapuk közül a legkorábbi. A referenciapokt lekérdezése a költséges rész, így egy második, kis hálózat — a biztonsági politika — azt jelözi előre, hogy a lekérdezés egyáltalán megéri-e. "Visszaadja a bináris címkét, amely azt jelzi, hogy az elsődleges politika valószínűleg eltér egy referenciapoktól, anélkül, hogy lekérdezné azt". A címke a két politika akcióinak négyzetes L2 eltérésénél van meghatározva egy tau küszöbnél, és az osztályozót bináris kereszt-entrópiával illesztik. A futtatáskor minden állapotban eldönti, hogy a tanuló továbbra is vezet, vagy a referenciapokt átveszi. Az absztrakt kevesebb referenciapokt-lekérdezésről számol be egy autóverseny szimulátorban, valamint egy konvergencia gyorsulást, amely a szerzők egy automatizált kurikulum hatásnak tulajdonítanak, anélkül hogy egy számot adnának hozzá.

A csapda a definícióban van, nem az eredményekben. Az osztályozó betanítása megköveteli az referenciapokt akcióját minden olyan állapotban, amely az illesztéshez használt, amely azt feltételezi, hogy a referencia egy másik program. Ha a referencia egy személy egy leader karral, akkor az az címkekészlet nem olcsó, és a módszer elveszíti azokat a tulajdonságokat, amelyért meg volt tervezve.

EnsembleDAgger: kétség és eltérés, mindkettő

Menda, Driggs-Campbell és Kochenderfer (2019) valószínűségi kérdésként kezelik a kaput. Az EnsembleDAgger "egy Gauss-proces közelítéseit használ neurális hálózatok ensemblei segítségével" és az ensemble varianciáját megbízhatóság proxyként olvassa: a magas variancia azt jelenti, hogy egy régió eltér a betanítási adatokból, amely — az expert feltételezésével, hogy elkerüli a meghibásodás államait — korrelál a meghibásodáshoz való közelséggel. A szabály egy konjunkció. A tanuló csak akkor járulhat hozzá, ha az L2 távolság az átlagos akciója és az expert akciója között egy küszöb alatt marad (eltérés) és a jósolt akciójának varianciája egy második alatt marad (kétség). Ha valamelyik meghiúsul, az expert veszi át az irányítást. A cél a tanuló akcióinak részarányának maximalizálása a meghibásodás valószínűségének korlátozása mellett; a papír javított biztonságot és tanulást jelent a fordított inga és a MuJoCo HalfCheetah egy másik DAgger variánsa ellen.

Az eltérés term az expert akcióját igényli

Ez halkan diszkvalifikálja a teljes szabályt a zárva maradt felügyelethez. A tanuló akciója és az expert akciója közötti távolság megköveteli az expert akcióját az adott állapotban, az adott pillanatban. Egy scripted expertnél, jó. Egy emberrel az ember folyamatosan akciókat kell hogy produkáljon — pontosan az a terhelés, amely az adapost variánsok eltávolítására voltak szánva. Az kétség term egyedül zárva maradt; a konjunkció nem.

LazyDAgger: stop the switch from chattering

Hoque és kollégái (2021) a költségeket támadták, amely az előző papírok nem mérték: a kapcsolót magát. Minden intervenció "megzavarja az egyéb munkát, amely az ember végez, késedelmet okoz az felügyelő és az autonóm vezérlés közötti kontextusváltásnál, és időt igényel a végrehajtáshoz". Egy kapu, amely tízszer nyílik meg percenként, rosszabb, mint az, amely egyszer megnyílik tíz másodpercre, azonos autonóm részarányban. A LazyDAgger kiterjeszti a SafeDAggert aszimmetrikus küszöbökkel — nehezebb belépni a felügyelő vezérlésbe, mint hogy benne maradjon — így a rendszer nem oszcillál a határon. A szimulációban "átlagosan 60%-kal csökkentheti a kontextusváltásokat a SafeDAgger felett 3 folyamatos vezérlési feladaton, miközben fenntartja az állam-of-the-art policy teljesítményt"; a szövet manipulációban egy ABB YuMival "60%-kal csökkenti a kontextusváltásokat, miközben 60%-kal magasabb sikerességi rátát ér el a SafeDAggernél a végrehajtás idején".

ThriftyDAgger: újdonság vagy kockázat, költségvetés alatt

A ThriftyDAgger (Hoque et al., CoRL 2021) a felügyelő költségvetésből indul, nem a policyból. "Egy tanult kapcsoló poktöt használ, hogy csak olyan államokban kérjen intervenciót, amelyek elég (1) újak, ahol a robot policynak nincs referencia viselkedése utánozni, vagy (2) kockázatosak, ahol a robot alacsony bizonytalanságú a feladatbetöltésben", egy új metrikával ezért a kockázat becslésére. A költségvetés egy bemenet, nem egy kimenet: azt határozod meg, hogy mennyi emberi időt fogunk tölteni. Végrehajtási időben alkalmazva a módszer "100%-os sikerességi rátát ér el mind a szimulációs, mind a fizikai feladatokban", és egy felhasználói tanulmány tíz résztvevővel, amely három robot flottáját irányítja egy koncentrációs feladat mellett, azt jelenti, hogy "58%-kal és 80%-kal növeli az emberi és robot teljesítményt az következő legjobb algoritmushoz képest, miközben csökkenti a felügyelő terhelést". A flotta beállítás ez munkának a természetes otthona; a Fleet-DAgger később formalizálta az interaktív flotta tanulást több robottal és felügyeletesekkel, azt javasolta a Return on Human Effort mennyiséget optimalizálni.

HG-DAgger: az emberi kaput tartja

Kelly et al. (2019) a másik irányba mennek. Nincs kapcsoló politika. A tanuló addig van "amíg az expert megfigyeli, hogy a kezdő egy nem biztonságos régióba lépett az allapotok közül", ekkor az expert veszi át az irányítást és irányítja a rendszert vissza. Az aggregálási szabály az szigorú rész: "Az expert akció címkéi csak ezekben a helyreállítási pályákban gyűjtik össze és adják hozzá az adathalmazhoz, ahol az emberi expertnek zavartalan irányítása volt a rendszer felett." Semmi nem jelölteti meg a címkét, miközben az ember néző.

Ez nem áll meg a kapcsolóban. A HG-DAgger azt is "tanul egy biztonsági küszöbot egy modell-bizonytalanság-alapú kockázat metrikához, amely azt lehet-e becsülni a teljesen betanított kezdő teljesítménye különféle állapotok régióiban": naplózza, mennyire volt bizonytalan a tanuló azekben a pillanatokban, amikor az emberi interveniált, és azoknak az utolsó negyedét átlagként veszi, ahol a tanuló a legjobban hasonlít a végső formájára. Ez nem egy kapu, amelyet a robot működtet, hanem egy diagnosztika, amely azt mondja meg, hol várt a befejezett politika. Az értékelés egy szimulált és egy valós-világbeli vezetési feladatot tartalmaz, és javított teljesítményt jelent a DAgger és a behavior cloning felett.

Egy kapcsolódó vonal megváltoztatja, mi számít mint egy címke. Spencer és kollégái Expert Intervention Learning azt tartja, hogy "bármilyen mennyiségű expert visszajelzés, legyen az intervenció vagy nem-intervenció, információt nyújt az aktuális állapot minőségéről, az akció optimalitásáról, vagy mindkettőről", formalizálva mint egy megkötés a tanuló érték függvénye és megoldva no-regret online tanulással. Ez alatt az olvasat alatt, a szakaszok ahol az emberi nézett és nem csinált semmit gyenge pozitív bizonyítékot adnak, nem üres. Az EIL ütközéskerülést tanul körülbelül egy perces expert irányítás felöl.

Robot kar munkatér kamerákkal az adatok gyűjtésére felügyelt policyrollout alatt
Az egy humán-felügyelt kör egy rendes inference futás egy felvevővel csatolva. A képkockák, amelyeket az operátor vezetet, jelölve vannak; a többi marad, ahogy volt.

Az variánsok egymás mellett

MódszerKi nyitja meg a kaputJelSzükséges rendelkezésre állásBejelentve
DAgger (Ross et al., 2011)Senki — a tanuló mindig vezetSemmi; az expert címkét jelent minden vizsgált államhozEgy expert képes az off-policy államokat címkézni anélkül, hogy irányítás alatt lenneNo-regret redukció garanciákkal a tanuló allapot eloszlása alatt
HG-DAgger (Kelly et al., 2019)Az emberi felügyelőA felügyelő megítélése, hogy az állapot nem biztonságosValaki, aki figyeli és a vezérlés tiszta átadásaLegyőzi a DAggert és a behavior cloninget egy szimulált és egy valós vezetési feladaton; a kockázat küszöbot is tanul
SafeDAgger (Zhang & Cho, 2016)A robotBináris osztályozó az L2 eltéréshez az referenciapoktól a tau felettEgy lekérdezhető referenciapokt az osztályozó címkéihezKevesebb referenciapokt lekérdezés egy verseny szimulátorban, gyorsabb konvergencia (nem adott szám)
EnsembleDAgger (Menda et al., 2019)A robotEnsemble variancia és távolság az expert akcióhoz, mindkettő küszöb alattNeurális hálózatok ensemblje plusz az expert akciója minden lépésbenJavított biztonság és tanulás inga és HalfCheetah felett
LazyDAgger (Hoque et al., 2021)A robot, hiszteréziszelSafeDAgger jele külön belépési és kilépési küszöbökkelAmit a SafeDAgger igényel, plusz egy második küszöb hangolásához~60% kevesebb kontextusváltás 3 feladaton; 60% magasabb sikerességi ráta YuMi szöveten
ThriftyDAgger (Hoque et al., 2021)A robot, költségvetés alattÚjdonság, vagy a feladatok befejezésének becsült kockázataEgy tanult kockázat-becslő és egy nyilatkozat intervenciós költségvetés100% sikerességi ráta a végrehajtási időn; felhasználói tanulmány (N=10): 58% és 80% nyereségek a követező legjobb algoritmussal szemben
EIL (Spencer et al., 2020)Az emberi — nem-intervenció szintén számítIntervenció és a hiánya mint megkötések az érték függvényreOnline no-regret tanulás egy érték megkötés felettÜtközéskerülés körülbelül egy perces expert irányítás felöl

Mit tesz meg mindegyik kapu, és mennyit számít

Olvass le az "szükséges" oszlopban és egy minta esik ki: minden robot-felügyelt jel ott egy proxy, amely meg kell hogy legyártva, és mindegyik proxynak van a saját számlája.

  • Az eltérés jelek (SafeDAgger, LazyDAgger, az EnsembleDAgger szabálya fele) szükséges egy referenciapoktot. Vagy van egy scripted expert, ebben az esetben az érdekes probléma már megoldott, vagy egy ember folyamatosan akciókat termel a háttérben, így egy távolság kiszámítható.
  • Az kétség jelek szükséges kalibrált episztémikus bizonytalanság. A kis vezérlés hálózatok egy ensemblja közelíti meg; egy trois-milliárd-paraméter vision-language-action modell egy ensemble memória és késedelmi probléma először.
  • Az újdonság és a kockázat jelek szükséges egy tanult becslő az feladatbetöltés, fel elég sikeres és sikertelen rolloutok. Egy feladaton, amelyet még dolgozol, az az adatok nem létezik az első körben.
  • Az emberi kapu szükséges figyelmet és semmi mást — az egyetlen jel elérhető az első napon, bármilyen politika architektúrán, plusz nincs extra modell tanítandó.
  • Nincs robot kapu eltávolítja az embert a szobából. Azok csökkentik, milyen gyakran az ember kell cselekedni, nem hogy kell jelen lenni.

Van egy csendesebb különbség abban, amit a kapu termel. Egy robot kapu tüzeléséből szél-pálya kézzel ad egy személyhez egy mozgó kart egy tetszőleges póznál. Egy emberi kapu hagyja az operátor válassza ki a pillanatot — az után a reach, előtt a grasp, nem félúton egy swing. Az helyreállítás szegmensek az kettőből nem egyformán tiszták, és ezek a szegmensek az teljes termék az körből.

Miért a humán-felügyelt forma nyer a valódi hardveren

Ez egy mérnöki érvelés, nem egy benchmark eredmény — nincs papír, amit találunk, amely az összes öt kaput futtatja ugyanazon a manipulátoron ugyanazzal a politika osztálysal. Négy pontra támaszodik.

Először, a felügyelő ott van mindenképpen. Senki sem hagyja a SO-100 kart felügyelet nélkül működni tárgyak mellett, melyek le tudja dönteni. Miután valaki figyeli, a határadó költség egy takeover gomb nyújtása közel nulla; egy kalibrált kockázat-becslő felépítése egy projekt.

Másodszor, a bizonytalanság, amely valójában meg tudsz mérni egy modern policyban gyakran a rossz mennyiség. A diffúzió vagy a flow-matching fej variancia által a mintavételi akció daraboknak keresztül produkál, és az variancia tükröz a multimodalitás a fej volt tanított reprezentálni, nem episztémikus tudatlanság az államról. Az EnsembleDAgger kétség term egy ensemble pontosan ezt használ rögzíteni. A kettő néz ugyanaz a szám és nem; az akció chunking és flow matching bejegyzések fedik, hogy ezek a fejek adják akciókat az első helyen.

Harmadszor, a meghibásodások, amelyek a manipulációban számít gyakran szemantikai nem pedig statisztikailag szokatlan. Egy politika bezárása az gripper két centiméterrel korábban, vagy elérésének magabiztosan a rossz egy kettőből azonos kockák, nem egy magas-variancia államban — ez magabiztos és rossz. Nincs variancia küszöb fogja meg ezt; egy személy nézésben azonnal fogja meg.

Negyedszer, a címke minőség — az eredeti HG-DAgger pont, és a gyakran kihagyott. Címkék összegyűjtve miközben az emberi zavartalan vezérlés volt jobb mint az címkét narráltatta egy mozgó rendszer felett. Ha a cél korrekciós adatok érdekes aggregálni, az terhelésnek bizonyít hazudik az automatizált kapu.

Ahol robot kapuk csinálnak fizetni

Az kép átfordít amikor egy felügyelő sok robotok — az rezsim felelős ThriftyDAgger felhasználói tanulmány és Fleet-DAgger formalizáció célzat. Az flotta az, az emberi figyelem a szűkös erőforrás és egy tökéletlen allokáció veri semmi. Az egy kar egy asztalon nem az abban a rezsimben.

Az emberi-felügyelt hurok, már vezetékezett fel

Átvétel egy futó inference munkamenet alatt, per-keretváltó intervenció zászlók az korrigált szegmensek, kurálás minden futás a korrekciók vagy értékelés, összeállítás egy vegyes adathalmazt a források melyik válassza ki, és folyamatos tanulás egy meglévő ellenpontból építik fel helyett hogy kézzel írni a script. Az átvétel működik egy leader karral, vagy a billentyűzettel és csúszkákkal ha nem is van egy.

Lásd, hogy a DAgger hurok hogyan fut

A kapu fele az módszer; az adatok kezelés az más fele

A kapu eldönti mely keretek egy emberi vezette, nem mit csinálnak velük, és az második döntés az ahol körök a legtöbb elpazarolva. Az első szabály az az egyik az D az DAggerben áll: összesít, nem helyettesít. Fino-tune egy checkpoint tisztán egy néhány száz korrekciós keretről ad neked egy modellt, amely látta majdnem semmi de helyreállítások és felejtett az névleges röppálya.

Az második szabály az az az az intervenciós keretek nem rendes keretek. Mandlekar et al. épített egy távolszabályozást szisztéma számára 6-DoF manipuláció engedi operátorok az monitor politikák és szervezik átvételen meghibásodás, majd képeztetett iteratív egy algoritmus amely "ösztönzi a politika tanulni hogyan átjárni szűk helyek az intervenciókon"; ügynökök oktatott azon az adathalmazon felülmúlta ügynökök oktatott egy azonos számon szokásos bemutató minta. Az Sirius tolja az ötlet az telepítés, "re-súlyozás betanítás minták az közelített emberi bizalom és optimizálás az politikák az súlyozott behavioral cloning". Mindkettő szükséges egy per-keret jelölő az amit emberi-vezette, amely az miért az intervention zászló számít több mint néz.

Az harmadik szabály az az automata keverés egy csapda. Egy összeállított adathalmaz kinek a források nem tudsz felsorol az az mely nem tudsz debug amikor az következő hurok rosszabb. Az ezen a platformon az összeállítás lépés az explicit erre miatt — eredeti adathalmaz plusz korrekciók, epizód választás per forrás, és az eredmény az egy rendes LeRobot dataset amely szinkronizál és tanít mint bárki más; az dataset dokumentáció fedik az formátum oldal.

Lépés egy körbenMit produkálA legtöbben szokásos út az mely az rosszabb
Futtass inference az rögzítés felkapcsoltEgy futás alatt az politika saját állapot eloszlásaRögzített mint sima teleoperation, vesztünk hogy egy politika volt vezetés
Szervezzen átvételen meghibásodásKorrekciós szegmensek egy per-keret intervenciós zászlóKorrigálás kozmetikus remegés, tanít stílus helyett helyreállítás
Kurálás mindegyik epizódKorrekciók, értékelés, vagy eldobásTartás minden; egy botlott átvétel költségeit több mint az epizód volt
Szinkronizálás az korrekciókEgy verziózott adathalmaz mellett az eredetiKorrekciók mely soha hagyja az helyi gép
Összeállítás az vegyes adathalmazEredeti plusz korrekciók, explicit választásCsendes auto-keverés, így egy később regresszió nem nyomozható egy forráshoz
Folyamatos egy checkpointbólEgy checkpoint felépítve az egy előzőbőlVárva egy optimalizáló mutatást; az súlyok felépít a modellt, azok nem visszaállít optimalizáló az

Beállítás egy kapu egy személy tud teljesen tartani

"Az ember dönt" nem egy specifikáció. Kettő operátorok különböző küszöbök termelnek összehasonlíthatatlan körök, és egy driftálő küszöb produkál egy trend mit nem tudsz olvasni. Írj le az triggerek előtte az első futás.

  1. Nevezd meg az feltételek mely nyit a kaput — megközelítés ki több mint egy fix margó, gripper bezárása a semmi felett, egy közös sodródása irányában egy limit, egy stall több mint egy másodperc vagy kettő — és tartsd meg az lista változatlan az körben.
  2. Nevezd meg mit nem nyit meg. Túllövés az politika helyreállít magából az egy magét tanulás jel; szervezzen átvételen ott törléseit helyreállítás azt már tudjon.
  3. Szervezzen átvételen korán elég egy tiszta kézfogáshoz, kéz vissza amint az az állapot helyreállítható.
  4. Naplózz miért szervezzel átvételt, per epizód. Három körök később ez az az egyetlen rekord az még az ugyanaz meghibásodás visszatér.
  5. Tartsd kamerák, feladat szöveg és operátor konstans körök keresztül. Megváltozás az és az számok stop összehasonlítható.

Mechanikusan az kézfogás van kettő variáns. Az egy leader karral, az leader kell elérni az follower jelenlegi póznál előtte torque átadás, vagy az kar ugrások; ez az igazítás mozgás az least-tesztelt rész az lánc valódi hardveren. Nélkül egy leader kar az átvétel az kézi az az első billentyűnyomás: az follower van held és az operátor oldja meg azt közösen-közöttük a billentyűzetből vagy húz csúszkák, az szerver-oldali szorítók tartása minden bemenet kicsi — egy pár fok per billentyűnyomás, egy maroknyi per csúszka frissítés, mivel nagy lépés egy held pózba az hogyan csíkozol egy szervó. Az lépés-által-lépés verzió az billentyű kötésekkel az az átvezet egy DAgger körből egy SO-100; háttér mind az teleoperation módok az az teleoperation dokumentáció és az leader-follower bejegyzés.

Összehasonlítás az támogatott politika architektúrák az azok betanítás és inference jellemzők
Az kapu az architektúra-agnosztikus. Mely politika mely korriálás változtatások az betanítás költség egy körből, nem hogyan az átvétel működik.

Olvasás azonban az kapu csinál valamit

Az metrika egy humán-felügyelt hurok az intervenciós ráta: intervenciós keretek szétválva az keretek az futás. Ez egy feladaton — ha nem esik körök keresztül, az hurok vásárolt semmi, és az az követó egy kell megváltozás valamit más mint az mennyiség az adatok.

Ez egy torzított metrika és te kell tudni hogyan. Ez méri az operátor küszöb mint az politika kompetencia, mely az miért az trigger lista marad rögzített; egy operátor mely relaxál egy munkamenet termel egy esett görbe semmi mögött. Ez is figyelmen kívül hagyta súlyosság — tíz keretek megállít ütközés és tíz nyomtatás grasp néz azonos. Pár ez egy fix értékelés készlet nem korrekciós adatok volt egyszer húzott feöl. Az cikk egy mérés egy DAgger hurok működik keresztül az értékelés terv, befogadva hogyan tartsd értékelés epizódok ki az betanítás mix.

Az emberi kapu, őszintén
Mit ad meg neked
  • Működik az első napon, a bármilyen politika architektúra, semmi plusz modell kalibrálni
  • Fogja meg magabiztos-és-rossz meghibásodások nem variancia küszöb detektál
  • Produkál korrekciók rögzített miközben az operátor volt teljes vezérlés, az egy pillanatban azok választott
  • Hozamok egy per-keret jelölő mely intervenció-súlyozott módszerek mint az IWR és Sirius fogyasztanak
Mit nem
  • Költségek folyamatos felügyelet; ez nem skálázható egy személy és sok robotok
  • Függ az operátor konzisztencia — egy driftálő küszöb korrupt az intervenciós ráta
  • Produkál nincs kockázat modell az magát; az HG-DAgger megtanult küszöb és ThriftyDAgger becslő vannak extra gépezet
  • Számít keretek, nem következmények
  • Nem menteni egy politika mely meghibásodás az előtt ellenőrzés, mint egy cserélt kamera vagy egy mislabelled feladat szöveg

Nyílt kérdések érdekes tartani nézet

Az benchmarkok vannak gyenge. Spencer és kollégái megvizsgálva azokat mely használt tesztelni imitációs tanulás megközelítések és talált azok "realizálható és egyszerű és így előbb az rögzítése az keménye rezsimek hiba összeadódás nézet az real-world döntés probléma" — és, elleni az körülvevő irodalom, talált sima behavioral cloning csinál jól azok. Ez az ok kételkedni minden rangsor az DAgger variánsok pihenő azok a feladatokat, befogadva egyesek számai az táblázat felett.

Robot kapuk nagy politikákon nem megoldott vagy. Az AIM munka cserél bizonytalanság az egy proxy Q-funkció utánzás az emberi intervenciós szabályt és jelent 40% fejlesztés az take-over költség és tanulás hatékonyság fölött ThriftyDAgger — az folyamatos és diszkrét vezérlés, nem az vision-language-action modell vezetés egy manipulátor. Hogy bármelyik ezek kapuk átvitel egy finom-hangolt VLA az nyílt. Az felmérés csinál egy kapcsolódó pont: az terület terminológia és szerkezet nem unifikált keresztül az irodalom, mely csinál módszerek kemény összehasonlítani. Az te az kar, az te naplók vannak az bizonyítéka neked van.

Van az HG-DAgger igazán DAgger ha az emberi csak címkét során intervenciókon?

Ez tartja az rész mely számít — adatok gyűjtött alatt az állapot eloszlása mely az tanuló indukál, összesített az mely jött előtte — és csökkent az rész mely nem túléli az kontakt az hardvarral. Az Kelly et al. bemutat ez az egy variáns; az 2011 no-regret garancia nem visz át tisztában.

Tudom-e használat egy robot kapu az egy finom-hangolt VLA politika egy SO-100?

Nem egyenesen. Az SafeDAgger klasszifikátor szükséges egy lekérdezhető referenciapokt mely te nem van. Az EnsembleDAgger szükséges egy ensemble, mely egy multi-milliárd-paraméter modellt jelent számos másolat az memória plusz azok inference költség. Az ThriftyDAgger szükséges egy kockázat becslő illesztett az sikerek és hibák mely nem léteznek előtte az te első körök.

Mennyi hosszú kell egy egyetlen átvétel legyen?

Elég hosszú elérni egy államot mely az politika tud folytatni feöl, és nem hosszabb: kiterjesztett átvételek fordít az futás az egy bemutató munkamenet és özönét az korrekciós készlet az névleges viselkedés. Az LazyDAgger lelet vág az másik út is — sok nagyon rövid kapcsolók azok saját költség.

Kell-e én csak az korrigált szegmensek tanít?

Nem — azt az a legtöbben szokásos út vész egy hurok. Egy modellt finom-hangolt csak helyreállítások az egy látott szinte semmi de helyreállítások. Keveri korrekciók az eredeti adathalmazba az forrásokkal választott kifejezett; hez megy további, néz az intervenciós-súlyozott megközelítés mint az IWR vagy Sirius, mely fel-súlyoz emberi-vezette keretek helyett mint elkülönítünk azok.

Mit történik az intervenciós ráta nem esik után egy hurok?

Szerzegy az az arcképen: az hurok nem segített. Előtte hozzáadás korrekciók, ellenőrzés az olcsóbb magyarázatok — csinál az operátor küszöb sodródás, voltak az korrekciók kozmetikus, csinál az összeállított adathalmaz teljesen tartalmaznak azok, volt betanítás felépítve az szándékolt checkpoint. Egy hurok mely csendes kezdett az az alap modellt néz pontosan mint egy hurok mely sikertelen tanulja.

Nem-intervenció hordoz információt?

Alatt az Expert Intervention Learning, igen: szakaszok ahol az felügyelő nézte és nem cselekedni van olvasott mint gyenge bizonyítéka mely állapot és akció voltak elfogadható, formalizált mint egy megkötés az érték függvényre. A legtöbb gyakorlati csővezetékek, befogadva ez az egy, jelölés csak mit az emberi vezette.

Az egy egyetlen kar egy asztalon az választás vannak feladva: tartsd meg az kaput te, írj le mit nyit meg, és töltsd meg az erőfeszítés az adatok kezelés mögött helyett helyett az automatizálás a kapcsoló. Az platform oldal leírt az az DAgger hurok oldal, betanítás lehetőségek per politika család alatt betanítás és árazás. Az háttér, kezd az imitációs tanulás és imitációs tanulás az SO-100; számára első futás, futtat az te először politika az rövidebb út.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started