
A sima DAgger azt kéri, hogy egy ember címkézze a államokat, miközben a robot még vezet. Valódi hardveren ez nem biztonságos és rossz címkéket termel. Az adapost variánsai az őszinte címkézést egy kapu helyettesítik, amelyet valakinek meg kell tartania: a humán a HG-DAggerben, egy biztonsági osztályozó a SafeDAggerben, egy ensemble ellentmondása az EnsembleDAggerben, egy költségvetés-korlátozott újdonság- és kockázatbecslés a ThriftyDAggerben. Ez a cikk összehasonlítja őket aszerint, hogy ki tulajdonosa a kapunak, milyen jel nyitja meg, és mennyibe kerül mindegyik — és miért a humán-felügyelt forma az, amely túlél a valódi kar kontaktusát.
Egy klónozott policy ott bukik meg, ahol a betanítási adatai kifogynak. A megoldás az, hogy továbbra is az policy saját állapot-eloszlása alatt gyűjtse az adatokat a demonstrátor helyett, amit a DAgger tesz és amit az adatagyújtés bevezetése az alapelvekből felsorol. Nyitva hagyja az eredeti algoritmus kínos részét: amíg a tanuló vezet, az expertek azt kellene, hogy mondják, mit csinálnának, minden államban, anélkül, hogy irányítás alatt lennének.
Egy szimulátorban egy scripted experthel, amely ingyenes. Egy asztalon egy valódi karral rajta nem ingyenes, és nem biztonságos. A HG-DAgger szerzői pontosan megfogalmazzák az ellenvetést: az ilyen mintavételi sémák "megkövetelik az experttől, hogy akciókat jelöljön meg anélkül, hogy teljesen irányítás alatt lenne", amely "csökkentheti a biztonságot, és ha embereket használnak expertkén, valószínűleg rontja az összegyűjtött címkék minőségét az érzékelt aktuátor-késedelem miatt" (Kelly et al., 2019). Két hiba rejtőzik ebben a mondatban: a policy továbbra is olyan államokba vezet, amelyeket senki sem akar, és az ezzel a kockázattal megvásárolt címkék rosszabbak, mint azok, amelyeket egy ember előállít, miközben a vezérléseket tartja. Minden alabbbbi variáns ugyanazt a kérdést válaszolja meg — kapu felügyelet és hagyja, hogy valaki eldöntse, mikor nyílik meg. Abban különböznek, hogy ki az valaki.
A rövid verzió
- •Az adapost variánsok az őszinte címkézést a policy vezérlés és az expert vezérlés közötti kapcsolóval helyettesítik. Az, ami elválasztja őket, az, hogy ki tulajdonosa a kapcsolónak.
- •A HG-DAgger a kapcsolót az embernek adja, és csak azokat az adatokat aggregálja, amelyeket a humánnak volt zavartalan irányítása alatt rögzített.
- •A SafeDAgger azt egy bináris osztályozónak adja, amely egy referenciapoktól való eltérést jelöz; az EnsembleDAgger alacsony ensemble varianciát és kis távolságot az expert akcióhoz egy időben követel meg.
- •A LazyDAgger hiszterézist ad hozzá, így a vezérlés nem pingpongol; a ThriftyDAgger egy explicit intervenciós költségvetés alatt újdonságra vagy becsült kockázatra kaput nyit.
- •A robot-felügyelt jelek valamit igényelnek, amit egy jól finomhangolt VLA egy hobby-klazályu karon általában hiányzik: egy referenciapokt, egy olcsó ensemble, vagy kalibrált episztémikus bizonytalanságot.
- •A kapu a módszer fele. Mi történik az intervenciós szegmensekkel azután — keverés, súlyozás, aggregálás — eldönti, hogy a kör javított-e valamit.
Humán-felügyelt és robot-felügyelt: a szétválás, amely számít
Az interaktív imitációs tanulásnak van saját felmérése; Celemin és kollégái az visszajelzés típusa, interfész, tanulási modell, felhasználói élmény, alkalmazás és benchmark szerint katalogizálják. Az a szétválás, amely eldönti az Ön mérnöki munkáját, egyszerűbb bármelyik tengelynél, és a közelmúltbeli munka közvetlenül nevezi el: egy módszer humán-felügyelt amikor a felügyelő dönt az intervenció időpontjáról, és robot-felügyelt amikor az ügynök dönt arról, mikor kérjen segítséget (Cai et al., 2025). Minden más a gépezet az egyik vagy a másik választás kiszolgálásában. Az adásvétel látható az elejétől: a humán kapu folyamatos figyelmet igényel, és a robot kapu azt ígéri, hogy ezt a figyelmet visszaadja — de csak akkor, ha az a jel, amely rá kaput nyit, megbízható, és az jel felépítése a maga kutatási problémája.
SafeDAgger: egy osztályozó, amely a saját eltéréseit jelözi
Zhang és Cho SafeDAggerje (2016) az e kapuk közül a legkorábbi. A referenciapokt lekérdezése a költséges rész, így egy második, kis hálózat — a biztonsági politika — azt jelözi előre, hogy a lekérdezés egyáltalán megéri-e. "Visszaadja a bináris címkét, amely azt jelzi, hogy az elsődleges politika valószínűleg eltér egy referenciapoktól, anélkül, hogy lekérdezné azt". A címke a két politika akcióinak négyzetes L2 eltérésénél van meghatározva egy tau küszöbnél, és az osztályozót bináris kereszt-entrópiával illesztik. A futtatáskor minden állapotban eldönti, hogy a tanuló továbbra is vezet, vagy a referenciapokt átveszi. Az absztrakt kevesebb referenciapokt-lekérdezésről számol be egy autóverseny szimulátorban, valamint egy konvergencia gyorsulást, amely a szerzők egy automatizált kurikulum hatásnak tulajdonítanak, anélkül hogy egy számot adnának hozzá.
A csapda a definícióban van, nem az eredményekben. Az osztályozó betanítása megköveteli az referenciapokt akcióját minden olyan állapotban, amely az illesztéshez használt, amely azt feltételezi, hogy a referencia egy másik program. Ha a referencia egy személy egy leader karral, akkor az az címkekészlet nem olcsó, és a módszer elveszíti azokat a tulajdonságokat, amelyért meg volt tervezve.
EnsembleDAgger: kétség és eltérés, mindkettő
Menda, Driggs-Campbell és Kochenderfer (2019) valószínűségi kérdésként kezelik a kaput. Az EnsembleDAgger "egy Gauss-proces közelítéseit használ neurális hálózatok ensemblei segítségével" és az ensemble varianciáját megbízhatóság proxyként olvassa: a magas variancia azt jelenti, hogy egy régió eltér a betanítási adatokból, amely — az expert feltételezésével, hogy elkerüli a meghibásodás államait — korrelál a meghibásodáshoz való közelséggel. A szabály egy konjunkció. A tanuló csak akkor járulhat hozzá, ha az L2 távolság az átlagos akciója és az expert akciója között egy küszöb alatt marad (eltérés) és a jósolt akciójának varianciája egy második alatt marad (kétség). Ha valamelyik meghiúsul, az expert veszi át az irányítást. A cél a tanuló akcióinak részarányának maximalizálása a meghibásodás valószínűségének korlátozása mellett; a papír javított biztonságot és tanulást jelent a fordított inga és a MuJoCo HalfCheetah egy másik DAgger variánsa ellen.
Ez halkan diszkvalifikálja a teljes szabályt a zárva maradt felügyelethez. A tanuló akciója és az expert akciója közötti távolság megköveteli az expert akcióját az adott állapotban, az adott pillanatban. Egy scripted expertnél, jó. Egy emberrel az ember folyamatosan akciókat kell hogy produkáljon — pontosan az a terhelés, amely az adapost variánsok eltávolítására voltak szánva. Az kétség term egyedül zárva maradt; a konjunkció nem.
LazyDAgger: stop the switch from chattering
Hoque és kollégái (2021) a költségeket támadták, amely az előző papírok nem mérték: a kapcsolót magát. Minden intervenció "megzavarja az egyéb munkát, amely az ember végez, késedelmet okoz az felügyelő és az autonóm vezérlés közötti kontextusváltásnál, és időt igényel a végrehajtáshoz". Egy kapu, amely tízszer nyílik meg percenként, rosszabb, mint az, amely egyszer megnyílik tíz másodpercre, azonos autonóm részarányban. A LazyDAgger kiterjeszti a SafeDAggert aszimmetrikus küszöbökkel — nehezebb belépni a felügyelő vezérlésbe, mint hogy benne maradjon — így a rendszer nem oszcillál a határon. A szimulációban "átlagosan 60%-kal csökkentheti a kontextusváltásokat a SafeDAgger felett 3 folyamatos vezérlési feladaton, miközben fenntartja az állam-of-the-art policy teljesítményt"; a szövet manipulációban egy ABB YuMival "60%-kal csökkenti a kontextusváltásokat, miközben 60%-kal magasabb sikerességi rátát ér el a SafeDAggernél a végrehajtás idején".
ThriftyDAgger: újdonság vagy kockázat, költségvetés alatt
A ThriftyDAgger (Hoque et al., CoRL 2021) a felügyelő költségvetésből indul, nem a policyból. "Egy tanult kapcsoló poktöt használ, hogy csak olyan államokban kérjen intervenciót, amelyek elég (1) újak, ahol a robot policynak nincs referencia viselkedése utánozni, vagy (2) kockázatosak, ahol a robot alacsony bizonytalanságú a feladatbetöltésben", egy új metrikával ezért a kockázat becslésére. A költségvetés egy bemenet, nem egy kimenet: azt határozod meg, hogy mennyi emberi időt fogunk tölteni. Végrehajtási időben alkalmazva a módszer "100%-os sikerességi rátát ér el mind a szimulációs, mind a fizikai feladatokban", és egy felhasználói tanulmány tíz résztvevővel, amely három robot flottáját irányítja egy koncentrációs feladat mellett, azt jelenti, hogy "58%-kal és 80%-kal növeli az emberi és robot teljesítményt az következő legjobb algoritmushoz képest, miközben csökkenti a felügyelő terhelést". A flotta beállítás ez munkának a természetes otthona; a Fleet-DAgger később formalizálta az interaktív flotta tanulást több robottal és felügyeletesekkel, azt javasolta a Return on Human Effort mennyiséget optimalizálni.
HG-DAgger: az emberi kaput tartja
Kelly et al. (2019) a másik irányba mennek. Nincs kapcsoló politika. A tanuló addig van "amíg az expert megfigyeli, hogy a kezdő egy nem biztonságos régióba lépett az allapotok közül", ekkor az expert veszi át az irányítást és irányítja a rendszert vissza. Az aggregálási szabály az szigorú rész: "Az expert akció címkéi csak ezekben a helyreállítási pályákban gyűjtik össze és adják hozzá az adathalmazhoz, ahol az emberi expertnek zavartalan irányítása volt a rendszer felett." Semmi nem jelölteti meg a címkét, miközben az ember néző.
Ez nem áll meg a kapcsolóban. A HG-DAgger azt is "tanul egy biztonsági küszöbot egy modell-bizonytalanság-alapú kockázat metrikához, amely azt lehet-e becsülni a teljesen betanított kezdő teljesítménye különféle állapotok régióiban": naplózza, mennyire volt bizonytalan a tanuló azekben a pillanatokban, amikor az emberi interveniált, és azoknak az utolsó negyedét átlagként veszi, ahol a tanuló a legjobban hasonlít a végső formájára. Ez nem egy kapu, amelyet a robot működtet, hanem egy diagnosztika, amely azt mondja meg, hol várt a befejezett politika. Az értékelés egy szimulált és egy valós-világbeli vezetési feladatot tartalmaz, és javított teljesítményt jelent a DAgger és a behavior cloning felett.
Egy kapcsolódó vonal megváltoztatja, mi számít mint egy címke. Spencer és kollégái Expert Intervention Learning azt tartja, hogy "bármilyen mennyiségű expert visszajelzés, legyen az intervenció vagy nem-intervenció, információt nyújt az aktuális állapot minőségéről, az akció optimalitásáról, vagy mindkettőről", formalizálva mint egy megkötés a tanuló érték függvénye és megoldva no-regret online tanulással. Ez alatt az olvasat alatt, a szakaszok ahol az emberi nézett és nem csinált semmit gyenge pozitív bizonyítékot adnak, nem üres. Az EIL ütközéskerülést tanul körülbelül egy perces expert irányítás felöl.

Az variánsok egymás mellett
| Módszer | Ki nyitja meg a kaput | Jel | Szükséges rendelkezésre állás | Bejelentve |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Senki — a tanuló mindig vezet | Semmi; az expert címkét jelent minden vizsgált államhoz | Egy expert képes az off-policy államokat címkézni anélkül, hogy irányítás alatt lenne | No-regret redukció garanciákkal a tanuló allapot eloszlása alatt |
| HG-DAgger (Kelly et al., 2019) | Az emberi felügyelő | A felügyelő megítélése, hogy az állapot nem biztonságos | Valaki, aki figyeli és a vezérlés tiszta átadása | Legyőzi a DAggert és a behavior cloninget egy szimulált és egy valós vezetési feladaton; a kockázat küszöbot is tanul |
| SafeDAgger (Zhang & Cho, 2016) | A robot | Bináris osztályozó az L2 eltéréshez az referenciapoktól a tau felett | Egy lekérdezhető referenciapokt az osztályozó címkéihez | Kevesebb referenciapokt lekérdezés egy verseny szimulátorban, gyorsabb konvergencia (nem adott szám) |
| EnsembleDAgger (Menda et al., 2019) | A robot | Ensemble variancia és távolság az expert akcióhoz, mindkettő küszöb alatt | Neurális hálózatok ensemblje plusz az expert akciója minden lépésben | Javított biztonság és tanulás inga és HalfCheetah felett |
| LazyDAgger (Hoque et al., 2021) | A robot, hiszteréziszel | SafeDAgger jele külön belépési és kilépési küszöbökkel | Amit a SafeDAgger igényel, plusz egy második küszöb hangolásához | ~60% kevesebb kontextusváltás 3 feladaton; 60% magasabb sikerességi ráta YuMi szöveten |
| ThriftyDAgger (Hoque et al., 2021) | A robot, költségvetés alatt | Újdonság, vagy a feladatok befejezésének becsült kockázata | Egy tanult kockázat-becslő és egy nyilatkozat intervenciós költségvetés | 100% sikerességi ráta a végrehajtási időn; felhasználói tanulmány (N=10): 58% és 80% nyereségek a követező legjobb algoritmussal szemben |
| EIL (Spencer et al., 2020) | Az emberi — nem-intervenció szintén számít | Intervenció és a hiánya mint megkötések az érték függvényre | Online no-regret tanulás egy érték megkötés felett | Ütközéskerülés körülbelül egy perces expert irányítás felöl |
Mit tesz meg mindegyik kapu, és mennyit számít
Olvass le az "szükséges" oszlopban és egy minta esik ki: minden robot-felügyelt jel ott egy proxy, amely meg kell hogy legyártva, és mindegyik proxynak van a saját számlája.
- Az eltérés jelek (SafeDAgger, LazyDAgger, az EnsembleDAgger szabálya fele) szükséges egy referenciapoktot. Vagy van egy scripted expert, ebben az esetben az érdekes probléma már megoldott, vagy egy ember folyamatosan akciókat termel a háttérben, így egy távolság kiszámítható.
- Az kétség jelek szükséges kalibrált episztémikus bizonytalanság. A kis vezérlés hálózatok egy ensemblja közelíti meg; egy trois-milliárd-paraméter vision-language-action modell egy ensemble memória és késedelmi probléma először.
- Az újdonság és a kockázat jelek szükséges egy tanult becslő az feladatbetöltés, fel elég sikeres és sikertelen rolloutok. Egy feladaton, amelyet még dolgozol, az az adatok nem létezik az első körben.
- Az emberi kapu szükséges figyelmet és semmi mást — az egyetlen jel elérhető az első napon, bármilyen politika architektúrán, plusz nincs extra modell tanítandó.
- Nincs robot kapu eltávolítja az embert a szobából. Azok csökkentik, milyen gyakran az ember kell cselekedni, nem hogy kell jelen lenni.
Van egy csendesebb különbség abban, amit a kapu termel. Egy robot kapu tüzeléséből szél-pálya kézzel ad egy személyhez egy mozgó kart egy tetszőleges póznál. Egy emberi kapu hagyja az operátor válassza ki a pillanatot — az után a reach, előtt a grasp, nem félúton egy swing. Az helyreállítás szegmensek az kettőből nem egyformán tiszták, és ezek a szegmensek az teljes termék az körből.
Miért a humán-felügyelt forma nyer a valódi hardveren
Ez egy mérnöki érvelés, nem egy benchmark eredmény — nincs papír, amit találunk, amely az összes öt kaput futtatja ugyanazon a manipulátoron ugyanazzal a politika osztálysal. Négy pontra támaszodik.
Először, a felügyelő ott van mindenképpen. Senki sem hagyja a SO-100 kart felügyelet nélkül működni tárgyak mellett, melyek le tudja dönteni. Miután valaki figyeli, a határadó költség egy takeover gomb nyújtása közel nulla; egy kalibrált kockázat-becslő felépítése egy projekt.
Másodszor, a bizonytalanság, amely valójában meg tudsz mérni egy modern policyban gyakran a rossz mennyiség. A diffúzió vagy a flow-matching fej variancia által a mintavételi akció daraboknak keresztül produkál, és az variancia tükröz a multimodalitás a fej volt tanított reprezentálni, nem episztémikus tudatlanság az államról. Az EnsembleDAgger kétség term egy ensemble pontosan ezt használ rögzíteni. A kettő néz ugyanaz a szám és nem; az akció chunking és flow matching bejegyzések fedik, hogy ezek a fejek adják akciókat az első helyen.
Harmadszor, a meghibásodások, amelyek a manipulációban számít gyakran szemantikai nem pedig statisztikailag szokatlan. Egy politika bezárása az gripper két centiméterrel korábban, vagy elérésének magabiztosan a rossz egy kettőből azonos kockák, nem egy magas-variancia államban — ez magabiztos és rossz. Nincs variancia küszöb fogja meg ezt; egy személy nézésben azonnal fogja meg.
Negyedszer, a címke minőség — az eredeti HG-DAgger pont, és a gyakran kihagyott. Címkék összegyűjtve miközben az emberi zavartalan vezérlés volt jobb mint az címkét narráltatta egy mozgó rendszer felett. Ha a cél korrekciós adatok érdekes aggregálni, az terhelésnek bizonyít hazudik az automatizált kapu.
Az kép átfordít amikor egy felügyelő sok robotok — az rezsim felelős ThriftyDAgger felhasználói tanulmány és Fleet-DAgger formalizáció célzat. Az flotta az, az emberi figyelem a szűkös erőforrás és egy tökéletlen allokáció veri semmi. Az egy kar egy asztalon nem az abban a rezsimben.
Az emberi-felügyelt hurok, már vezetékezett fel
Átvétel egy futó inference munkamenet alatt, per-keretváltó intervenció zászlók az korrigált szegmensek, kurálás minden futás a korrekciók vagy értékelés, összeállítás egy vegyes adathalmazt a források melyik válassza ki, és folyamatos tanulás egy meglévő ellenpontból építik fel helyett hogy kézzel írni a script. Az átvétel működik egy leader karral, vagy a billentyűzettel és csúszkákkal ha nem is van egy.
Lásd, hogy a DAgger hurok hogyan futA kapu fele az módszer; az adatok kezelés az más fele
A kapu eldönti mely keretek egy emberi vezette, nem mit csinálnak velük, és az második döntés az ahol körök a legtöbb elpazarolva. Az első szabály az az egyik az D az DAggerben áll: összesít, nem helyettesít. Fino-tune egy checkpoint tisztán egy néhány száz korrekciós keretről ad neked egy modellt, amely látta majdnem semmi de helyreállítások és felejtett az névleges röppálya.
Az második szabály az az az az intervenciós keretek nem rendes keretek. Mandlekar et al. épített egy távolszabályozást szisztéma számára 6-DoF manipuláció engedi operátorok az monitor politikák és szervezik átvételen meghibásodás, majd képeztetett iteratív egy algoritmus amely "ösztönzi a politika tanulni hogyan átjárni szűk helyek az intervenciókon"; ügynökök oktatott azon az adathalmazon felülmúlta ügynökök oktatott egy azonos számon szokásos bemutató minta. Az Sirius tolja az ötlet az telepítés, "re-súlyozás betanítás minták az közelített emberi bizalom és optimizálás az politikák az súlyozott behavioral cloning". Mindkettő szükséges egy per-keret jelölő az amit emberi-vezette, amely az miért az intervention zászló számít több mint néz.
Az harmadik szabály az az automata keverés egy csapda. Egy összeállított adathalmaz kinek a források nem tudsz felsorol az az mely nem tudsz debug amikor az következő hurok rosszabb. Az ezen a platformon az összeállítás lépés az explicit erre miatt — eredeti adathalmaz plusz korrekciók, epizód választás per forrás, és az eredmény az egy rendes LeRobot dataset amely szinkronizál és tanít mint bárki más; az dataset dokumentáció fedik az formátum oldal.
| Lépés egy körben | Mit produkál | A legtöbben szokásos út az mely az rosszabb |
|---|---|---|
| Futtass inference az rögzítés felkapcsolt | Egy futás alatt az politika saját állapot eloszlása | Rögzített mint sima teleoperation, vesztünk hogy egy politika volt vezetés |
| Szervezzen átvételen meghibásodás | Korrekciós szegmensek egy per-keret intervenciós zászló | Korrigálás kozmetikus remegés, tanít stílus helyett helyreállítás |
| Kurálás mindegyik epizód | Korrekciók, értékelés, vagy eldobás | Tartás minden; egy botlott átvétel költségeit több mint az epizód volt |
| Szinkronizálás az korrekciók | Egy verziózott adathalmaz mellett az eredeti | Korrekciók mely soha hagyja az helyi gép |
| Összeállítás az vegyes adathalmaz | Eredeti plusz korrekciók, explicit választás | Csendes auto-keverés, így egy később regresszió nem nyomozható egy forráshoz |
| Folyamatos egy checkpointból | Egy checkpoint felépítve az egy előzőből | Várva egy optimalizáló mutatást; az súlyok felépít a modellt, azok nem visszaállít optimalizáló az |
Beállítás egy kapu egy személy tud teljesen tartani
"Az ember dönt" nem egy specifikáció. Kettő operátorok különböző küszöbök termelnek összehasonlíthatatlan körök, és egy driftálő küszöb produkál egy trend mit nem tudsz olvasni. Írj le az triggerek előtte az első futás.
- Nevezd meg az feltételek mely nyit a kaput — megközelítés ki több mint egy fix margó, gripper bezárása a semmi felett, egy közös sodródása irányában egy limit, egy stall több mint egy másodperc vagy kettő — és tartsd meg az lista változatlan az körben.
- Nevezd meg mit nem nyit meg. Túllövés az politika helyreállít magából az egy magét tanulás jel; szervezzen átvételen ott törléseit helyreállítás azt már tudjon.
- Szervezzen átvételen korán elég egy tiszta kézfogáshoz, kéz vissza amint az az állapot helyreállítható.
- Naplózz miért szervezzel átvételt, per epizód. Három körök később ez az az egyetlen rekord az még az ugyanaz meghibásodás visszatér.
- Tartsd kamerák, feladat szöveg és operátor konstans körök keresztül. Megváltozás az és az számok stop összehasonlítható.
Mechanikusan az kézfogás van kettő variáns. Az egy leader karral, az leader kell elérni az follower jelenlegi póznál előtte torque átadás, vagy az kar ugrások; ez az igazítás mozgás az least-tesztelt rész az lánc valódi hardveren. Nélkül egy leader kar az átvétel az kézi az az első billentyűnyomás: az follower van held és az operátor oldja meg azt közösen-közöttük a billentyűzetből vagy húz csúszkák, az szerver-oldali szorítók tartása minden bemenet kicsi — egy pár fok per billentyűnyomás, egy maroknyi per csúszka frissítés, mivel nagy lépés egy held pózba az hogyan csíkozol egy szervó. Az lépés-által-lépés verzió az billentyű kötésekkel az az átvezet egy DAgger körből egy SO-100; háttér mind az teleoperation módok az az teleoperation dokumentáció és az leader-follower bejegyzés.

Olvasás azonban az kapu csinál valamit
Az metrika egy humán-felügyelt hurok az intervenciós ráta: intervenciós keretek szétválva az keretek az futás. Ez egy feladaton — ha nem esik körök keresztül, az hurok vásárolt semmi, és az az követó egy kell megváltozás valamit más mint az mennyiség az adatok.
Ez egy torzított metrika és te kell tudni hogyan. Ez méri az operátor küszöb mint az politika kompetencia, mely az miért az trigger lista marad rögzített; egy operátor mely relaxál egy munkamenet termel egy esett görbe semmi mögött. Ez is figyelmen kívül hagyta súlyosság — tíz keretek megállít ütközés és tíz nyomtatás grasp néz azonos. Pár ez egy fix értékelés készlet nem korrekciós adatok volt egyszer húzott feöl. Az cikk egy mérés egy DAgger hurok működik keresztül az értékelés terv, befogadva hogyan tartsd értékelés epizódok ki az betanítás mix.
- Működik az első napon, a bármilyen politika architektúra, semmi plusz modell kalibrálni
- Fogja meg magabiztos-és-rossz meghibásodások nem variancia küszöb detektál
- Produkál korrekciók rögzített miközben az operátor volt teljes vezérlés, az egy pillanatban azok választott
- Hozamok egy per-keret jelölő mely intervenció-súlyozott módszerek mint az IWR és Sirius fogyasztanak
- Költségek folyamatos felügyelet; ez nem skálázható egy személy és sok robotok
- Függ az operátor konzisztencia — egy driftálő küszöb korrupt az intervenciós ráta
- Produkál nincs kockázat modell az magát; az HG-DAgger megtanult küszöb és ThriftyDAgger becslő vannak extra gépezet
- Számít keretek, nem következmények
- Nem menteni egy politika mely meghibásodás az előtt ellenőrzés, mint egy cserélt kamera vagy egy mislabelled feladat szöveg
Nyílt kérdések érdekes tartani nézet
Az benchmarkok vannak gyenge. Spencer és kollégái megvizsgálva azokat mely használt tesztelni imitációs tanulás megközelítések és talált azok "realizálható és egyszerű és így előbb az rögzítése az keménye rezsimek hiba összeadódás nézet az real-world döntés probléma" — és, elleni az körülvevő irodalom, talált sima behavioral cloning csinál jól azok. Ez az ok kételkedni minden rangsor az DAgger variánsok pihenő azok a feladatokat, befogadva egyesek számai az táblázat felett.
Robot kapuk nagy politikákon nem megoldott vagy. Az AIM munka cserél bizonytalanság az egy proxy Q-funkció utánzás az emberi intervenciós szabályt és jelent 40% fejlesztés az take-over költség és tanulás hatékonyság fölött ThriftyDAgger — az folyamatos és diszkrét vezérlés, nem az vision-language-action modell vezetés egy manipulátor. Hogy bármelyik ezek kapuk átvitel egy finom-hangolt VLA az nyílt. Az felmérés csinál egy kapcsolódó pont: az terület terminológia és szerkezet nem unifikált keresztül az irodalom, mely csinál módszerek kemény összehasonlítani. Az te az kar, az te naplók vannak az bizonyítéka neked van.
Van az HG-DAgger igazán DAgger ha az emberi csak címkét során intervenciókon?▾
Ez tartja az rész mely számít — adatok gyűjtött alatt az állapot eloszlása mely az tanuló indukál, összesített az mely jött előtte — és csökkent az rész mely nem túléli az kontakt az hardvarral. Az Kelly et al. bemutat ez az egy variáns; az 2011 no-regret garancia nem visz át tisztában.
Tudom-e használat egy robot kapu az egy finom-hangolt VLA politika egy SO-100?▾
Nem egyenesen. Az SafeDAgger klasszifikátor szükséges egy lekérdezhető referenciapokt mely te nem van. Az EnsembleDAgger szükséges egy ensemble, mely egy multi-milliárd-paraméter modellt jelent számos másolat az memória plusz azok inference költség. Az ThriftyDAgger szükséges egy kockázat becslő illesztett az sikerek és hibák mely nem léteznek előtte az te első körök.
Mennyi hosszú kell egy egyetlen átvétel legyen?▾
Elég hosszú elérni egy államot mely az politika tud folytatni feöl, és nem hosszabb: kiterjesztett átvételek fordít az futás az egy bemutató munkamenet és özönét az korrekciós készlet az névleges viselkedés. Az LazyDAgger lelet vág az másik út is — sok nagyon rövid kapcsolók azok saját költség.
Kell-e én csak az korrigált szegmensek tanít?▾
Nem — azt az a legtöbben szokásos út vész egy hurok. Egy modellt finom-hangolt csak helyreállítások az egy látott szinte semmi de helyreállítások. Keveri korrekciók az eredeti adathalmazba az forrásokkal választott kifejezett; hez megy további, néz az intervenciós-súlyozott megközelítés mint az IWR vagy Sirius, mely fel-súlyoz emberi-vezette keretek helyett mint elkülönítünk azok.
Mit történik az intervenciós ráta nem esik után egy hurok?▾
Szerzegy az az arcképen: az hurok nem segített. Előtte hozzáadás korrekciók, ellenőrzés az olcsóbb magyarázatok — csinál az operátor küszöb sodródás, voltak az korrekciók kozmetikus, csinál az összeállított adathalmaz teljesen tartalmaznak azok, volt betanítás felépítve az szándékolt checkpoint. Egy hurok mely csendes kezdett az az alap modellt néz pontosan mint egy hurok mely sikertelen tanulja.
Nem-intervenció hordoz információt?▾
Alatt az Expert Intervention Learning, igen: szakaszok ahol az felügyelő nézte és nem cselekedni van olvasott mint gyenge bizonyítéka mely állapot és akció voltak elfogadható, formalizált mint egy megkötés az érték függvényre. A legtöbb gyakorlati csővezetékek, befogadva ez az egy, jelölés csak mit az emberi vezette.
Az egy egyetlen kar egy asztalon az választás vannak feladva: tartsd meg az kaput te, írj le mit nyit meg, és töltsd meg az erőfeszítés az adatok kezelés mögött helyett helyett az automatizálás a kapcsoló. Az platform oldal leírt az az DAgger hurok oldal, betanítás lehetőségek per politika család alatt betanítás és árazás. Az háttér, kezd az imitációs tanulás és imitációs tanulás az SO-100; számára első futás, futtat az te először politika az rövidebb út.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started