
Intervention rate – intervenčné rámce vydelené rámcami behu – je najlacnejší čestný signál pokroku, ktorý má ľudmi riadená slučka DAgger. Tento článok ho definuje tak, aby dvaja ľudia vypočítali rovnakú hodnotu, ukazuje, ako ju protokolovať, a prejde štyrmi spôsobmi, ako vás klame: zvyknutie operátora, posúvajúci sa pokus vyhodnocovania, tréning iba na korekcií a človek, ktorý v utorok koriguje inak ako v pondelok.
Kolo DAgger sa zdá produktívne, pokiaľ ste v ňom. Riadite politiku, preberáte kontrolu, keď zlyháva v zovretí, uložíte korrekcie, pretrénujete, a nasledujúci beh vyzerá – prisahali by ste – o niečo hladší. Dve kolá neskôr nemôžete povedať, či sa niečo zmenilo, pretože "o niečo hladší" nie je veličina.
Slučka potrebuje jedno číslo na kolo, a v ľudmi riadenej slučke je to takmer zadarmo: podiel behu, počas ktorého ste mali kontrolu namiesto politiky. Tento článok ho definuje tak, aby dve osoby vypočítali rovnakú hodnotu, zapisuje ho, číta výslednú krivku a pomenováva štyri spôsoby, ako vás klame, keď stojí sám. Pre teóriu, ktorú tento článok predpokladá, pozri explainer DAgger a variant riadený človekom; praktická obdobu je spustenie slučky DAgger na SO-100.
Krátka verzia
- •Intervention rate = intervenčné rámce / rámce behu. Rámce, nie epizódy, a menovateľ obsahuje rámce, ktoré ste strávili korigenziou.
- •Plochá krivka počas troch kôl znamená, že kolá neprinášajú nič – zmeňte zmes, checkpoint alebo úlohu namiesto zbierania štvrtého.
- •Padajúca intervention rate nie je stúpajúca success rate. Vaša hranica vstupu klesá nadol, keď rastie dôvera.
- •Bez mrazeného protokolu vyhodnocovania – rovnaké štartovné pozy, objekty, kamery, počet pokusov – meriate miestnosť.
- •Tréning iba na korekcií skresľuje rozdelenie stavov. Odpoveď IWR: kreslite intervenčné a nemaľované vzorky v rovnakej proporcii.
Prečo kolo potrebuje číslo vôbec
DAgger existuje kvôli problému s rozdelením, a problémy s rozdelením sú pre oko neviditeľné. Ross a Bagnell ukázali, že učenie napodobňovaním na pevnej sade demonštrácie vedie ku skloňovacím chybám a hranici ľútosti rastúcej kvadraticky v časovom horizonte: akonáhle sa človek učiaci dostane mimo stavov, ktoré demonštrátor navštívil, nič v dátach mu nepovie, ako sa vrátiť. DAgger to rieši iteráciou – spustite politiku, označte stavy, ktoré navštevuje, agregujte, pretrénujte – čo Ross, Gordon a Bagnell rámujú ako redukciu na učenie bez ľútosti online.
Tento rámec má dôsledok, ktorý ľudia preskakujú. Záruka sa týka postupnosti politík cez iterácie, nie žiadneho jednotlivého behu. Nepovie nič o tom, či vaše tretie kolo pomohlo. Jediný spôsob, ako vedieť, je merať každú iteráciu. Kelly a kolegovia predstavili HG-DAgger, pretože klasický DAgger pýta experta na označenia akcií, zatiaľ čo nováčik stále kontroluje, čo článok tvrdí, že môže znížiť bezpečnosť a u ľudských expertov pravdepodobne zhorší kvalitu označenia vnímaným oneskorením aktuátora. HG-DAgger sa tiež učí prah bezpečnosti pre metriku rizika založenú na neurčitosti modelu a hlási zlepšenú výkonnosť oproti DAgger a behavioral cloning na úlohe šoférovania. Nezverejňuje počty intervencií; tie vyrábate sami.
Definovanie sadzby tak, aby dvaja ľudia dostali rovnaké číslo
Definícia je jeden riadok: intervenčné rámce vydelené rámcami behu. Všetko zložité sa skrýva v tom, čo sa počíta ako rámec a čo sa počíta ako beh.
Rámce, nie epizódy
Počítanie epizód s aspoň jednou intervenciou je zbytočné: desať epizód s jedným jemným potlačením a desať, v ktorých ste riadili osemdesiat percent, obe dávajú "10/10". Počet rámcov ich oddeľuje, a to je podrobnosť, ktorú záznam už má – v formáte LeRobot dataset je každý časový krok riadok, takže intervenčný príznak je jeden stĺpec boolean vedľa stavu a akcie. Tu sa zapisuje na rámec v okamihu, keď sa začína preberanie kontroly, a vyprázdňuje sa, keď sa kontrola vracia.
Menovateľ obsahuje korrekcie
Dve voliteľnosti menovateľa sú obhajiteľné – celkové rámce behu, alebo rámce, ktoré politika riadila autonómne – a výrazne sa rozchádzajú pri vysokých úrovniach intervencií. Prevezmite kontrolu na 400 z 1000 rámcov a prvý dáva 40 percent, druhý 67 percent. Porovnanie jedného kola meraného prvým spôsobom s nasledujúcim meraným druhým spôsobom je to, ako skutočné zlepšenie zmizne. Vezmite celkové rámce a nikdy znova nerevidujte voľbu v sérii.
Rozhodnite sa raz, čo sa stane s rámcami prevodu
Vždy je tu šev. Keď sa kontrola prenáša, niektoré rámce patria obom stranám: ruka sa drží, vodca sa zarovnáva, záznam je zamrazený. V tomto potrubí zostávajú rámce prevodu v raw toku a nikdy nevstúpia do kurátorskej epizódy – sú ani správanie politiky ani korekcia, ktorá by bola stojatá na tréningu. Počítajte šev rovnako každý beh: pri 30 Hz šesť preberaní s dvojsekundovým švom každý je 360 rámcov, dosť na presun percentuálneho bodu.
Rámce alebo epizódy; celý beh alebo iba autonómny; rámce prevodu v alebo von. Ktorúkoľvek z troch zmien ticho medzi kolami robí krivku bezvýznamnou. Napíšte všetky tri.
Protokolovanie, aby číslo prežilo reláciu
Metrika v stavovom paneli bežiaceho procesu je odčítanie: zmizne pri reštarte a nemôže byť vynesená. Jeden len pripevňovací riadok na beh pokrýva celú sériu – vrátane ktorého checkpoint ste riadili, pretože sa to mení každé kolo a zmiešanie ich zneplatňuje, čo nasleduje.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Dve polia niesou váhu. train_mix je to, čo ste nakŕmili ďalšiu tréningovú úlohu; bez toho sa nič nedá pripísať. eval_protocol pomenúva fixný test, ktorý ste spustili neskôr, a je pole, ktoré sa najčastejšie nechá prázdne. V cockpite ay-robots stav prevzatia kontroly hlási počet intervenčných rámcov pre bežnú reláciu, takže protokolovanie je skôr prepis ako inštrumentácia; dokumentácia dataset sa týka toho, kde pristanú stĺpce na rámec.

Čítanie krivky: tri kolá, jeden verdikt
Tri kolá sú minimum na čítanie, pretože dva body sú vždy čiara. Nasledujúca tabuľka je šablóna účetnictva s zástupnými číslami, nie merania z akéhokoľvek behu. Hľadáte monotónny pokles spárovaný zvýšením úspechu na fixnom teste.
| Kolo | Checkpoint riadený | Rámce | Intervenčné rámce | Sadzba | Úspechy (z 20) |
|---|---|---|---|---|---|
| 0 (základný stav) | základná politika | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | z miešanky kola 0 | 5 610 | 980 | 17,5 % | 10 |
| 2 | z miešanky kola 1 | 5 412 | 611 | 11,3 % | 11 |
| 3 | z miešanky kola 2 | 5 380 | 598 | 11,1 % | 12 |
Kolá jeden a dva robia prácu. Tretie kolo nie: 11,3 oproti 11,1 percent je v rámci kolísania behu na fyzickej ruke, a štvrté kolo rovnakých korekcií trávi odpoledne na nič. Plochý segment hovorí zmeniť niečo štrukturálne.
- Zostávajúce zlyhania nie sú opraviteľné teleoperáciou – objekt mimo dosahu, geometria chytača, kĺb na svojej hranici. Žiadne korrekčné údaje neopravujú kinematickú stenu.
- Korrekcie sú príliš málo oproti základnému datasetu, aby posunuli gradient, a nič ich nevažuje.
- Korrekcie si odporujú, takže politika priemeňuje dve stratégie a pristane medzi nimi.
- Zlyhanie je upstream: kamera sa pohla, osvetlenie sa zmenilo, pohľad zápästia už nie je zhodný s tréningom.
- Úloha je na stropu tejto triedy politík na tomto hardvéri, a ďalším krokom sú viac základných údajov.
Posledné dva nie sú zlyhania slučky. V Sirius-Fleet je klesajúca potreba človeka navrhnutým výsledkom: keď sa autonómia robota zlepšuje, jej prediktory anomálií prispôsobujú svoje kritériá predikcie, čo vedie k menej žiadostiam o ľudskú intervenciu a postupne znižuje ľudskú záťaž v čase. Tam sa kritérium prispôsobuje zámerne. V manuálnej slučke sa vaše prispôsobuje tiež, ticho – takže sadzba, ktorá sa zrovnáva, pretože úloha je na jej strope, vyzerá presne ako jedna, ktorá sa zrovnáva, pretože operátor prestane všímať. Čo je ďalší problém.
Pasca 1: padajúca sadzba nie je stúpajúca success rate
Intervention rate meria presne jednu vec: koľko z behu ste sa rozhodli vlastniť. To rozhodnutie je vaše, prijaté v reálnom čase, a pohybuje sa. V kole nula preberáte kontrolu pri prvom zlom uhle prístupu; do kola tri ste pozorovali, ako sa politika zotavuje z tucta z nich, a necháte ju skúsiť. Vaša hranica sa posunula; politika sa možno nie. Sadzba klesá v každom prípade.
Ľudská dôvera je aspoň modelovaná veličina v literatúre skôr ako predpokladaná konštanta. Sirius preváži tréningovacie vzorky aproximovanou ľudskou dôverou a optimalizuje politiku s váženým behavioral cloning, pričom hlási 8 percentný nárast v simulácii a 27 percent na skutočnom hardvéri oproti stavu umenia v policy success rate, s dvojnásobnou rýchlosťou konvergencie. To považuje dôveru za váhu na dátach. Nekorekčuje hranicu vo vašej hlave medzi kolom nula a kolom tri.
Nemôžete odstrániť drift, takže spárujte sadzbu s niečím, čo vaša hranica nemôže dotknúť: fixnú sadu pokusov, v ktorých nikdy neintervenujete, zhodnotenú podľa kritéria napísaného pred kolom. Sadzba, ktorá klesá, zatiaľ čo spárovaná success rate stojí, je podpisom zvyknutia – stojí za chytenie, pretože zvnútra slučky to vyzerá ako pokrok.
| Intervention rate | Success rate na fixnom protokole | Najpravdepodobnejšie čítanie |
|---|---|---|
| klesá | rastie | Kolo fungovalo. Pokračujte. |
| klesá | plochá | Vaša hranica sa posunula, alebo korrekcie odstránili úsilie bez odstránenia zlyhaní. |
| klesá | klesá | Korrekcie zhoršujú politiku. Skontrolujte zmes a ich vnútornú konzistenciu. |
| plochá | plochá | Kolo neprinieslo nič. Zmeňte zmes, checkpoint alebo úlohu pred zbieraním viac. |
| rastie | klesá | Regresia. Podozrievajte tréningovú zmes, zmenenú kameru alebo mix checkpoint pred podozrievaním metódy. |
Pasca 2: bez pevného protokolu meriate miestnosť
Vyhodnotenie na skutočnom robote je drahé a ťažko sa opakuje. Autori SIMPLER motivujú simulované vyhodnotenie pozorovaním, že vyhodnotenie takýchto politík v reálnom svete nie je škálovateľné a čelí problémom s reprodukovateľnosťou, ktoré sa pravdepodobne zhoršia, keď sa politiky zošíria na spektrum úloh. RoboArena to útočí z druhej strany, s viac ako 600 párovými epizódami vyhodnocovania reálnych robotov v siedmych generalistických politikách, spustené hodnotiteľmi v siedmych akademických inštitúciách na platforme DROID. Jej hodnotitelia si vyberajú svoje vlastné úlohy a prostredia, ale musia posúdiť dvojito slepé páry politík; článok hlási, že túto davom zdroj usporiadané ranking sleduje výkonnosť generalistickej politiky presnejšie ako konvenčné, centralizované vyhodnotenie.
Nebudete spúšťať 600 párovaných epizód na jednom SO-100 v dielni. To, čo môžete urobiť, je odstrániť rozptyl, ktorý kontrolujete – zoznam dosť nudný, že sa zvyčajne preskakuje.
| Rozmer | Zamrazte to | Čo sa posúva, ak to neurobíte |
|---|---|---|
| Štartovná póza | Napísaná domovská pozícia, riadená pred každou skúškou | Trajektória začína mimo distribúcie |
| Objekty | Páskované značky a rovnaké fyzické objekty vyhradené na vyhodnotenie | Lepšia politika je skutočne bližší objekt |
| Kamery a svetlo | Rovnaké príslušenstvo, indexy, expozícia; žalúzie zatvorené; fotografovať nastavenie | Samotná výmena indexov kamery môže dominovať výsledkom |
| Pokusy a pravidlo zastavenia | Fixné n, fixný časový limit, kritérium napísané pred kolom | Post-hoc kritériá menia blízke pokusy na čokoľvek, čo potrebujete |
| Správanie operátora | Bez intervencií počas pokusov vyhodnocovania | Vyhodnotenie sa stáva ďalšou reláciou korrekcie |
Potom aritmetika, neľútosvá na počte pokusov, ktoré si dielňa môže dovoliť. Podľa normálnej aproximácie nestojí 60 percent úspechu v 20 pokusoch so štandardnou chybou blízkou 11 percentným bodom – odmocnina 0,6 krát 0,4 nad 20 – a rozdiel medzi dvoma takými kolami niesli približne 15. Skok zo 60 na 70 percent je preto v súlade s tým, že sa nič nestalo. Päťdesiat pokusov prináša číslo na kolo približne na 7 bodov a stojí odpoledne.
Táto asymetria je argument pre intervention rate: počítané na tisícoch rámcov namiesto dvadsiatich binárnych výsledkov, pohybuje sa skôr a hladšie. Vyhradzovanie je to, že rámce v rámci epizódy sú ťažko korelované – jeden zlý stisk dáva sto po sebe idúcich intervenčných rámcov – takže efektívna veľkosť vzorky je bližšie k počtu prevzatí. Zaobchádza sa so sadzbou ako s ranným indikátorom a success rate ako s pomalou základnou pravdou.
Epizódy vyhodnocovania nikdy nesmú vstúpiť do zloženého tréningovej dataset – inak je kolo n+1 zhodnotené na údajoch, na ktorých sa trénoval, a krivka meria memoráciu.
Pasca 3: tréning iba na korekcií bez ohľadu na politiku
Korrekcie sú zaujímavé údaje, takže inštinkt je trénovať na nich. Neurobte. Prichádzajú konštrukciou z úzkeho seku stavového priestoru, kde politika už zlyhávala, a hovoria takmer nič o väčšine behu, ktorý fungoval. Trénovanie na tomto seku sám a dostanete politiku dobrú v zotavovaní sa z pochrútaného prístupu, ktorá zabudla, ako urobiť čistý.
Mandlekar a kolegovia postavili svoj systém diaľkovej intervencie okolo toho. Ich rámec: manipulácie úlohy obsahujú kritické body vyžadujúce postupnosť presných akcií – vloženie podu do kávovaru je ich príklad – kde malé odchýlky vedú do stavov, ktoré demonštrácie nikdy nepokryli. Ich algoritmus trénuje iteratívne na nových dátach, takže sa politika učí prechádzať cez tie kritické body, a hlasia, že agenti trénovaní na dátach intervencie Beat agentov trénovaných na ekvivalentnom počte vzoriek od neinvenčných demonštrátorov.
- Rýchle: krátky beh cez niekoľko desiatok epizód je dosť lacný na opakovanie
- Zacielené: gradient je dominovaný stavmi, na ktorých vám záleží
- Lacné na testovanie, či je stil korrekcie vôbec naučiteľný
- Distribúcia jemného ladenia už nepripomína distribúciu úloh
- Nominálne správanie sa može viditeľne zhoršiť v rámci jedného kola
- Sadzba môže klesať, zatiaľ čo úspech klesá spolu s ním – čisté segmenty vymenené za zotavenia
Pomer miešania je hyperparamater a zaslúži si byť zapísaný. Skladanie ďalšieho dataset je to, kde sa rozhoduje: pôvodné demonštrácie plus sada korekcií, výber epizód na zdroj skôr než pravidlo, ktoré ticho vťahuje sa, čo je dostupné. Tam to je jeden krok zloženia v cockpite, a výsledkom je obyčajný dataset – viď dokumentácia trénovania. Čo žiadny nástroj neurobí pre vás je záznam, ktorý pomer vyprodukoval ktorú krivku.
Pasca 4: človek nie je konzistentný expert
Teória DAgger predpokladá experta. V technickom zmysle nie ste: vaše korrekcie nie sú vzorkami z pevného podmieňovaného rozdelenia cez akcie. Autori ACT menujú toto, keď uvádzajú prekážky pre jemnú manipuláciu – chyby sa hromadia v čase a ľudské demonštrácie môžu byť nestacionárne. Ich systém stále dosahuje 80 až 90 percent úspešnosti na šiestich skutočných úlohách z desiatich minút demonštrácií, takže problém je riešiteľný, nie neprítomný.
Štúdia robomimic robí bod z dátovej strany. Cez šesť offline algoritmov na piatich simulovaných a troch skutočných viacstupňových úlohách, jej lekcie zahŕňajú citlivosť na voľby dizajnu, závislosť od kvality demonštrácie, a – ten, ktorý tu bolí najviac – variabilitu vyplývajúcu z kritérií zastavenia, pretože ciele trénovania a vyhodnocovania sa líšia. Checkpoint s najmenšou stratou nie je spoľahlivo ten s najväčšou success rate.
Existuje hardvérová verzia toho: vstupný režim formuje korekciu. Nastavenie vodca-nasledovník produkuje nepretržité, človekom tempované trajektórie. Kľúčové nudzenie sú tvrdé zatiahnuté serverom – dva stupne za výzvu na kĺboch ramena, štyri na chytači – takže rovnaký zámer príde ako schody malých krokov. Posúvače posielajú absolútne ciele a server sa posúva nanajvýš šesť stupňov k nim za hovor. Tri režimy, tri akčné distribúcie; zmiešavanie všetkých troch do jednej sady korekcií a potom sa čudesť, prečo prístup otočil nervózne je samoindukovaný. dokumentácia teleoperácie sa týka toho, čo každý režim posiela.
Váženie intervencií: IWR a čo prišlo potom
Ak sú korrekcie cenná menšina, principiálny fix je váha skôr ako výhradnosť. Intervention Weighted Regression je referenčná implementácia: dáta sú rozdelené do intervenčných a neinvenčných vzoriek, a obe partície sú vzorkované v rovnakej proporcii počas trénovania. Sada korekcií, ktorá je päť percent rámcov, potom prispieva polovica gradientu bez nominálneho správania zmizni z distribúcie.
Rovnaký podiel je štartovný bod, nie zákon. Sirius zovšeobecňuje jej nahradením binárnej partície kontinuálnou váhou z približovanej ľudskej dôvery; Sirius-Fleet presúva rozhodnutie upstream, pomocou modelu vizuálneho sveta a prediktora anomálií rozhoduje, keď sa človek vôbec pýta. Spoločný prieťah: flag intervencie je tréningovým signálom, nie iba stĺpcom účetnictva.
| Metóda | Kto rozhoduje, keď človek konajúce | Ako sa používajú údaje o intervencií | Hlásený výsledok |
|---|---|---|---|
| DAgger (2011) | Pevný rozvrh; expert označí navštívené stavy | Jeden rastúci dataset, nevážený | Rámovaný ako redukcia na učenie bez ľútosti online |
| HG-DAgger (2019) | Človek, riadiaci kontrolu na skutočnom systéme | Agregované; plus naučený prah bezpečnosti na neurčitosti modelu | Lepší ako DAgger a BC na šoférovaní; bez počtov intervencií |
| IWR (2020) | Človek, cez diaľkovú teleoperáciu | Vzorky intervencie a neinvencie čerpané v rovnakej proporcii | Bieds neinvenčné demo pri rovnakom počte vzoriek |
| Sirius (2022) | Človek, počas nasadenia | Vážené BC, váhy z aproximovanej ľudskej dôvery | Nárast o 8 % v simulácii, 27 % na skutočnom hardvéri; 2x rýchlejšia konvergencia |
| ThriftyDAgger (2021) | Systém, riadiaci na novosť a riziko | Interaktívny zber pod rozpočtom dohľadu | Štúdia používateľa (N=10): 58 % vyššia ľudská a 80 % vyššia výkonnosť robota ako ďalšia najlepšia metóda |
| Fleet-DAgger (2022) | Systém, prideľujúce pozornosť cez flotu | Fleet učenie skórované návratom z ľudského úsilia | Až 8,8x vyšší ROHE ako východiská |
| Sirius-Fleet (2024) | Prediktory anomálií so samočinne prispôsobujúcimi kritériami | Viacúlohové učenie s modelom vizuálneho sveta | Menej žiadostí o intervenciu, keď sa autonómia zlepšuje |

Štyri metriky stojí za protokolovanie vedľa sadzby
- Prevzatia na beh. Dvadsať krátkych korekcií a jeden dlhý dávajú podobné sadzby a opisujú rôzne politiky – jeden nervózny, jeden s jedinou slepou pou.
- Priemer intervenčnej dĺžky. Stúpajúca dĺžka s klesajúcim počtom znamená, že zostávajúce zlyhania sú ťažké, čo je to, ako vyzerá neskorý pokrok.
- Čas na prvú intervenciu. Politika, ktorá ide ďalej pred potrebou pomoci, sa zlepšuje aj keď je celková sadzba plochá.
- Kde sa korrekcie skupinujú. Priehrada vlajkou normalizovanému pokroku epizódy; stabilný vrchol cez kolá poukazuje na jeden úzky bod.
Protokol kola, ktorý môžete skutočne spustiť
Merané kolo má šesť krokov a produkuje jeden riadok v denníku. Prvé štyri sú slučka; posledné dva ho robia meraním.
- 1Zamrazte protokol vyhodnocovania pred kolom nula
Zapíšte si štartovnú pózu, umiestnenie objektu, kamery, počet pokusov, časový limit a kritérium úspechu. Fotografovať tabuľka. Ak sa dokument musí zmeniť, séria sa reštartuje.
- 2Merajte základný stav
Spustite protokol bez intervencií a zaznamenenajte úspechy; potom spustite jednu inštruovanú reláciu s povoleným prevzatím a zaznamenenajte sadzbu. Tieto dve čísla sú kolo nula.
- 3Zbierajte korrekcie v jednom konzistentnom štýle
Jeden vstupný režim na kolo, jeden operátor, ak to môžete zvládnuť. Prevezmite kontrolu na kritérium, ktoré viete vyslofzť nahlas – "chytač viac ako dva centimetre preč na prístupe" – a držte to na kolo.
- 4Triáž každú epizódu ten istý deň
Korekcia, evaluácia alebo zahodenie. Nezvučné epizódy sa zahodili, nie uložené na teórii, že viac údajov pomáha – korekcia, v ktorej ste sami fumbled je horšia ako žiadna epizóda.
- 5Zložte zmes explicitne
Pôvodné demonštrácie plus korrekcie, výber epizód na zdroj. Zaznamenajte počet základ, počet korekcií a akékoľvek váženie – toto je pole, ktoré budete chcieť za tri týždne.
- 6Pokračujte z checkpointu, potom znova zmerajte
Trénujte zložený dataset z predchádzajúceho checkpointu namiesto základného modelu, spustite mrazený protokol plus jednu inštruovanú reláciu, pripojte riadok a porovnajte s predchádzajúcimi dvoma kolami.
Dve limity zmenia, ako čítate slabé kolo. Pokračovanie z checkpointu inicializuje váhy z neho – nie obnovenie optimalizátu, takže rozvrh sa spustí od nova a krátky beh z konvergovaného checkpointu sa môže veľmi málo posunúť. A pohyb zarovnania vedúceho na začiatku prevzatia má najmenší beží na skutočnom hardvéri všetkého v reťazi; ak korrekcie všetky začínajú s podivným přechodom, pozrite tam pred obvinením zmesi.
Merané slučka, už zapojené
ay-robots implementuje týchto šesť krokov ako prvky produktu: prevezmite kontrolu stred-behu od vedúceho ramena, klávesnice alebo posúvače, s intervenčnými rámcami automaticky označené; triáž každú epizódu ako korekciu, evaluáciu alebo zahodenie; zložiť ďalší dataset z pôvodných demonštrácií plus korekcií, výber epizód na zdroj; a spustite nasledujúci beh trénovania z predchádzajúceho checkpointu namiesto základného modelu.
Pozri, ako slučka DAgger fungujeČo čísla nemôžu povedať
Nič z toho nie je vyriešené, a úhľadná krivka vás nemala by presviedchať inak. Intervention rate meria spoločný systém – politika, hardvér, operátor, miestnosť – a nič na vlastnosti nepripisuje. Nemôže povedať, či boli korrekcie dobré, a šťastne padne na úlohu, ktorá sa stala ľahšou, pretože objekt sa posunul o dva centimetre bližšie počas troch týždňov.
To, čo to robí je premeniť vágnu dojem do stĺpca, s ktorým sa môžete hádať. Alternatíva nie je lepšia metrika; je to tri týždne zbierania korekcií krivka by vám povedala, po kole tri, zastaviť zbieranie. Literatúra prieskum definuje interaktívne učenie napodobňovaním ako spätnej väzby od človeka daná prerušovane počas vykonávania robota, umožňujúce online zlepšenie správania; rodina je široká, a žiadne usporiadanie to funguje bez čísla na kolo. Viď tiež sprievodcu učením napodobňovaním SO-100 pre základný dataset, ktorý miešate oproti, spustenie politiky pre inference stranu, a stránka slučky DAgger pre implementované potrubí.
Je intervention rate iba jeden mínus success rate?▾
Nie. Sadzba meria koľko z behu ste prevzali; success rate meria, či sa úloha skončila bez vás. Beh môže uspieť s intervention rate 30 percent, a beh bez intervencií môže úplne zlyhať. Tiež sa líšia v šume: sadzba sa pohybuje hladko cez tisíc korelov rámcov, success rate skáče medzi hŕstkou binárnych výsledkov. Protokolovať oboje.
Koľko pokusov vyhodnocovania potrebujem, aby success rate znamenal čokoľvek?▾
Viac ako sa zdá rozumné. Podľa normálnej aproximácie, 20 pokusov pri skutočnej 60 percentnej success rate niesli štandardnú chybu blízku 11 percentným bodom, takže 10-bodový pohyb medzi kolami je nerozoznateľný od šumu; 50 pokusov prinášajú tú číslu približne 7. Ak si nemôžete dovoliť 50, udržiavajte počet pokusov rovnakých cez kolá a posudzujte malé pohyby ako nepresnivé.
Ako by som mal začať s pomerom demonštrácií ku korrekciám?▾
Zdokumentovaný štartovný bod je IWR: rozdeľte dáta na intervenčné a neinvenčné vzorky a kreslite ich v rovnakej proporcii, takže korrekcie prispieva polovice gradientu bez ohľadu na to, aká malá frakcia rámcov sú. Ak vaše nastavenie nemôže váhové vzorkovanie, aproximácia jej prostredníctvom počtov epizód pri zložení dataset a záznam pomerom. Tréning iba na korekcií je možnosť na vylúčenie.
Moja intervention rate sa po kole zvýšila. Je kolo zbytočné?▾
Nie nevyhnutne, ale skontrolujte nudné vysvetlenia najskôr: pokiaľ checkpoint, ktorý ste riadili, zodpovedal ten, ktorý ste trénovalo, zmenila sa kamera index alebo montáž, umiestnenie objektu sa posunulo, bol štýl korekcie konzistentný. Ak sú všetci štyri čistí a spárovaný success rate tiež padol, podozrievajte zmes – príliš málo základných demonštrácií oproti korrekciám, alebo korrekcie, ktoré si odporujú. Skutočná regresia patrí do denníka, nie do bin.
Môžem preskočiť mrazený protokol vyhodnocovania a iba sledovať intervention rate?▾
Iba ak prijmete, že nemôžete povedať zlepšenie z zvyknutia. Sadzba závisí od vašej vlastnej hranice v reálnom čase na vstup, a tá hranica klesá, ako sa zoznamujete s zvykami politiky. Mrazený protokol je časť merania vaša hranica nemôže dosiahnuť – páskované značky, napísaná domovská pozícia, fixný počet pokusov, kritérium rozhodol pred kolom. Musí zostať nezmenená cez sériu.
Zapamätajte si denník v úložisku, nie v notebooku: kolá sú dni od seba, hardvér sa prestaví, a osoba čítajúca krivku v októbri ste vy bez pamäti na august. dokumentácia FAQ sa týka operačných detailov vynechaných tu.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started