
Intervention rate - intervenční snímky dělené snímky běhu - je nejlevnější upřímný signál pokroku, který má lidmi řízená DAgger smyčka. Tento článek jej definuje tak, aby jej dvě osoby vypočítaly stejně, ukazuje, jak jej zaznamenávat, a prochází čtyřmi způsoby, kterými vás svádí: zvyk operátora, drifující nastavení vyhodnocení, trénování pouze na korekcích a člověk, který v úterý opravuje jinak než v pondělí.
DAgger kolo se cítí produktivně, dokud v něm jste. Řídíte zásadu, převezmete si ji, když zpacká uchopení, uložíte opravy, přetrénujete a příští spuštění vypadá - přísahali byste - trochu plynuleji. Dvě kola později nemůžete říci, zda se něco změnilo, protože "trochu plynuleji" není veličina.
Smyčka potřebuje jedno číslo na kolo, a v lidmi řízené smyčce je to téměř zdarma: podíl běhu, během kterého jste měli kontrolu místo zásady. Tento článek jej definuje tak, aby jej dvě osoby vypočítaly stejně, zaznamenává jej, čte výslednou křivku a pojmenuje čtyři způsoby, kterými vás svádí, když stojí samo. Teorii, kterou tento kus předpokládá, viz vysvětlení DAgger a varianta řízená člověkem; praktický protějšek je spuštění DAgger smyčky na SO-100.
Krátká verze
- •Intervention rate = intervenční snímky / snímky běhu. Snímky, ne epizody, a jmenovatel zahrnuje snímky, které jste strávili opravou.
- •Plochá křivka během tří kol znamená, že kola nic nekupují - změňte směs, checkpoint nebo úkol místo shromažďování čtvrtého.
- •Klesající intervention rate není rostoucí úspěšnost. Váš práh pro zasáhnutí se s rostoucí důvěrou snižuje.
- •Bez zmrazeného evaluačního protokolu - stejné počáteční pozice, předměty, kamery, počet pokusů - měříte místnost.
- •Trénování pouze na korekcích zkrzí distribuci stavu. Odpověď IWR: čerpat intervenční a neintervenční vzorky v rovném poměru.
Proč kolo potřebuje vůbec nějaké číslo
DAgger existuje kvůli distribuičnímu problému, a distribuční problémy jsou pro oko neviditelné. Ross a Bagnell ukázali, že učení napodobením na pevné sadě demonstrací vede ke skládajícím se chybám a k hranici zájmu rostoucí kvadraticky v čase horizondu: jakmile se student vzdálí od stavů, které demonstrátor navštívil, nic v datech mu neřekne, jak se vrátit. DAgger to opravuje iterací - spusťte zásadu, označte stavy, které navštíví, agregujte, přetrénujte - což Ross, Gordon a Bagnell rámují jako redukci na online learning bez zájmu.
Tento rámec má důsledek, který lidé přeskakují. Záruka se týká posloupnosti zásad v rámci iterací, nikoli jednotlivého běhu. Neříká nic o tom, zda váš třetí kol pomohlo. Jediný způsob, jak to vědět, je měřit každou iteraci. Kelly a kolegové zavedli HG-DAgger, protože klasický DAgger žádá experta o označení akcí, zatímco nováček stále ovládá, což článek tvrdí, že může snížit bezpečnost a u lidských odborníků je pravděpodobné, že snížit kvalitu štítku vnímáním zpoždění actuátoru. HG-DAgger také učí bezpečnostní práh pro metriku rizika založenou na nejistotě modelu a hlásí zlepšenou výkonnost oproti DAgger i behavioral cloning na řídící úloze. Nezveřejňuje počty intervencí; ty vyrábíte sami.
Definování sazby tak, aby dva lidé dostali stejné číslo
Definice je jeden řádek: intervenční snímky dělené snímky běhu. Všechno obtížné se skrývá v tom, co se počítá jako snímek a co se počítá jako běh.
Snímky, ne epizody
Počítání epizod s alespoň jednou intervencí je zbytečné: deset epizod s jedním lehkým potlačením a deset, ve kterých jste řídili osmdesát procent, obě dávají "10/10". Počet snímků je odděluje, a je to granularita, kterou záznam již má - v formátu LeRobot datovém souboru každý časový krok je řádkem, takže příznak intervence je jeden sloupec boolean vedle stavu a akce. Zde je zapsáno na snímek v okamžiku, kdy se přebírá, a vymazáno, když se kontrola vrátí.
Jmenovatel zahrnuje opravy
Dva jmenovatelé jsou obhajitelné - celkové snímky běhu nebo snímky, které zásada řídila autonomně - a velmi se liší na vysokých úrovních intervence. Převezměte si 400 z 1000 snímků a první dává 40 procent, druhý 67 procent. Porovnání jednoho kola měřeného prvním způsobem proti příštímu měřenému druhým způsobem je, jak skutečné zlepšení zmizí. Vezměte si celkové snímky a nikdy si neprohlédněte volbu v seriálu.
Rozhodněte se jednou, co se stane s handover snímky
Vždy je tam šev. Když se ovládání přesouvá, některé snímky patří oběma stranám: rameno je drženo, vůdce se zarovnává, záznam je zmrazen. V tomto pipeline zůstávají handover snímky v surového toku a nikdy nevstupují do kurátor epizoda - jsou to chování politiky ani oprava, kterou by stálo za to trénovat. Počítejte šev stejným způsobem každé kolo: při 30 Hz, šest přebírání s dvousecundovým švem každý je 360 snímků, dost na přesunutí procentuálního bodu.
Snímky nebo epizody; celkový běh nebo pouze autonomní; handover snímky dovnitř nebo ven. Některý ze tří změněných tichých mezi koly činí křivku bezvýznamnou. Zapište všechny tři.
Zaznamenávání tak, aby číslo přežilo sezónu
Metrika v stavovém panelu běžícího procesu je čtení: po restartování zmizí a nelze ji vykreslit. Jeden řádek pouze připojovací za běh pokrývá celou řadu - včetně kterého checkpoint jste řídili, protože se to mění každé kolo a jejich smíchání znehodnocuje to, co následuje.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Dvě pole nýsou váhu. train_mix je to, co jste krmili příští prácí trénování; bez toho nic nelze přičíst. eval_protocol pojmenuje pevný test, který jste později spustili, a je pole, které se nejčastěji opomíjí. V ay-robots cockpitu hlásí stav převzetí počet intervenčních snímků pro běžící relaci, takže záznam je spíše přepis než instrumentace; dokumentace datovému souboru pokrývá, kam přistávají sloupce pro každý snímek.

Čtení křivky: tři kola, jeden verdikt
Tři kola je minimum pro čtení, protože dva body jsou vždy čára. Tabulka níže je šablona účetnictví s čísly zástupných symbolů, nikoli měření z žádného běhu. Hledáte monotónní pokles sladěný zvýšením úspěchu na pevném testu.
| Kolo | Checkpoint řídil | Snímky | Intervenční snímky | Sazba | Úspěchy (z 20) |
|---|---|---|---|---|---|
| 0 (baseline) | základní politika | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | ze soupravy kola 0 | 5 610 | 980 | 17,5 % | 10 |
| 2 | ze soupravy kola 1 | 5 412 | 611 | 11,3 % | 11 |
| 3 | ze soupravy kola 2 | 5 380 | 598 | 11,1 % | 12 |
Kola jeden a dva dělají práci. Třetí kolo ne: 11,3 proti 11,1 procent je v rámci varianty běhu-k-běhu čehokoliv měřeného na fyzickém rameni, a čtvrté kolo stejných oprav tráví odpoledne za nic. Plochý segment říká změnit něco strukturálního.
- Zbývající selhání nejsou opravitelná teleopearací - objekt mimo dosah, geometrie gripper, kloub v jeho limitu. Žádné opravné údaje nezapadají do kinematické zdi.
- Opravy jsou příliš málo proti základnímu datovému souboru, aby posunuly gradient, a nic je neváží.
- Opravy se navzájem odporují, takže zásada průměry dvě strategie a přistane mezi nimi.
- Selhání je proti proudu: kamera se přesunula, osvětlení se změnilo, zápěstí se již neshoduje s tréninkem.
- Úkol je na stropu této třídy politiky na tomto hardwaru, a dalším krokem je více základních dat.
Poslední dva nejsou selhání smyčky. V Sirius-Fleet klesající potřeba člověka je navržený výsledek: jak se robotická autonomie zlepšuje, její anomální prediktory přizpůsobují svá kritéria předpovědi, což vede k menšímu počtu žádostí o lidskou intervenci a postupnému snižování lidské zátěže v čase. Tam se kritérium přizpůsobuje účelu. V manuální smyčce vaše se také přizpůsobuje, tiše - takže sazba, která se zploští, protože úkol je v jeho stropu, vypadá přesně jako ten, který se zploští, protože operátor přestal všímat si. Což je příští problém.
Léčka 1: klesající sazba není rostoucí úspěšnost
Intervention rate měří přesně jednu věc: kolik běhu jste se rozhodli vlastnit. Toto rozhodnutí je vaše, činěné v reálném čase, a pohybuje se. V kole nula převezmete si při prvním špatném úhlu přístupu; v kole tři jste viděli, jak se zásada zotavuje z tuctu z nich a necháte ji zkusit. Váš práh se posunul; politika se nemusela. Sazba padá tak či onak.
Lidská důvěra je alespoň modelovaná veličina v literatuře místo předpokládané konstanty. Sirius znovu váží vzorky trénování s aproximovanou lidskou důvěrou a optimalizuje politiku pomocí váženého behavioral cloning, hlášením 8 procent nárůstu v simulaci a 27 procent na skutečném hardwaru nad state-of-the-art v úspěšnosti politiky, dvakrát rychleji konvergence. To považuje důvěru za váhu na datech. Nekoriguje práh ve vaší hlavě mezi kolem nula a kolem tři.
Nemůžete odstranit drift, takže spárujte sazbu s něčím, co váš práh nemůže dotknout: pevný soubor pokusů, ve kterých vůbec nezasahujete, bodovaný podle kritéria zapsaného před kolem. Sazba, která padá, zatímco spárovaná úspěšnost zůstává, je podpisem zvyku - za to stojí chytit, protože z uvnitř smyčky se cítí jako pokrok.
| Intervention rate | Úspěšnost na pevném protokolu | Nejpravděpodobněji čtení |
|---|---|---|
| padá | stoupá | Kolo fungovalo. Pokračovat. |
| padá | plochý | Váš práh se posunul, nebo opravy odstranily úsilí bez odstranění selhání. |
| padá | padá | Opravy degradují politiku. Zkontrolujte míchání a jejich vnitřní konzistenci. |
| plochý | plochý | Kolo nekupovalo nic. Změňte mix, checkpoint nebo úkol před shromažďováním více. |
| stoupá | padá | Regrese. Podezírejte mix trénování, změněnou kameru nebo mix checkpoint před podezřením metody. |
Léčka 2: bez pevného protokolu měříte místnost
Vyhodnocení skutečného robota je drahé a těžko opakovatelné. Autoři SIMPLER motivují simulované vyhodnocení pozorováním, že vyhodnocení takových zásad v reálném světě není škálovatelné a čelí problémům reprodukovatelnosti, které se pravděpodobně zhorší, jak se spektrum úkolů zásad rozšiřuje. RoboArena ji útočí z druhé strany, s více než 600 párovými epizodami reálného robota vyhodnocení v celých sedmi generalistických zásadách, spuštěných vyhodnocovatelů na sedmi akademických institucích na DROID platformě. Její vyhodnocovatelé si vybírají své vlastní úkoly a prostředí, ale musí dvojitě-slepě posoudit páry zásad; příspěvek hlásí, že toto crowdsourced pořadí sleduje výkonnost generalistické politiky přesněji než konvenční, centralizované vyhodnocení.
Na jedné SO-100 v dílně nebudete spouštět 600 párových epizod. Co můžete udělat, je odstranit rozptyl, který kontrolujete - seznam nudný dost na to, aby se obvykle přeskočil.
| Dimenze | Zmrazte to | Co se posouvá, pokud se to neudělá |
|---|---|---|
| Počáteční poloha | Písemná domovská pozice, řízená před každým pokusem | Trajektorie začíná mimo distribuci |
| Objekty | Lepené značky a stejné fyzické objekty vyhrazené pro vyhodnocení | "Lepší" politika je opravdu bližší předmět |
| Kamery a světlo | Stejné připojení, indexy, expozice; slepá okna zavřená; fotografovat nastavení | Zaměněné indexy kamer se samy o sobě mohou dominovat výsledku |
| Zkoušky a pravidlo zastavení | Pevné n, pevný timeout, kritérium zapsané před kolem | Post-hoc kritéria promění těsné chyby v cokoliv, co potřebujete |
| Chování operátora | Bez intervencí během evaluačních pokusů | Vyhodnocení se stane další relací opravy |
Pak aritmetika, neúprosná počtu pokusů, které dílna může dovolit. Pod normální aproximací, 60 procent úspěchu přes 20 pokusů nese standardní chybu blízko 11 procent bodů - druhá odmocnina 0,6 krát 0,4 přes 20 - a rozdíl mezi dvěma takovými koly nese asi 15. Skok z 60 na 70 procent je proto konzistentní s tím, že se nic nestalo. Padesát pokusů přesune hodnotu za kolo na přibližně 7 bodů a stojí odpoledne.
Tato asymetrie je argumentem pro intervention rate: vypočtené přes tisíce snímků místo dvacet binárních výsledků, pohybuje se dříve a plynuleji. Záznam je, že snímky v epizodě jsou těžce korelované - jedno špatné uchopení přináší sto po sobě jdoucích intervenčních snímků - takže efektivní velikost vzorku je blíže počtu převzetí. Zacházejte se sazbou jako s včasným indikátorem a úspěšností jako s pomalou zemskou pravdou.
Epizody vyhodnocení nesmí nikdy vstoupit do složeného datavého souboru trénování - jinak je kolo n+1 bodováno na datech, na kterých bylo trénováno, a křivka měří memorování.
Léčka 3: trénování pouze na korekcích ohne politiku
Opravy jsou zajímavá data, takže instinkt je trénovat na nich. Nedělejte. Přicházejí stavbou z úzkého řezu prostoru stavu, kde zásada již selhávala, a říkají téměř nic o většině běhu, která fungovala. Dolaďte se na tom řezu samotně a dostanete politiku dobrou v zotavování se z pokryté přístupem, která zapomněla, jak udělat čistou.
Mandlekar a kolegové postavili svůj systém vzdálené intervence kolem toho. Jejich rámec: manipulační úkoly obsahují problémové oblasti vyžadující posloupnost přesných akcí - vložení podnosu do kávovaru je jejich příklad - kde malé odchylky vedou do stavů, které demonstrace nikdy nepokryly. Jejich algoritmus trénuje iterativně na nových datech, takže se politika učí procházet těmito úzkými místy, a hlášují, že agenti trénovaní na datech intervence porazí agenty trénované na ekvivalentním počtu vzorků od neintervenčních demonstrátorů.
- Rychle: krátký běh přes několik desítek epizod je levný dost na to, aby se opakoval
- Cíleně: gradient je dominován stavy, na kterých vám záleží
- Levně testovat, zda je styl opravy vůbec vyučovatelný
- Distribuce jemného ladění již neodpovídá distribuci úkolů
- Nominální chování se může viditelně degradovat v rámci jednoho kola
- Sazba může padnout, zatímco úspěch s ní padá - čisté segmenty obchodovány za zotavení
Poměr míchání je hyperparametr a zaslouží si to, aby se zapsalo. Složení příští datovému souboru je místo, kde se rozhoduje: původní demonstrace plus sada oprav, výběr epizod na zdroj místo pravidla, které tiše táhne v cokoliv je k dispozici. Zde je jeden krok skládaní v cockpitu, a výsledkem je obyčejný datový soubor - viz dokumentaci trénování. Co žádný nástroj nedělá za vás, je zaznamenávání, který poměr vyprodukoval jakou křivku.
Léčka 4: člověk není konzistentní odborník
Teorie DAgger předpokládá experta. Nejste v technickém smyslu: vaše opravy nejsou vzorky z pevné podmíněné distribuce přes akce. Autoři ACT to pojmenují při seznamování s překážkami jemné manipulace - chyby se skládají v čase a lidské demonstrace mohou být ne-stacionární. Jejich systém stále dosahuje 80 až 90 procent úspěchu na šesti skutečných úkolech z deseti minut demonstrací, takže problém je řešitelný, ne nepřítomný.
Studium robomimic dělá bod ze strany dat. Přes šest offline algoritmů na pět simulovaných a tři reálných víceúrovňových úkolů, její lekce zahrnují citlivost na volby návrhu, závislost na kvalitě demonstrace, a - ten, který nejvíc bolí zde - variabilita vycházející z kritérií zastavení, protože se cíle trénování a vyhodnocení liší. Checkpoint s nejnižší ztrátou není spolehlivě ten s nejvyšší úspěšností.
Existuje hardwarová verze toho: vstupní režim tvaruje opravu. nastavení vůdce-následovníka produkuje nepřetržité, zpomalenými člověkem trajektorie. Klávesnice nudge jsou tvrdě sevřeny serverem - dva stupně na kloubech ramene, čtyři na gripper - takže stejný záměr přijde jako schody malých kroků. Posuvníky odesílají absolutní cíle a server se pohybuje maximálně šest stupňů směrem k nim za hovor. Tři režimy, tři distribuce akcí; míchání všech tří do jedné sady oprav a pak se divu, proč se přístup stal nervózní je sebeinfligovaný. dokumentace dálkového ovládání pokrývá to, co každý režim posílá.
Vážení intervencí: IWR a co přišlo po
Pokud jsou opravy cennou menšinou, principiální oprava je váha spíše než exkluzivita. Intervention Weighted Regression je referenční implementace: data jsou rozdělena na intervenční a neintervenční vzorky a dvě oddíly jsou vzorkovány v rovném poměru během trénování. Sada oprav, která je pět procent snímků, pak přispívá polovinou gradientu, bez nominálního chování mizení z distribuce.
Stejný poměr je výchozím bodem, ne zákona. Sirius jej zobecňuje nahrazením binární oddílů nepřetržitou váhou z aproximované lidské důvěry; Sirius-Fleet posunuje rozhodnutí upstream, pomocí vizuálního světového modelu a anomálních prediktorů rozhodnout, když je člověk vůbec požadován. Společné vlákno: příznak intervence je tréninkový signál, ne jen účetní sloupec.
| Metoda | Kdo se rozhodne, kdy člověk jedná | Jak se používají intervenční data | Hlášený výsledek |
|---|---|---|---|
| DAgger (2011) | Pevný plán; expert označuje navštívené státy | Jeden rostoucí datový soubor, nevážený | Rámcován jako redukce na online learning bez zájmu |
| HG-DAgger (2019) | Člověk, gating kontrola na skutečném systému | Agregováno; plus naučený bezpečnostní práh na nejistotě modelu | Lepší než DAgger a BC na jízdě; žádné počty intervencí dány |
| IWR (2020) | Člověk, prostřednictvím dálkového ovládání | Intervenční a neintervenční vzorky jsou čerpány v rovném poměru | Porazí neintervenční demos při počtu stejných vzorků |
| Sirius (2022) | Člověk, během nasazení | Vážené BC, váhy z aproximované lidské důvěry | 8 % nárůst v simulaci, 27 % na skutečném hardwaru; 2x rychlejší konvergence |
| ThriftyDAgger (2021) | Systém, gating na novosti a riziku | Interaktivní sběr pod rozpočtem dohledu | Studie uživatele (N=10): 58 % vyšší člověk a 80 % vyšší výkonnost robota než další nejlepší metoda |
| Fleet-DAgger (2022) | Systém, přidělování pozornosti v rámci vozovny | Učení vozovny skórováno návratem na lidské úsilí | Až 8,8x vyšší ROHE než baselines |
| Sirius-Fleet (2024) | Anomální prediktory se samo-přizpůsobujícím kritérii | Učení více úkolů s vizuálním světovým modelem | Méně žádostí o intervenci, jak se autonomie zlepšuje |

Čtyři metriky hodné zaznamenávání vedle sazby
- Převzetí za běh. Dvacet krátkých oprav a jeden dlouhý dávají podobné sazby a popisují různé zásady - jeden nervózní, jeden se slepou skvrnou.
- Průměrná délka intervence. Rostoucí délka s padajícím počtem znamená, že zbývající selhání jsou těžká, což je to, jak vypadá pozdní pokrok.
- Čas do první intervence. Politika, která si vezme dále, než potřebuje pomoc, se zlepšuje, i když celková sazba je plochá.
- Kde intervenční klastry. Bin příznak normalizovaným pokrokem epizody; stabilní vrchol přes kola ukazuje na jedno úzké místo.
Protokol kola, který můžete opravdu spustit
Měřené kolo má šest kroků a vytvoří jeden řádek v záznamu. První čtyři jsou smyčka; poslední dva to dělají měřením.
- 1Zmrazte evaluační protokol před kolem nula
Zapište počáteční polohu, umístění objektu, kamery, počet pokusů, timeout a kritérium úspěchu. Fotografujte stůl. Pokud se má dokument změnit, série se restartuje.
- 2Změřit baseline
Spusťte protokol bez intervencí a zaznamenejte úspěchy; pak spusťte jednu relaci s nástrojem s povoleným přebíráním a zaznamenejte sazbu. Tato dvě čísla jsou kolo nula.
- 3Shromažďujte opravy v jednom konzistentním stylu
Jeden vstupní režim za kolo, jeden operátor, pokud se vám to podaří. Převezměte si na kritériu, které můžete hlasitě uvést - 'gripper více než dva centimetry pryč v přístupu' - a podržte jej za kolo.
- 4Triáž každá epizoda stejný den
Oprava, vyhodnocení nebo zahození. Nejednoznačné epizody se zahazují, neukládají se na teorii, kterou více dat pomáhá - oprava, ve které jste se sami zadrhli, je horší než žádná epizoda.
- 5Složte směs explicitně
Původní demonstrace plus opravy, výběr epizod na zdroj. Zaznamenat počet základny, počet oprav a jaké vážení - to je pole, které chcete za tři týdny.
- 6Pokračujte z checkpointu, pak znovu změřte
Trénujte složenou datovému soubor z předchozího checkpointu spíše než z modelu základu, spusťte zmrazený protokol plus jednu relaci s nástrojem, přidejte řádek a porovnejte s předchozími dvěma koly.
Dva omezení změnit způsob čtení slabého kola. Pokračování z checkpointu inicializuje váhy z toho - ne obnovení optimizátoru, takže plán začíná čerstvě a krátký běh ze sbíhajícího se checkpointu se může posunout velmi málo. A pohyb zarovnání vůdce na začátku převzetí má nejméně najaždění na skutečném hardwaru všeho v řetězci; pokud všechny opravy začínají lichým přechodem, podívejte se tam před viníkem míchání.
Měřená smyčka, již zapojená
ay-robots implementuje těchto šest kroků jako funkce produktu: převzít se uprostřed běhu od ramene vůdce, klávesnice nebo posuvníků, s automaticky označenými intervenčními snímky; triáž každá epizoda jako oprava, vyhodnocení nebo zahození; složit příští datový soubor z původních demonstrací plus opravy, výběr epizod na zdroj; a spustit příští tréninkový běh z předchozího checkpointu místo modelu základu.
Podívejte se, jak DAgger smyčka fungujeJaké číslice Vám nemohou říci
Žádný z nich není vyřešen, a úhledná křivka by vás neměla přesvědčit jinak. Intervention rate měří přidružený systém - politika, hardware, operátor, místnost - a nic si nepřičítá. Nemůže posoudit, zda byly opravy dobré, a šťastně padne na úkol, který se stal snadnějším, protože se objekt posunul dva centimetry blíže na tři týdny.
Co dělá je proměnit neurčitý dojem v sloupec, o kterém můžete argumentovat. Alternativa není lepší metrika; je to tři týdny shromažďování oprav, které by vám křivka řekla, po kole tři, aby se zastavila shromažďování. Průzkumná literatura definuje interaktivní učení napodobením jako lidskou zpětnou vazbu danou občas během spuštění robota, což umožňuje online zlepšení chování; rodina je široka, a žádné uspořádání toho bez čísla za kolo funguje. Podívejte se také na průvodce SO-100 imitation learning pro základní datový soubor, který míchate proti, spuštění politiky pro stranu inference a stránka DAgger smyčky pro implementovaný pipeline.
Je intervention rate jen jeden mínus úspěšnost?▾
Ne. Sazba měří, kolik běhu jste si převzali; úspěšnost měří, zda se úkol udělal bez vás. Běh se může zdařit s 30 procenty intervention rate, a běh bez intervencí se může zcela nezdařit. Liší se také v hluku: sazba se hladce pohybuje přes tisíce korelovaných snímků, úspěšnost skočí mezi hrstí binárních výsledků. Zaznamenejte oba.
Kolik pokusů o vyhodnocení potřebuji, aby měla úspěšnost něco znamenala?▾
Více než se cítí rozumně. Pod normální aproximací, 20 pokusů při skutečné 60 procent úspěšnosti nese standardní chybu blízko 11 procent bodů, takže 10bodový pohyb mezi koly nelze rozlišit od hluku; 50 pokusů přesou číslo na přibližně 7. Pokud si nemůžete dovolit 50, udržujte počet pokusů identický v celých kolech a zacházejte s malými pohyby jako s neprůkaznými.
Jaký poměr demonstrací k opravám bych měl začít?▾
Zdokumentovaný výchozí bod je IWR: rozdělte data na intervenční a neintervenční vzorky a čerpejte je v rovném poměru, takže opravy přispívají polovinou gradientu, ať už jaký podíl snímků jsou. Pokud vaše nastavení nemůže váha vzorkování, přibližujte je prostřednictvím počtu epizod při skládání datovému souboru a zaznamenejte poměr. Trénování pouze na opravách je možnost, kterou je třeba vyloučit.
Moje intervention rate stoupla po kole. Je kolo zmařeno?▾
Nutně ne, ale nejdříve zkontrolujte nudné vysvětlení: vhodoval checkpoint, který jste řídili, shodovat se s tím, který jste trénovali, změnila se kamera indexu či montáže, změnilo se umístění objektu, byl styl opravy konzistentní. Pokud jsou všechny čtyři čisté a spárovaná úspěšnost také padla, podezírejte mix - příliš málo základních demonstrací proti opravám, nebo opravy, které se navzájem odporují. Skrz regrese patří do záznamu, ne do koše.
Mohu přeskočit pevný evaluační protokol a jen sledovat intervention rate?▾
Pouze pokud přijmete, že nemůžete rozlišit zlepšení od zvyku. Sazba závisí na vaší vlastní prahové hodnotě v reálném čase pro zasáhnutí, a tento práh padá, jak si zvyknete na zvláštnosti politiky. Zmrazený protokol je součást měření, kterou váš práh nemůže dosáhnout - lepené značky, psaná domovská póza, pevný počet pokusů, kritérium rozhodnuté před kolem. Musí zůstat nezměněno v celé řadě.
Uchovávejte záznam v úložišti, ne v notebooku: kola jsou dny od sebe, hardware se znovu staví a osoba čtoucí křivku v říjnu jste vy bez vzpomínky na srpen. Часté otázky dokumentace pokrývají operační detaily opomenuté zde.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started