Pracovní prostor stolního robota typu používaného jako pevné nastavení vyhodnocení pro opakované spuštění zásad
DAggerVyhodnoceníUčení NapodobenímRobotická DataSO-100

Měření DAgger Loop: Intervention Rate, Evaluační Protokol a Pasti Mezi Nimi

AY-Robots ResearchAugust 27, 202615 minut čtení

Intervention rate - intervenční snímky dělené snímky běhu - je nejlevnější upřímný signál pokroku, který má lidmi řízená DAgger smyčka. Tento článek jej definuje tak, aby jej dvě osoby vypočítaly stejně, ukazuje, jak jej zaznamenávat, a prochází čtyřmi způsoby, kterými vás svádí: zvyk operátora, drifující nastavení vyhodnocení, trénování pouze na korekcích a člověk, který v úterý opravuje jinak než v pondělí.

DAgger kolo se cítí produktivně, dokud v něm jste. Řídíte zásadu, převezmete si ji, když zpacká uchopení, uložíte opravy, přetrénujete a příští spuštění vypadá - přísahali byste - trochu plynuleji. Dvě kola později nemůžete říci, zda se něco změnilo, protože "trochu plynuleji" není veličina.

Smyčka potřebuje jedno číslo na kolo, a v lidmi řízené smyčce je to téměř zdarma: podíl běhu, během kterého jste měli kontrolu místo zásady. Tento článek jej definuje tak, aby jej dvě osoby vypočítaly stejně, zaznamenává jej, čte výslednou křivku a pojmenuje čtyři způsoby, kterými vás svádí, když stojí samo. Teorii, kterou tento kus předpokládá, viz vysvětlení DAgger a varianta řízená člověkem; praktický protějšek je spuštění DAgger smyčky na SO-100.

Krátká verze

  • Intervention rate = intervenční snímky / snímky běhu. Snímky, ne epizody, a jmenovatel zahrnuje snímky, které jste strávili opravou.
  • Plochá křivka během tří kol znamená, že kola nic nekupují - změňte směs, checkpoint nebo úkol místo shromažďování čtvrtého.
  • Klesající intervention rate není rostoucí úspěšnost. Váš práh pro zasáhnutí se s rostoucí důvěrou snižuje.
  • Bez zmrazeného evaluačního protokolu - stejné počáteční pozice, předměty, kamery, počet pokusů - měříte místnost.
  • Trénování pouze na korekcích zkrzí distribuci stavu. Odpověď IWR: čerpat intervenční a neintervenční vzorky v rovném poměru.

Proč kolo potřebuje vůbec nějaké číslo

DAgger existuje kvůli distribuičnímu problému, a distribuční problémy jsou pro oko neviditelné. Ross a Bagnell ukázali, že učení napodobením na pevné sadě demonstrací vede ke skládajícím se chybám a k hranici zájmu rostoucí kvadraticky v čase horizondu: jakmile se student vzdálí od stavů, které demonstrátor navštívil, nic v datech mu neřekne, jak se vrátit. DAgger to opravuje iterací - spusťte zásadu, označte stavy, které navštíví, agregujte, přetrénujte - což Ross, Gordon a Bagnell rámují jako redukci na online learning bez zájmu.

Tento rámec má důsledek, který lidé přeskakují. Záruka se týká posloupnosti zásad v rámci iterací, nikoli jednotlivého běhu. Neříká nic o tom, zda váš třetí kol pomohlo. Jediný způsob, jak to vědět, je měřit každou iteraci. Kelly a kolegové zavedli HG-DAgger, protože klasický DAgger žádá experta o označení akcí, zatímco nováček stále ovládá, což článek tvrdí, že může snížit bezpečnost a u lidských odborníků je pravděpodobné, že snížit kvalitu štítku vnímáním zpoždění actuátoru. HG-DAgger také učí bezpečnostní práh pro metriku rizika založenou na nejistotě modelu a hlásí zlepšenou výkonnost oproti DAgger i behavioral cloning na řídící úloze. Nezveřejňuje počty intervencí; ty vyrábíte sami.

Definování sazby tak, aby dva lidé dostali stejné číslo

Definice je jeden řádek: intervenční snímky dělené snímky běhu. Všechno obtížné se skrývá v tom, co se počítá jako snímek a co se počítá jako běh.

Snímky, ne epizody

Počítání epizod s alespoň jednou intervencí je zbytečné: deset epizod s jedním lehkým potlačením a deset, ve kterých jste řídili osmdesát procent, obě dávají "10/10". Počet snímků je odděluje, a je to granularita, kterou záznam již má - v formátu LeRobot datovém souboru každý časový krok je řádkem, takže příznak intervence je jeden sloupec boolean vedle stavu a akce. Zde je zapsáno na snímek v okamžiku, kdy se přebírá, a vymazáno, když se kontrola vrátí.

Jmenovatel zahrnuje opravy

Dva jmenovatelé jsou obhajitelné - celkové snímky běhu nebo snímky, které zásada řídila autonomně - a velmi se liší na vysokých úrovních intervence. Převezměte si 400 z 1000 snímků a první dává 40 procent, druhý 67 procent. Porovnání jednoho kola měřeného prvním způsobem proti příštímu měřenému druhým způsobem je, jak skutečné zlepšení zmizí. Vezměte si celkové snímky a nikdy si neprohlédněte volbu v seriálu.

Rozhodněte se jednou, co se stane s handover snímky

Vždy je tam šev. Když se ovládání přesouvá, některé snímky patří oběma stranám: rameno je drženo, vůdce se zarovnává, záznam je zmrazen. V tomto pipeline zůstávají handover snímky v surového toku a nikdy nevstupují do kurátor epizoda - jsou to chování politiky ani oprava, kterou by stálo za to trénovat. Počítejte šev stejným způsobem každé kolo: při 30 Hz, šest přebírání s dvousecundovým švem každý je 360 snímků, dost na přesunutí procentuálního bodu.

Tři rozhodnutí, která porušují porovnatelnost

Snímky nebo epizody; celkový běh nebo pouze autonomní; handover snímky dovnitř nebo ven. Některý ze tří změněných tichých mezi koly činí křivku bezvýznamnou. Zapište všechny tři.

Zaznamenávání tak, aby číslo přežilo sezónu

Metrika v stavovém panelu běžícího procesu je čtení: po restartování zmizí a nelze ji vykreslit. Jeden řádek pouze připojovací za běh pokrývá celou řadu - včetně kterého checkpoint jste řídili, protože se to mění každé kolo a jejich smíchání znehodnocuje to, co následuje.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Jeden řádek za běh. Zaznamenávání jmenovatele a handover konvence vedle čísla je důležitější než jména polí.

Dvě pole nýsou váhu. train_mix je to, co jste krmili příští prácí trénování; bez toho nic nelze přičíst. eval_protocol pojmenuje pevný test, který jste později spustili, a je pole, které se nejčastěji opomíjí. V ay-robots cockpitu hlásí stav převzetí počet intervenčních snímků pro běžící relaci, takže záznam je spíše přepis než instrumentace; dokumentace datovému souboru pokrývá, kam přistávají sloupce pro každý snímek.

Matice konfigurací trénování zobrazující zásady, datové soubory a checkpointy vedle sebe
Každé kolo změní checkpoint a mix datovému souboru. Číslo, jejichž kombinace nebyla zaznamenána, nelze přičíst.

Čtení křivky: tři kola, jeden verdikt

Tři kola je minimum pro čtení, protože dva body jsou vždy čára. Tabulka níže je šablona účetnictví s čísly zástupných symbolů, nikoli měření z žádného běhu. Hledáte monotónní pokles sladěný zvýšením úspěchu na pevném testu.

KoloCheckpoint řídilSnímkyIntervenční snímkySazbaÚspěchy (z 20)
0 (baseline)základní politika5 9001 38023,4 %7
1ze soupravy kola 05 61098017,5 %10
2ze soupravy kola 15 41261111,3 %11
3ze soupravy kola 25 38059811,1 %12

Kola jeden a dva dělají práci. Třetí kolo ne: 11,3 proti 11,1 procent je v rámci varianty běhu-k-běhu čehokoliv měřeného na fyzickém rameni, a čtvrté kolo stejných oprav tráví odpoledne za nic. Plochý segment říká změnit něco strukturálního.

  • Zbývající selhání nejsou opravitelná teleopearací - objekt mimo dosah, geometrie gripper, kloub v jeho limitu. Žádné opravné údaje nezapadají do kinematické zdi.
  • Opravy jsou příliš málo proti základnímu datovému souboru, aby posunuly gradient, a nic je neváží.
  • Opravy se navzájem odporují, takže zásada průměry dvě strategie a přistane mezi nimi.
  • Selhání je proti proudu: kamera se přesunula, osvětlení se změnilo, zápěstí se již neshoduje s tréninkem.
  • Úkol je na stropu této třídy politiky na tomto hardwaru, a dalším krokem je více základních dat.

Poslední dva nejsou selhání smyčky. V Sirius-Fleet klesající potřeba člověka je navržený výsledek: jak se robotická autonomie zlepšuje, její anomální prediktory přizpůsobují svá kritéria předpovědi, což vede k menšímu počtu žádostí o lidskou intervenci a postupnému snižování lidské zátěže v čase. Tam se kritérium přizpůsobuje účelu. V manuální smyčce vaše se také přizpůsobuje, tiše - takže sazba, která se zploští, protože úkol je v jeho stropu, vypadá přesně jako ten, který se zploští, protože operátor přestal všímat si. Což je příští problém.

Léčka 1: klesající sazba není rostoucí úspěšnost

Intervention rate měří přesně jednu věc: kolik běhu jste se rozhodli vlastnit. Toto rozhodnutí je vaše, činěné v reálném čase, a pohybuje se. V kole nula převezmete si při prvním špatném úhlu přístupu; v kole tři jste viděli, jak se zásada zotavuje z tuctu z nich a necháte ji zkusit. Váš práh se posunul; politika se nemusela. Sazba padá tak či onak.

Lidská důvěra je alespoň modelovaná veličina v literatuře místo předpokládané konstanty. Sirius znovu váží vzorky trénování s aproximovanou lidskou důvěrou a optimalizuje politiku pomocí váženého behavioral cloning, hlášením 8 procent nárůstu v simulaci a 27 procent na skutečném hardwaru nad state-of-the-art v úspěšnosti politiky, dvakrát rychleji konvergence. To považuje důvěru za váhu na datech. Nekoriguje práh ve vaší hlavě mezi kolem nula a kolem tři.

Nemůžete odstranit drift, takže spárujte sazbu s něčím, co váš práh nemůže dotknout: pevný soubor pokusů, ve kterých vůbec nezasahujete, bodovaný podle kritéria zapsaného před kolem. Sazba, která padá, zatímco spárovaná úspěšnost zůstává, je podpisem zvyku - za to stojí chytit, protože z uvnitř smyčky se cítí jako pokrok.

Intervention rateÚspěšnost na pevném protokoluNejpravděpodobněji čtení
padástoupáKolo fungovalo. Pokračovat.
padáplochýVáš práh se posunul, nebo opravy odstranily úsilí bez odstranění selhání.
padápadáOpravy degradují politiku. Zkontrolujte míchání a jejich vnitřní konzistenci.
plochýplochýKolo nekupovalo nic. Změňte mix, checkpoint nebo úkol před shromažďováním více.
stoupápadáRegrese. Podezírejte mix trénování, změněnou kameru nebo mix checkpoint před podezřením metody.

Léčka 2: bez pevného protokolu měříte místnost

Vyhodnocení skutečného robota je drahé a těžko opakovatelné. Autoři SIMPLER motivují simulované vyhodnocení pozorováním, že vyhodnocení takových zásad v reálném světě není škálovatelné a čelí problémům reprodukovatelnosti, které se pravděpodobně zhorší, jak se spektrum úkolů zásad rozšiřuje. RoboArena ji útočí z druhé strany, s více než 600 párovými epizodami reálného robota vyhodnocení v celých sedmi generalistických zásadách, spuštěných vyhodnocovatelů na sedmi akademických institucích na DROID platformě. Její vyhodnocovatelé si vybírají své vlastní úkoly a prostředí, ale musí dvojitě-slepě posoudit páry zásad; příspěvek hlásí, že toto crowdsourced pořadí sleduje výkonnost generalistické politiky přesněji než konvenční, centralizované vyhodnocení.

Na jedné SO-100 v dílně nebudete spouštět 600 párových epizod. Co můžete udělat, je odstranit rozptyl, který kontrolujete - seznam nudný dost na to, aby se obvykle přeskočil.

DimenzeZmrazte toCo se posouvá, pokud se to neudělá
Počáteční polohaPísemná domovská pozice, řízená před každým pokusemTrajektorie začíná mimo distribuci
ObjektyLepené značky a stejné fyzické objekty vyhrazené pro vyhodnocení"Lepší" politika je opravdu bližší předmět
Kamery a světloStejné připojení, indexy, expozice; slepá okna zavřená; fotografovat nastaveníZaměněné indexy kamer se samy o sobě mohou dominovat výsledku
Zkoušky a pravidlo zastaveníPevné n, pevný timeout, kritérium zapsané před kolemPost-hoc kritéria promění těsné chyby v cokoliv, co potřebujete
Chování operátoraBez intervencí během evaluačních pokusůVyhodnocení se stane další relací opravy

Pak aritmetika, neúprosná počtu pokusů, které dílna může dovolit. Pod normální aproximací, 60 procent úspěchu přes 20 pokusů nese standardní chybu blízko 11 procent bodů - druhá odmocnina 0,6 krát 0,4 přes 20 - a rozdíl mezi dvěma takovými koly nese asi 15. Skok z 60 na 70 procent je proto konzistentní s tím, že se nic nestalo. Padesát pokusů přesune hodnotu za kolo na přibližně 7 bodů a stojí odpoledne.

Tato asymetrie je argumentem pro intervention rate: vypočtené přes tisíce snímků místo dvacet binárních výsledků, pohybuje se dříve a plynuleji. Záznam je, že snímky v epizodě jsou těžce korelované - jedno špatné uchopení přináší sto po sobě jdoucích intervenčních snímků - takže efektivní velikost vzorku je blíže počtu převzetí. Zacházejte se sazbou jako s včasným indikátorem a úspěšností jako s pomalou zemskou pravdou.

Udržujte epizody vyhodnocení mimo fond trénování

Epizody vyhodnocení nesmí nikdy vstoupit do složeného datavého souboru trénování - jinak je kolo n+1 bodováno na datech, na kterých bylo trénováno, a křivka měří memorování.

Léčka 3: trénování pouze na korekcích ohne politiku

Opravy jsou zajímavá data, takže instinkt je trénovat na nich. Nedělejte. Přicházejí stavbou z úzkého řezu prostoru stavu, kde zásada již selhávala, a říkají téměř nic o většině běhu, která fungovala. Dolaďte se na tom řezu samotně a dostanete politiku dobrou v zotavování se z pokryté přístupem, která zapomněla, jak udělat čistou.

Mandlekar a kolegové postavili svůj systém vzdálené intervence kolem toho. Jejich rámec: manipulační úkoly obsahují problémové oblasti vyžadující posloupnost přesných akcí - vložení podnosu do kávovaru je jejich příklad - kde malé odchylky vedou do stavů, které demonstrace nikdy nepokryly. Jejich algoritmus trénuje iterativně na nových datech, takže se politika učí procházet těmito úzkými místy, a hlášují, že agenti trénovaní na datech intervence porazí agenty trénované na ekvivalentním počtu vzorků od neintervenčních demonstrátorů.

Trénování pouze na korekcích versus složená směs
Co vám získáte pouze opravy
  • Rychle: krátký běh přes několik desítek epizod je levný dost na to, aby se opakoval
  • Cíleně: gradient je dominován stavy, na kterých vám záleží
  • Levně testovat, zda je styl opravy vůbec vyučovatelný
Jakou cenu to stojí
  • Distribuce jemného ladění již neodpovídá distribuci úkolů
  • Nominální chování se může viditelně degradovat v rámci jednoho kola
  • Sazba může padnout, zatímco úspěch s ní padá - čisté segmenty obchodovány za zotavení

Poměr míchání je hyperparametr a zaslouží si to, aby se zapsalo. Složení příští datovému souboru je místo, kde se rozhoduje: původní demonstrace plus sada oprav, výběr epizod na zdroj místo pravidla, které tiše táhne v cokoliv je k dispozici. Zde je jeden krok skládaní v cockpitu, a výsledkem je obyčejný datový soubor - viz dokumentaci trénování. Co žádný nástroj nedělá za vás, je zaznamenávání, který poměr vyprodukoval jakou křivku.

Léčka 4: člověk není konzistentní odborník

Teorie DAgger předpokládá experta. Nejste v technickém smyslu: vaše opravy nejsou vzorky z pevné podmíněné distribuce přes akce. Autoři ACT to pojmenují při seznamování s překážkami jemné manipulace - chyby se skládají v čase a lidské demonstrace mohou být ne-stacionární. Jejich systém stále dosahuje 80 až 90 procent úspěchu na šesti skutečných úkolech z deseti minut demonstrací, takže problém je řešitelný, ne nepřítomný.

Studium robomimic dělá bod ze strany dat. Přes šest offline algoritmů na pět simulovaných a tři reálných víceúrovňových úkolů, její lekce zahrnují citlivost na volby návrhu, závislost na kvalitě demonstrace, a - ten, který nejvíc bolí zde - variabilita vycházející z kritérií zastavení, protože se cíle trénování a vyhodnocení liší. Checkpoint s nejnižší ztrátou není spolehlivě ten s nejvyšší úspěšností.

Existuje hardwarová verze toho: vstupní režim tvaruje opravu. nastavení vůdce-následovníka produkuje nepřetržité, zpomalenými člověkem trajektorie. Klávesnice nudge jsou tvrdě sevřeny serverem - dva stupně na kloubech ramene, čtyři na gripper - takže stejný záměr přijde jako schody malých kroků. Posuvníky odesílají absolutní cíle a server se pohybuje maximálně šest stupňů směrem k nim za hovor. Tři režimy, tři distribuce akcí; míchání všech tří do jedné sady oprav a pak se divu, proč se přístup stal nervózní je sebeinfligovaný. dokumentace dálkového ovládání pokrývá to, co každý režim posílá.

Vážení intervencí: IWR a co přišlo po

Pokud jsou opravy cennou menšinou, principiální oprava je váha spíše než exkluzivita. Intervention Weighted Regression je referenční implementace: data jsou rozdělena na intervenční a neintervenční vzorky a dvě oddíly jsou vzorkovány v rovném poměru během trénování. Sada oprav, která je pět procent snímků, pak přispívá polovinou gradientu, bez nominálního chování mizení z distribuce.

Stejný poměr je výchozím bodem, ne zákona. Sirius jej zobecňuje nahrazením binární oddílů nepřetržitou váhou z aproximované lidské důvěry; Sirius-Fleet posunuje rozhodnutí upstream, pomocí vizuálního světového modelu a anomálních prediktorů rozhodnout, když je člověk vůbec požadován. Společné vlákno: příznak intervence je tréninkový signál, ne jen účetní sloupec.

MetodaKdo se rozhodne, kdy člověk jednáJak se používají intervenční dataHlášený výsledek
DAgger (2011)Pevný plán; expert označuje navštívené státyJeden rostoucí datový soubor, neváženýRámcován jako redukce na online learning bez zájmu
HG-DAgger (2019)Člověk, gating kontrola na skutečném systémuAgregováno; plus naučený bezpečnostní práh na nejistotě modeluLepší než DAgger a BC na jízdě; žádné počty intervencí dány
IWR (2020)Člověk, prostřednictvím dálkového ovládáníIntervenční a neintervenční vzorky jsou čerpány v rovném poměruPorazí neintervenční demos při počtu stejných vzorků
Sirius (2022)Člověk, během nasazeníVážené BC, váhy z aproximované lidské důvěry8 % nárůst v simulaci, 27 % na skutečném hardwaru; 2x rychlejší konvergence
ThriftyDAgger (2021)Systém, gating na novosti a rizikuInteraktivní sběr pod rozpočtem dohleduStudie uživatele (N=10): 58 % vyšší člověk a 80 % vyšší výkonnost robota než další nejlepší metoda
Fleet-DAgger (2022)Systém, přidělování pozornosti v rámci vozovnyUčení vozovny skórováno návratem na lidské úsilíAž 8,8x vyšší ROHE než baselines
Sirius-Fleet (2024)Anomální prediktory se samo-přizpůsobujícím kritériiUčení více úkolů s vizuálním světovým modelemMéně žádostí o intervenci, jak se autonomie zlepšuje
Zobrazení žebříčku porovnávající zásady robota podle změřeného skóre
Pořadí zásad proti sobě znamená něco pouze když každý záznam spustil stejný protokol. To se vztahuje i na vaše vlastní tři kola.

Čtyři metriky hodné zaznamenávání vedle sazby

  • Převzetí za běh. Dvacet krátkých oprav a jeden dlouhý dávají podobné sazby a popisují různé zásady - jeden nervózní, jeden se slepou skvrnou.
  • Průměrná délka intervence. Rostoucí délka s padajícím počtem znamená, že zbývající selhání jsou těžká, což je to, jak vypadá pozdní pokrok.
  • Čas do první intervence. Politika, která si vezme dále, než potřebuje pomoc, se zlepšuje, i když celková sazba je plochá.
  • Kde intervenční klastry. Bin příznak normalizovaným pokrokem epizody; stabilní vrchol přes kola ukazuje na jedno úzké místo.

Protokol kola, který můžete opravdu spustit

Měřené kolo má šest kroků a vytvoří jeden řádek v záznamu. První čtyři jsou smyčka; poslední dva to dělají měřením.

  1. 1
    Zmrazte evaluační protokol před kolem nula

    Zapište počáteční polohu, umístění objektu, kamery, počet pokusů, timeout a kritérium úspěchu. Fotografujte stůl. Pokud se má dokument změnit, série se restartuje.

  2. 2
    Změřit baseline

    Spusťte protokol bez intervencí a zaznamenejte úspěchy; pak spusťte jednu relaci s nástrojem s povoleným přebíráním a zaznamenejte sazbu. Tato dvě čísla jsou kolo nula.

  3. 3
    Shromažďujte opravy v jednom konzistentním stylu

    Jeden vstupní režim za kolo, jeden operátor, pokud se vám to podaří. Převezměte si na kritériu, které můžete hlasitě uvést - 'gripper více než dva centimetry pryč v přístupu' - a podržte jej za kolo.

  4. 4
    Triáž každá epizoda stejný den

    Oprava, vyhodnocení nebo zahození. Nejednoznačné epizody se zahazují, neukládají se na teorii, kterou více dat pomáhá - oprava, ve které jste se sami zadrhli, je horší než žádná epizoda.

  5. 5
    Složte směs explicitně

    Původní demonstrace plus opravy, výběr epizod na zdroj. Zaznamenat počet základny, počet oprav a jaké vážení - to je pole, které chcete za tři týdny.

  6. 6
    Pokračujte z checkpointu, pak znovu změřte

    Trénujte složenou datovému soubor z předchozího checkpointu spíše než z modelu základu, spusťte zmrazený protokol plus jednu relaci s nástrojem, přidejte řádek a porovnejte s předchozími dvěma koly.

Dva omezení změnit způsob čtení slabého kola. Pokračování z checkpointu inicializuje váhy z toho - ne obnovení optimizátoru, takže plán začíná čerstvě a krátký běh ze sbíhajícího se checkpointu se může posunout velmi málo. A pohyb zarovnání vůdce na začátku převzetí má nejméně najaždění na skutečném hardwaru všeho v řetězci; pokud všechny opravy začínají lichým přechodem, podívejte se tam před viníkem míchání.

Měřená smyčka, již zapojená

ay-robots implementuje těchto šest kroků jako funkce produktu: převzít se uprostřed běhu od ramene vůdce, klávesnice nebo posuvníků, s automaticky označenými intervenčními snímky; triáž každá epizoda jako oprava, vyhodnocení nebo zahození; složit příští datový soubor z původních demonstrací plus opravy, výběr epizod na zdroj; a spustit příští tréninkový běh z předchozího checkpointu místo modelu základu.

Podívejte se, jak DAgger smyčka funguje

Jaké číslice Vám nemohou říci

Žádný z nich není vyřešen, a úhledná křivka by vás neměla přesvědčit jinak. Intervention rate měří přidružený systém - politika, hardware, operátor, místnost - a nic si nepřičítá. Nemůže posoudit, zda byly opravy dobré, a šťastně padne na úkol, který se stal snadnějším, protože se objekt posunul dva centimetry blíže na tři týdny.

Co dělá je proměnit neurčitý dojem v sloupec, o kterém můžete argumentovat. Alternativa není lepší metrika; je to tři týdny shromažďování oprav, které by vám křivka řekla, po kole tři, aby se zastavila shromažďování. Průzkumná literatura definuje interaktivní učení napodobením jako lidskou zpětnou vazbu danou občas během spuštění robota, což umožňuje online zlepšení chování; rodina je široka, a žádné uspořádání toho bez čísla za kolo funguje. Podívejte se také na průvodce SO-100 imitation learning pro základní datový soubor, který míchate proti, spuštění politiky pro stranu inference a stránka DAgger smyčky pro implementovaný pipeline.

Je intervention rate jen jeden mínus úspěšnost?

Ne. Sazba měří, kolik běhu jste si převzali; úspěšnost měří, zda se úkol udělal bez vás. Běh se může zdařit s 30 procenty intervention rate, a běh bez intervencí se může zcela nezdařit. Liší se také v hluku: sazba se hladce pohybuje přes tisíce korelovaných snímků, úspěšnost skočí mezi hrstí binárních výsledků. Zaznamenejte oba.

Kolik pokusů o vyhodnocení potřebuji, aby měla úspěšnost něco znamenala?

Více než se cítí rozumně. Pod normální aproximací, 20 pokusů při skutečné 60 procent úspěšnosti nese standardní chybu blízko 11 procent bodů, takže 10bodový pohyb mezi koly nelze rozlišit od hluku; 50 pokusů přesou číslo na přibližně 7. Pokud si nemůžete dovolit 50, udržujte počet pokusů identický v celých kolech a zacházejte s malými pohyby jako s neprůkaznými.

Jaký poměr demonstrací k opravám bych měl začít?

Zdokumentovaný výchozí bod je IWR: rozdělte data na intervenční a neintervenční vzorky a čerpejte je v rovném poměru, takže opravy přispívají polovinou gradientu, ať už jaký podíl snímků jsou. Pokud vaše nastavení nemůže váha vzorkování, přibližujte je prostřednictvím počtu epizod při skládání datovému souboru a zaznamenejte poměr. Trénování pouze na opravách je možnost, kterou je třeba vyloučit.

Moje intervention rate stoupla po kole. Je kolo zmařeno?

Nutně ne, ale nejdříve zkontrolujte nudné vysvětlení: vhodoval checkpoint, který jste řídili, shodovat se s tím, který jste trénovali, změnila se kamera indexu či montáže, změnilo se umístění objektu, byl styl opravy konzistentní. Pokud jsou všechny čtyři čisté a spárovaná úspěšnost také padla, podezírejte mix - příliš málo základních demonstrací proti opravám, nebo opravy, které se navzájem odporují. Skrz regrese patří do záznamu, ne do koše.

Mohu přeskočit pevný evaluační protokol a jen sledovat intervention rate?

Pouze pokud přijmete, že nemůžete rozlišit zlepšení od zvyku. Sazba závisí na vaší vlastní prahové hodnotě v reálném čase pro zasáhnutí, a tento práh padá, jak si zvyknete na zvláštnosti politiky. Zmrazený protokol je součást měření, kterou váš práh nemůže dosáhnout - lepené značky, psaná domovská póza, pevný počet pokusů, kritérium rozhodnuté před kolem. Musí zůstat nezměněno v celé řadě.

Uchovávejte záznam v úložišti, ne v notebooku: kola jsou dny od sebe, hardware se znovu staví a osoba čtoucí křivku v říjnu jste vy bez vzpomínky na srpen. Часté otázky dokumentace pokrývají operační detaily opomenuté zde.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started