Pracovný priestor stolného robota, ktorý sa používa ako pevný systém vyhodnotenia pre opakované spustenia politiky
DAggerEvaluáciaImitation LearningRobotické dátaSO-100

Meranie slučky DAgger: Intervention Rate, protokol evaluácie a pasce medzi nimi

AY-Robots ResearchAugust 27, 202615 min čítania

Intervention rate – intervenčné rámce vydelené rámcami behu – je najlacnejší čestný signál pokroku, ktorý má ľudmi riadená slučka DAgger. Tento článok ho definuje tak, aby dvaja ľudia vypočítali rovnakú hodnotu, ukazuje, ako ju protokolovať, a prejde štyrmi spôsobmi, ako vás klame: zvyknutie operátora, posúvajúci sa pokus vyhodnocovania, tréning iba na korekcií a človek, ktorý v utorok koriguje inak ako v pondelok.

Kolo DAgger sa zdá produktívne, pokiaľ ste v ňom. Riadite politiku, preberáte kontrolu, keď zlyháva v zovretí, uložíte korrekcie, pretrénujete, a nasledujúci beh vyzerá – prisahali by ste – o niečo hladší. Dve kolá neskôr nemôžete povedať, či sa niečo zmenilo, pretože "o niečo hladší" nie je veličina.

Slučka potrebuje jedno číslo na kolo, a v ľudmi riadenej slučke je to takmer zadarmo: podiel behu, počas ktorého ste mali kontrolu namiesto politiky. Tento článok ho definuje tak, aby dve osoby vypočítali rovnakú hodnotu, zapisuje ho, číta výslednú krivku a pomenováva štyri spôsoby, ako vás klame, keď stojí sám. Pre teóriu, ktorú tento článok predpokladá, pozri explainer DAgger a variant riadený človekom; praktická obdobu je spustenie slučky DAgger na SO-100.

Krátka verzia

  • Intervention rate = intervenčné rámce / rámce behu. Rámce, nie epizódy, a menovateľ obsahuje rámce, ktoré ste strávili korigenziou.
  • Plochá krivka počas troch kôl znamená, že kolá neprinášajú nič – zmeňte zmes, checkpoint alebo úlohu namiesto zbierania štvrtého.
  • Padajúca intervention rate nie je stúpajúca success rate. Vaša hranica vstupu klesá nadol, keď rastie dôvera.
  • Bez mrazeného protokolu vyhodnocovania – rovnaké štartovné pozy, objekty, kamery, počet pokusov – meriate miestnosť.
  • Tréning iba na korekcií skresľuje rozdelenie stavov. Odpoveď IWR: kreslite intervenčné a nemaľované vzorky v rovnakej proporcii.

Prečo kolo potrebuje číslo vôbec

DAgger existuje kvôli problému s rozdelením, a problémy s rozdelením sú pre oko neviditeľné. Ross a Bagnell ukázali, že učenie napodobňovaním na pevnej sade demonštrácie vedie ku skloňovacím chybám a hranici ľútosti rastúcej kvadraticky v časovom horizonte: akonáhle sa človek učiaci dostane mimo stavov, ktoré demonštrátor navštívil, nič v dátach mu nepovie, ako sa vrátiť. DAgger to rieši iteráciou – spustite politiku, označte stavy, ktoré navštevuje, agregujte, pretrénujte – čo Ross, Gordon a Bagnell rámujú ako redukciu na učenie bez ľútosti online.

Tento rámec má dôsledok, ktorý ľudia preskakujú. Záruka sa týka postupnosti politík cez iterácie, nie žiadneho jednotlivého behu. Nepovie nič o tom, či vaše tretie kolo pomohlo. Jediný spôsob, ako vedieť, je merať každú iteráciu. Kelly a kolegovia predstavili HG-DAgger, pretože klasický DAgger pýta experta na označenia akcií, zatiaľ čo nováčik stále kontroluje, čo článok tvrdí, že môže znížiť bezpečnosť a u ľudských expertov pravdepodobne zhorší kvalitu označenia vnímaným oneskorením aktuátora. HG-DAgger sa tiež učí prah bezpečnosti pre metriku rizika založenú na neurčitosti modelu a hlási zlepšenú výkonnosť oproti DAgger a behavioral cloning na úlohe šoférovania. Nezverejňuje počty intervencií; tie vyrábate sami.

Definovanie sadzby tak, aby dvaja ľudia dostali rovnaké číslo

Definícia je jeden riadok: intervenčné rámce vydelené rámcami behu. Všetko zložité sa skrýva v tom, čo sa počíta ako rámec a čo sa počíta ako beh.

Rámce, nie epizódy

Počítanie epizód s aspoň jednou intervenciou je zbytočné: desať epizód s jedným jemným potlačením a desať, v ktorých ste riadili osemdesiat percent, obe dávajú "10/10". Počet rámcov ich oddeľuje, a to je podrobnosť, ktorú záznam už má – v formáte LeRobot dataset je každý časový krok riadok, takže intervenčný príznak je jeden stĺpec boolean vedľa stavu a akcie. Tu sa zapisuje na rámec v okamihu, keď sa začína preberanie kontroly, a vyprázdňuje sa, keď sa kontrola vracia.

Menovateľ obsahuje korrekcie

Dve voliteľnosti menovateľa sú obhajiteľné – celkové rámce behu, alebo rámce, ktoré politika riadila autonómne – a výrazne sa rozchádzajú pri vysokých úrovniach intervencií. Prevezmite kontrolu na 400 z 1000 rámcov a prvý dáva 40 percent, druhý 67 percent. Porovnanie jedného kola meraného prvým spôsobom s nasledujúcim meraným druhým spôsobom je to, ako skutočné zlepšenie zmizne. Vezmite celkové rámce a nikdy znova nerevidujte voľbu v sérii.

Rozhodnite sa raz, čo sa stane s rámcami prevodu

Vždy je tu šev. Keď sa kontrola prenáša, niektoré rámce patria obom stranám: ruka sa drží, vodca sa zarovnáva, záznam je zamrazený. V tomto potrubí zostávajú rámce prevodu v raw toku a nikdy nevstúpia do kurátorskej epizódy – sú ani správanie politiky ani korekcia, ktorá by bola stojatá na tréningu. Počítajte šev rovnako každý beh: pri 30 Hz šesť preberaní s dvojsekundovým švom každý je 360 rámcov, dosť na presun percentuálneho bodu.

Tri rozhodnutia, ktoré porušujú porovnateľnosť

Rámce alebo epizódy; celý beh alebo iba autonómny; rámce prevodu v alebo von. Ktorúkoľvek z troch zmien ticho medzi kolami robí krivku bezvýznamnou. Napíšte všetky tri.

Protokolovanie, aby číslo prežilo reláciu

Metrika v stavovom paneli bežiaceho procesu je odčítanie: zmizne pri reštarte a nemôže byť vynesená. Jeden len pripevňovací riadok na beh pokrýva celú sériu – vrátane ktorého checkpoint ste riadili, pretože sa to mení každé kolo a zmiešanie ich zneplatňuje, čo nasleduje.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Jeden riadok na beh. Záznam menovateľa a konvencie prevodu vedľa čísla je dôležitejší ako názvy polí.

Dve polia niesou váhu. train_mix je to, čo ste nakŕmili ďalšiu tréningovú úlohu; bez toho sa nič nedá pripísať. eval_protocol pomenúva fixný test, ktorý ste spustili neskôr, a je pole, ktoré sa najčastejšie nechá prázdne. V cockpite ay-robots stav prevzatia kontroly hlási počet intervenčných rámcov pre bežnú reláciu, takže protokolovanie je skôr prepis ako inštrumentácia; dokumentácia dataset sa týka toho, kde pristanú stĺpce na rámec.

Matica konfigurácie trénovania zobrazujúca politiky, datasety a checkpointy vedľa seba
Každý beh mení checkpoint a zmes dataset. Číslo, ktorého kombinácia nebola zaznamenaná, sa nedá pripísať.

Čítanie krivky: tri kolá, jeden verdikt

Tri kolá sú minimum na čítanie, pretože dva body sú vždy čiara. Nasledujúca tabuľka je šablóna účetnictva s zástupnými číslami, nie merania z akéhokoľvek behu. Hľadáte monotónny pokles spárovaný zvýšením úspechu na fixnom teste.

KoloCheckpoint riadenýRámceIntervenčné rámceSadzbaÚspechy (z 20)
0 (základný stav)základná politika5 9001 38023,4 %7
1z miešanky kola 05 61098017,5 %10
2z miešanky kola 15 41261111,3 %11
3z miešanky kola 25 38059811,1 %12

Kolá jeden a dva robia prácu. Tretie kolo nie: 11,3 oproti 11,1 percent je v rámci kolísania behu na fyzickej ruke, a štvrté kolo rovnakých korekcií trávi odpoledne na nič. Plochý segment hovorí zmeniť niečo štrukturálne.

  • Zostávajúce zlyhania nie sú opraviteľné teleoperáciou – objekt mimo dosahu, geometria chytača, kĺb na svojej hranici. Žiadne korrekčné údaje neopravujú kinematickú stenu.
  • Korrekcie sú príliš málo oproti základnému datasetu, aby posunuli gradient, a nič ich nevažuje.
  • Korrekcie si odporujú, takže politika priemeňuje dve stratégie a pristane medzi nimi.
  • Zlyhanie je upstream: kamera sa pohla, osvetlenie sa zmenilo, pohľad zápästia už nie je zhodný s tréningom.
  • Úloha je na stropu tejto triedy politík na tomto hardvéri, a ďalším krokom sú viac základných údajov.

Posledné dva nie sú zlyhania slučky. V Sirius-Fleet je klesajúca potreba človeka navrhnutým výsledkom: keď sa autonómia robota zlepšuje, jej prediktory anomálií prispôsobujú svoje kritériá predikcie, čo vedie k menej žiadostiam o ľudskú intervenciu a postupne znižuje ľudskú záťaž v čase. Tam sa kritérium prispôsobuje zámerne. V manuálnej slučke sa vaše prispôsobuje tiež, ticho – takže sadzba, ktorá sa zrovnáva, pretože úloha je na jej strope, vyzerá presne ako jedna, ktorá sa zrovnáva, pretože operátor prestane všímať. Čo je ďalší problém.

Pasca 1: padajúca sadzba nie je stúpajúca success rate

Intervention rate meria presne jednu vec: koľko z behu ste sa rozhodli vlastniť. To rozhodnutie je vaše, prijaté v reálnom čase, a pohybuje sa. V kole nula preberáte kontrolu pri prvom zlom uhle prístupu; do kola tri ste pozorovali, ako sa politika zotavuje z tucta z nich, a necháte ju skúsiť. Vaša hranica sa posunula; politika sa možno nie. Sadzba klesá v každom prípade.

Ľudská dôvera je aspoň modelovaná veličina v literatúre skôr ako predpokladaná konštanta. Sirius preváži tréningovacie vzorky aproximovanou ľudskou dôverou a optimalizuje politiku s váženým behavioral cloning, pričom hlási 8 percentný nárast v simulácii a 27 percent na skutočnom hardvéri oproti stavu umenia v policy success rate, s dvojnásobnou rýchlosťou konvergencie. To považuje dôveru za váhu na dátach. Nekorekčuje hranicu vo vašej hlave medzi kolom nula a kolom tri.

Nemôžete odstrániť drift, takže spárujte sadzbu s niečím, čo vaša hranica nemôže dotknúť: fixnú sadu pokusov, v ktorých nikdy neintervenujete, zhodnotenú podľa kritéria napísaného pred kolom. Sadzba, ktorá klesá, zatiaľ čo spárovaná success rate stojí, je podpisom zvyknutia – stojí za chytenie, pretože zvnútra slučky to vyzerá ako pokrok.

Intervention rateSuccess rate na fixnom protokoleNajpravdepodobnejšie čítanie
klesárastieKolo fungovalo. Pokračujte.
klesáplocháVaša hranica sa posunula, alebo korrekcie odstránili úsilie bez odstránenia zlyhaní.
klesáklesáKorrekcie zhoršujú politiku. Skontrolujte zmes a ich vnútornú konzistenciu.
plocháplocháKolo neprinieslo nič. Zmeňte zmes, checkpoint alebo úlohu pred zbieraním viac.
rastieklesáRegresia. Podozrievajte tréningovú zmes, zmenenú kameru alebo mix checkpoint pred podozrievaním metódy.

Pasca 2: bez pevného protokolu meriate miestnosť

Vyhodnotenie na skutočnom robote je drahé a ťažko sa opakuje. Autori SIMPLER motivujú simulované vyhodnotenie pozorovaním, že vyhodnotenie takýchto politík v reálnom svete nie je škálovateľné a čelí problémom s reprodukovateľnosťou, ktoré sa pravdepodobne zhoršia, keď sa politiky zošíria na spektrum úloh. RoboArena to útočí z druhej strany, s viac ako 600 párovými epizódami vyhodnocovania reálnych robotov v siedmych generalistických politikách, spustené hodnotiteľmi v siedmych akademických inštitúciách na platforme DROID. Jej hodnotitelia si vyberajú svoje vlastné úlohy a prostredia, ale musia posúdiť dvojito slepé páry politík; článok hlási, že túto davom zdroj usporiadané ranking sleduje výkonnosť generalistickej politiky presnejšie ako konvenčné, centralizované vyhodnotenie.

Nebudete spúšťať 600 párovaných epizód na jednom SO-100 v dielni. To, čo môžete urobiť, je odstrániť rozptyl, ktorý kontrolujete – zoznam dosť nudný, že sa zvyčajne preskakuje.

RozmerZamrazte toČo sa posúva, ak to neurobíte
Štartovná pózaNapísaná domovská pozícia, riadená pred každou skúškouTrajektória začína mimo distribúcie
ObjektyPáskované značky a rovnaké fyzické objekty vyhradené na vyhodnotenieLepšia politika je skutočne bližší objekt
Kamery a svetloRovnaké príslušenstvo, indexy, expozícia; žalúzie zatvorené; fotografovať nastavenieSamotná výmena indexov kamery môže dominovať výsledkom
Pokusy a pravidlo zastaveniaFixné n, fixný časový limit, kritérium napísané pred kolomPost-hoc kritériá menia blízke pokusy na čokoľvek, čo potrebujete
Správanie operátoraBez intervencií počas pokusov vyhodnocovaniaVyhodnotenie sa stáva ďalšou reláciou korrekcie

Potom aritmetika, neľútosvá na počte pokusov, ktoré si dielňa môže dovoliť. Podľa normálnej aproximácie nestojí 60 percent úspechu v 20 pokusoch so štandardnou chybou blízkou 11 percentným bodom – odmocnina 0,6 krát 0,4 nad 20 – a rozdiel medzi dvoma takými kolami niesli približne 15. Skok zo 60 na 70 percent je preto v súlade s tým, že sa nič nestalo. Päťdesiat pokusov prináša číslo na kolo približne na 7 bodov a stojí odpoledne.

Táto asymetria je argument pre intervention rate: počítané na tisícoch rámcov namiesto dvadsiatich binárnych výsledkov, pohybuje sa skôr a hladšie. Vyhradzovanie je to, že rámce v rámci epizódy sú ťažko korelované – jeden zlý stisk dáva sto po sebe idúcich intervenčných rámcov – takže efektívna veľkosť vzorky je bližšie k počtu prevzatí. Zaobchádza sa so sadzbou ako s ranným indikátorom a success rate ako s pomalou základnou pravdou.

Držte epizódy vyhodnocovania mimo tréningovej bazéna

Epizódy vyhodnocovania nikdy nesmú vstúpiť do zloženého tréningovej dataset – inak je kolo n+1 zhodnotené na údajoch, na ktorých sa trénoval, a krivka meria memoráciu.

Pasca 3: tréning iba na korekcií bez ohľadu na politiku

Korrekcie sú zaujímavé údaje, takže inštinkt je trénovať na nich. Neurobte. Prichádzajú konštrukciou z úzkeho seku stavového priestoru, kde politika už zlyhávala, a hovoria takmer nič o väčšine behu, ktorý fungoval. Trénovanie na tomto seku sám a dostanete politiku dobrú v zotavovaní sa z pochrútaného prístupu, ktorá zabudla, ako urobiť čistý.

Mandlekar a kolegovia postavili svoj systém diaľkovej intervencie okolo toho. Ich rámec: manipulácie úlohy obsahujú kritické body vyžadujúce postupnosť presných akcií – vloženie podu do kávovaru je ich príklad – kde malé odchýlky vedú do stavov, ktoré demonštrácie nikdy nepokryli. Ich algoritmus trénuje iteratívne na nových dátach, takže sa politika učí prechádzať cez tie kritické body, a hlasia, že agenti trénovaní na dátach intervencie Beat agentov trénovaných na ekvivalentnom počte vzoriek od neinvenčných demonštrátorov.

Tréning iba na korekcií oproti zmiešanej zmesi
Čo ti korrekcie-len dostanú
  • Rýchle: krátky beh cez niekoľko desiatok epizód je dosť lacný na opakovanie
  • Zacielené: gradient je dominovaný stavmi, na ktorých vám záleží
  • Lacné na testovanie, či je stil korrekcie vôbec naučiteľný
Čo vás stojí
  • Distribúcia jemného ladenia už nepripomína distribúciu úloh
  • Nominálne správanie sa može viditeľne zhoršiť v rámci jedného kola
  • Sadzba môže klesať, zatiaľ čo úspech klesá spolu s ním – čisté segmenty vymenené za zotavenia

Pomer miešania je hyperparamater a zaslúži si byť zapísaný. Skladanie ďalšieho dataset je to, kde sa rozhoduje: pôvodné demonštrácie plus sada korekcií, výber epizód na zdroj skôr než pravidlo, ktoré ticho vťahuje sa, čo je dostupné. Tam to je jeden krok zloženia v cockpite, a výsledkom je obyčajný dataset – viď dokumentácia trénovania. Čo žiadny nástroj neurobí pre vás je záznam, ktorý pomer vyprodukoval ktorú krivku.

Pasca 4: človek nie je konzistentný expert

Teória DAgger predpokladá experta. V technickom zmysle nie ste: vaše korrekcie nie sú vzorkami z pevného podmieňovaného rozdelenia cez akcie. Autori ACT menujú toto, keď uvádzajú prekážky pre jemnú manipuláciu – chyby sa hromadia v čase a ľudské demonštrácie môžu byť nestacionárne. Ich systém stále dosahuje 80 až 90 percent úspešnosti na šiestich skutočných úlohách z desiatich minút demonštrácií, takže problém je riešiteľný, nie neprítomný.

Štúdia robomimic robí bod z dátovej strany. Cez šesť offline algoritmov na piatich simulovaných a troch skutočných viacstupňových úlohách, jej lekcie zahŕňajú citlivosť na voľby dizajnu, závislosť od kvality demonštrácie, a – ten, ktorý tu bolí najviac – variabilitu vyplývajúcu z kritérií zastavenia, pretože ciele trénovania a vyhodnocovania sa líšia. Checkpoint s najmenšou stratou nie je spoľahlivo ten s najväčšou success rate.

Existuje hardvérová verzia toho: vstupný režim formuje korekciu. Nastavenie vodca-nasledovník produkuje nepretržité, človekom tempované trajektórie. Kľúčové nudzenie sú tvrdé zatiahnuté serverom – dva stupne za výzvu na kĺboch ramena, štyri na chytači – takže rovnaký zámer príde ako schody malých krokov. Posúvače posielajú absolútne ciele a server sa posúva nanajvýš šesť stupňov k nim za hovor. Tri režimy, tri akčné distribúcie; zmiešavanie všetkých troch do jednej sady korekcií a potom sa čudesť, prečo prístup otočil nervózne je samoindukovaný. dokumentácia teleoperácie sa týka toho, čo každý režim posiela.

Váženie intervencií: IWR a čo prišlo potom

Ak sú korrekcie cenná menšina, principiálny fix je váha skôr ako výhradnosť. Intervention Weighted Regression je referenčná implementácia: dáta sú rozdelené do intervenčných a neinvenčných vzoriek, a obe partície sú vzorkované v rovnakej proporcii počas trénovania. Sada korekcií, ktorá je päť percent rámcov, potom prispieva polovica gradientu bez nominálneho správania zmizni z distribúcie.

Rovnaký podiel je štartovný bod, nie zákon. Sirius zovšeobecňuje jej nahradením binárnej partície kontinuálnou váhou z približovanej ľudskej dôvery; Sirius-Fleet presúva rozhodnutie upstream, pomocou modelu vizuálneho sveta a prediktora anomálií rozhoduje, keď sa človek vôbec pýta. Spoločný prieťah: flag intervencie je tréningovým signálom, nie iba stĺpcom účetnictva.

MetódaKto rozhoduje, keď človek konajúceAko sa používajú údaje o intervenciíHlásený výsledok
DAgger (2011)Pevný rozvrh; expert označí navštívené stavyJeden rastúci dataset, neváženýRámovaný ako redukcia na učenie bez ľútosti online
HG-DAgger (2019)Človek, riadiaci kontrolu na skutočnom systémeAgregované; plus naučený prah bezpečnosti na neurčitosti modeluLepší ako DAgger a BC na šoférovaní; bez počtov intervencií
IWR (2020)Človek, cez diaľkovú teleoperáciuVzorky intervencie a neinvencie čerpané v rovnakej proporciiBieds neinvenčné demo pri rovnakom počte vzoriek
Sirius (2022)Človek, počas nasadeniaVážené BC, váhy z aproximovanej ľudskej dôveryNárast o 8 % v simulácii, 27 % na skutočnom hardvéri; 2x rýchlejšia konvergencia
ThriftyDAgger (2021)Systém, riadiaci na novosť a rizikoInteraktívny zber pod rozpočtom dohľaduŠtúdia používateľa (N=10): 58 % vyššia ľudská a 80 % vyššia výkonnosť robota ako ďalšia najlepšia metóda
Fleet-DAgger (2022)Systém, prideľujúce pozornosť cez flotuFleet učenie skórované návratom z ľudského úsiliaAž 8,8x vyšší ROHE ako východiská
Sirius-Fleet (2024)Prediktory anomálií so samočinne prispôsobujúcimi kritériamiViacúlohové učenie s modelom vizuálneho svetaMenej žiadostí o intervenciu, keď sa autonómia zlepšuje
Pohľad tabuľky porovnávajúci robotické politiky podľa meraného skóre
Poradie politík oproti sebe znamená niečo iba vtedy, keď každá položka spustila rovnaký protokol. To sa vzťahuje aj na vaše vlastné tri kolá.

Štyri metriky stojí za protokolovanie vedľa sadzby

  • Prevzatia na beh. Dvadsať krátkych korekcií a jeden dlhý dávajú podobné sadzby a opisujú rôzne politiky – jeden nervózny, jeden s jedinou slepou pou.
  • Priemer intervenčnej dĺžky. Stúpajúca dĺžka s klesajúcim počtom znamená, že zostávajúce zlyhania sú ťažké, čo je to, ako vyzerá neskorý pokrok.
  • Čas na prvú intervenciu. Politika, ktorá ide ďalej pred potrebou pomoci, sa zlepšuje aj keď je celková sadzba plochá.
  • Kde sa korrekcie skupinujú. Priehrada vlajkou normalizovanému pokroku epizódy; stabilný vrchol cez kolá poukazuje na jeden úzky bod.

Protokol kola, ktorý môžete skutočne spustiť

Merané kolo má šesť krokov a produkuje jeden riadok v denníku. Prvé štyri sú slučka; posledné dva ho robia meraním.

  1. 1
    Zamrazte protokol vyhodnocovania pred kolom nula

    Zapíšte si štartovnú pózu, umiestnenie objektu, kamery, počet pokusov, časový limit a kritérium úspechu. Fotografovať tabuľka. Ak sa dokument musí zmeniť, séria sa reštartuje.

  2. 2
    Merajte základný stav

    Spustite protokol bez intervencií a zaznamenenajte úspechy; potom spustite jednu inštruovanú reláciu s povoleným prevzatím a zaznamenenajte sadzbu. Tieto dve čísla sú kolo nula.

  3. 3
    Zbierajte korrekcie v jednom konzistentnom štýle

    Jeden vstupný režim na kolo, jeden operátor, ak to môžete zvládnuť. Prevezmite kontrolu na kritérium, ktoré viete vyslofzť nahlas – "chytač viac ako dva centimetre preč na prístupe" – a držte to na kolo.

  4. 4
    Triáž každú epizódu ten istý deň

    Korekcia, evaluácia alebo zahodenie. Nezvučné epizódy sa zahodili, nie uložené na teórii, že viac údajov pomáha – korekcia, v ktorej ste sami fumbled je horšia ako žiadna epizóda.

  5. 5
    Zložte zmes explicitne

    Pôvodné demonštrácie plus korrekcie, výber epizód na zdroj. Zaznamenajte počet základ, počet korekcií a akékoľvek váženie – toto je pole, ktoré budete chcieť za tri týždne.

  6. 6
    Pokračujte z checkpointu, potom znova zmerajte

    Trénujte zložený dataset z predchádzajúceho checkpointu namiesto základného modelu, spustite mrazený protokol plus jednu inštruovanú reláciu, pripojte riadok a porovnajte s predchádzajúcimi dvoma kolami.

Dve limity zmenia, ako čítate slabé kolo. Pokračovanie z checkpointu inicializuje váhy z neho – nie obnovenie optimalizátu, takže rozvrh sa spustí od nova a krátky beh z konvergovaného checkpointu sa môže veľmi málo posunúť. A pohyb zarovnania vedúceho na začiatku prevzatia má najmenší beží na skutočnom hardvéri všetkého v reťazi; ak korrekcie všetky začínajú s podivným přechodom, pozrite tam pred obvinením zmesi.

Merané slučka, už zapojené

ay-robots implementuje týchto šesť krokov ako prvky produktu: prevezmite kontrolu stred-behu od vedúceho ramena, klávesnice alebo posúvače, s intervenčnými rámcami automaticky označené; triáž každú epizódu ako korekciu, evaluáciu alebo zahodenie; zložiť ďalší dataset z pôvodných demonštrácií plus korekcií, výber epizód na zdroj; a spustite nasledujúci beh trénovania z predchádzajúceho checkpointu namiesto základného modelu.

Pozri, ako slučka DAgger funguje

Čo čísla nemôžu povedať

Nič z toho nie je vyriešené, a úhľadná krivka vás nemala by presviedchať inak. Intervention rate meria spoločný systém – politika, hardvér, operátor, miestnosť – a nič na vlastnosti nepripisuje. Nemôže povedať, či boli korrekcie dobré, a šťastne padne na úlohu, ktorá sa stala ľahšou, pretože objekt sa posunul o dva centimetre bližšie počas troch týždňov.

To, čo to robí je premeniť vágnu dojem do stĺpca, s ktorým sa môžete hádať. Alternatíva nie je lepšia metrika; je to tri týždne zbierania korekcií krivka by vám povedala, po kole tri, zastaviť zbieranie. Literatúra prieskum definuje interaktívne učenie napodobňovaním ako spätnej väzby od človeka daná prerušovane počas vykonávania robota, umožňujúce online zlepšenie správania; rodina je široká, a žiadne usporiadanie to funguje bez čísla na kolo. Viď tiež sprievodcu učením napodobňovaním SO-100 pre základný dataset, ktorý miešate oproti, spustenie politiky pre inference stranu, a stránka slučky DAgger pre implementované potrubí.

Je intervention rate iba jeden mínus success rate?

Nie. Sadzba meria koľko z behu ste prevzali; success rate meria, či sa úloha skončila bez vás. Beh môže uspieť s intervention rate 30 percent, a beh bez intervencií môže úplne zlyhať. Tiež sa líšia v šume: sadzba sa pohybuje hladko cez tisíc korelov rámcov, success rate skáče medzi hŕstkou binárnych výsledkov. Protokolovať oboje.

Koľko pokusov vyhodnocovania potrebujem, aby success rate znamenal čokoľvek?

Viac ako sa zdá rozumné. Podľa normálnej aproximácie, 20 pokusov pri skutočnej 60 percentnej success rate niesli štandardnú chybu blízku 11 percentným bodom, takže 10-bodový pohyb medzi kolami je nerozoznateľný od šumu; 50 pokusov prinášajú tú číslu približne 7. Ak si nemôžete dovoliť 50, udržiavajte počet pokusov rovnakých cez kolá a posudzujte malé pohyby ako nepresnivé.

Ako by som mal začať s pomerom demonštrácií ku korrekciám?

Zdokumentovaný štartovný bod je IWR: rozdeľte dáta na intervenčné a neinvenčné vzorky a kreslite ich v rovnakej proporcii, takže korrekcie prispieva polovice gradientu bez ohľadu na to, aká malá frakcia rámcov sú. Ak vaše nastavenie nemôže váhové vzorkovanie, aproximácia jej prostredníctvom počtov epizód pri zložení dataset a záznam pomerom. Tréning iba na korekcií je možnosť na vylúčenie.

Moja intervention rate sa po kole zvýšila. Je kolo zbytočné?

Nie nevyhnutne, ale skontrolujte nudné vysvetlenia najskôr: pokiaľ checkpoint, ktorý ste riadili, zodpovedal ten, ktorý ste trénovalo, zmenila sa kamera index alebo montáž, umiestnenie objektu sa posunulo, bol štýl korekcie konzistentný. Ak sú všetci štyri čistí a spárovaný success rate tiež padol, podozrievajte zmes – príliš málo základných demonštrácií oproti korrekciám, alebo korrekcie, ktoré si odporujú. Skutočná regresia patrí do denníka, nie do bin.

Môžem preskočiť mrazený protokol vyhodnocovania a iba sledovať intervention rate?

Iba ak prijmete, že nemôžete povedať zlepšenie z zvyknutia. Sadzba závisí od vašej vlastnej hranice v reálnom čase na vstup, a tá hranica klesá, ako sa zoznamujete s zvykami politiky. Mrazený protokol je časť merania vaša hranica nemôže dosiahnuť – páskované značky, napísaná domovská pozícia, fixný počet pokusov, kritérium rozhodol pred kolom. Musí zostať nezmenená cez sériu.

Zapamätajte si denník v úložisku, nie v notebooku: kolá sú dni od seba, hardvér sa prestaví, a osoba čítajúca krivku v októbri ste vy bez pamäti na august. dokumentácia FAQ sa týka operačných detailov vynechaných tu.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started