SO-100 lacný robotický rameno na stole, nastavené na teleoprácovanie a tréning politiky
DAggerSO-100Imitation LearningVLATeleoprácovanie

Spúšťanie DAgger Loop na SO-100 s VLA Policy

AY-Robots ResearchAugust 27, 2026Čítanie trvá 15 min

Detailný popis jedného ľudmi riadeného DAgger kola na ramene SO-100: spustite politiku a záznam, prevezme ju v prípade chyby, archivujte ako opravu, zložte zmiešaný dataset a pokračujte v tréningu z checkpointu. Obsahuje cestu prevzatia cez klávesnicu a posúvače pre ľudí bez vedúceho ramena a štyri chyby, ktoré robia kolo bezcenným.

Vaša politika beží. Dosahuje na kocku, zatvára chyť milimeter príliš skoro a pokračuje, akoby ju mala. Nič sa nechá chybou a žiadne množstvo pozerania sa na tréningovú stratu to nevysvetlí. Riešenie nie je ďalších 20 000 gradient krokov na rovnakých demonštráciách. Je to vrátenie rúk späť na rameno presne tam, kde ide nesprávne, záznam toho, čo ste urobili namiesto toho, a tréning ďalšieho checkpointu na starých dátach plus tej opravu. To je DAgger kolo a tu je spôsob, ako sa spúšťa na SO-100 s vision-language-action politikou.

Teória je inde: prečo dataset aggregation vôbec funguje a čo human gating zmení na tom. Toto je prevádzkovacia príručka, a predpokladá natrénovaný checkpoint, pracovnú sadu kamery a rameno, ktoré sa pohybuje. Šesť krokov nižšie sú slučka tak, ako je implementovaná na stránke DAgger tejto platformy, ale poradie je rovnaké z vašich vlastných skriptov.

Jedno kolo v skratke

  • Spustite natrénovanú politiku a záznam, s textom úlohy kola namiesto obecného teleoprácovacieho štítka.
  • Prevezme ju v momente, keď sa správanie pokazí: зеркальный handover s vedúcim ramenom, okamžitý a manuálny cez klávesnicu alebo posúvače bez jedného.
  • Triáž každého kola: archivujte ako opravu, udržiavajte ako epizódu vyhodnotenia alebo zaraďte.
  • Zložte zmes ručne - pôvodné demonštrácie plus opravy, epizódy vybrané podľa zdroja. Nikdy netrénujte len na opravách.
  • Pokračujte v tréningu z posledného checkpointu a poznamenajte si, ktorý checkpoint vytvoril ktorú zmes.
  • Číslo, ktoré hovorí, či bolo kolo niečo wert, je intervention rate, nie tréninková strata.

Prečo druhé kolo nie je len viac údajov

Behavior cloning tréni na stavoch, ktoré navštívil človek. V čase testu politika navštevuje stavy, ktoré spôsobuje, a malé chyby akcií sa zložitosti do stavov, ktoré demonštrácia nikdy nepokryla. Ross, Gordon a Bagnell formalizovali tú chybu na AISTATS 2011 a odpovedali algoritmu, ktorý tréni stacionárnu deterministickú politiku a pod ich redukciou sa musí správať dobre pod stavovej distribúcie, ktorú indukuje: spustite súčasnú politiku, nechajte experta označiť stavy, ktoré skutočne dosiahla, pridajte ich do datasetu, pretrénujte, opakujte. Kelly et al. urobili query praktické s HG-DAgger, kde sa človek rozhoduje, kedy prevziať kontrolu namiesto označovania stavov bez držania ovládačov; hlásia zlepšenú výkonnosť oproti DAgger a behavior cloning na simulovanej aj reálnej autonómnej jazdy. Human gating je to, čo robí slučku znesiteľnou na stole s ramenom - pohybujete rukami len vtedy, keď niečo ide nesprávne.

Dve následnosti sa v praxi zdajú byť viac dôležité ako teória. Opravy nie sú bežné demonštrácie: koncentrujú sa na kritických oblastiach, ktoré popisujú Mandlekar et al., kde malá odchýlka spustí politiku do stavov, ktoré demonštrácie nikdy nepokryli. A dataset vytvorený len z týchto ťažkých častí je zle formovaný dataset - Belkhale, Cui a Sadigh tvrdia z dátovej strany, že state diversity nie je vždy užitočný, a že action divergence a transition diversity spolu rozhodujú o kvalite datasetu. Zmiešaný dataset nie je kompromis, je to bod.

Zamrazte tieto pred prvým kolom

DAgger kolo porovnáva politiku so sebou v čase. Čokoľvek, čo zmeníte medzi kolami, čo nie je dataset, robí toto porovnanie bezpredmetným.

  • Pozície kamery a montážu, vrátane kamery na zápestí. Uvoľnite jednu svorku a zmenili ste distribúciu pozorovaní, nie politiku.
  • Expozícia a white balance, ak vám to umožňuje váš záchytný stack. Auto-expozícia pohyb medzi kolami je pomalá, neviditeľná domain shift.
  • Kalibrácia ramena a servo nulové pozície. Ak musíte rekalibrovať, považujte všetko zaznamenané pred tým za samostatný dataset.
  • Text úlohy. Každá VLA tu je podmienená; prepísanie uprostred slučky je iná úloha.
  • Osvetlenie, povrch stola, súbor objektov. Nový objekt je nový experiment, nie ďalšie kolo.
  • Frekvencia snímkования záznamu. Porovnávanie intervention rates naprieč dvoma vzorkovacími rastrami dáva rozdiely, ktoré pochádzajú z rastru.
Kamera na zápestí nie je voliteľný nábytok

Hsu et al. porovnali pohľad zameraný na ruku oproti obvyklému pohľadu tretej osoby a zistili, že perspektíva eye-in-hand konzistentne zlepšila efektívnosť tréningu a out-of-distribution generalizáciu, napriek menej videní scény. Na pätspojovom ramene je časovanie gripu zvyčajne to, čo vaše opravy opravujú, a gripy timing je to, čo nesiete v pohľade zápestia.

Kolo, koniec do konca

  1. 1
    Spustite inference a záznam

    Spustite beh proti checkpointu, ktorý chcete zlepšiť, potom spustite záznam do inference koreňa. Zaznamenaný takto dědí text úlohy samotného behu, čo je to, na čom bola politika trénovaná, namiesto predvoleného teleoprácovacieho štítka. Bez záznamu môžete sledovať chybu, ale nie ju trénovať.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Prevezme ju, keď sa pokazí

    Stlačte Take over a vyberte režim vstupu: vedúce rameno, klávesnica alebo posúvače. Runner sa pozastavuje, opravíte, vrátite. Snímky zaznamenané, kým ste viedli, sú automaticky označené ako intervencie.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Triáž epizódy

    Rozhodnite podľa epizódy: archivujte ako opravu, udržiavajte ako vyhodnotenie, alebo zaraďte. Beh, ktorý politika dokončila bez pomoci, je vyhodnocovací data.

  4. 4
    Synchronizujte dataset opravy

    Opravy sa zbierajú v lokálnom datasete podľa politiky a idú do cloudového úložiska automatickou synchronizáciou. Nič sa tam zmiešava, čo ste tam nepoložili.

  5. 5
    Zložte zmiešaný dataset

    Spojte pôvodný dataset s datasetom opravy, výberom epizód explicitne podľa zdroja. Výsledok je bežný dataset od tej chvíle ďalej.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Pokračujte v tréningu z checkpointu

    Trénujte zmes z predchádzajúceho checkpointu namiesto základného modelu. Poznamenajte si, ktorý checkpoint a ktorá zmes; bez tej dvojice kolo nie je reprodukovateľné.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Krok 2 v detailu: dva spôsoby prevzatia

S vedúcim ramenom

V leader-follower režime je prevzatie handover medzi dvoma ramenami, ktoré nie sú v rovnakej polohe. Stlačením Take over runner pozastavy a vedie vedúceho do aktuálnej polohy nasledujúceho, aby nič nevyskočilo, keď sa krútiaci moment prenáša. Ak je táto zarovnávacia jednotka vypršaná, zarovnajte vedúceho ručne a uvoľnite len po tom, čo sú obe v rámci piatich stupňov. Od tej chvíle ovládaš normálne a stĺpec akcií zaznamenáva to, čo si prikázal.

Buďte úprimní k tejto ceste: zarovnávacia jednotka a handover krútiaceho momentu sú najmenej testovaná časť slučky na skutočnom hardvéri. Pred spoľahnutím sa na handover v behu, na ktorom vám záleží, testujte na pomalej, neškodnej polohe. Vedúce rameno vytvára najhladšie opravy z troch módov a tiež má najviac, čo sa dá pokaziť mechanicky.

Bez vedúceho ramena: klávesnica a posúvače

Väčšina ľudí čítajúcich toto vlastní jedno rameno. Toho je dosť. Vyberte si vstup z klávesnice alebo posúvača v momente, keď stlačíte Take over, a prevzatie je okamžité a manuálne - nie je druhé rameno na zarovnanie, takže nie je žiadny zarovnávací krok. Nasledujúce udržuje svoju polohu a čaká na vstup.

Režim vstupuAko sa rameno pohybujeLimit per-call vynútený serveromZamknutý, keď
Vedúce ramenoZrkadlo vedie nasledujúceho z uhlov kĺbov vedúcehoŽiadne nudge alebo set volania v tomto režime; zrkadlo piše ciele nasledujúceho nepretržiteNikdy uzamknutý, a predvolený, ak nie je zadaný žiadny režim vstupu - ale potrebuje druhé rameno; bez vedúceho id je prevzatie odmietnuté
KlávesnicaRelatívna nudge za stlačenie klávesu, poslané na endpoint nudge prevzatiaTvrdá svorka pri 2 stupňoch na kĺb, 4 stupne na gripyOdmietnuté s 409, ak bolo prevzatie spustené v režime vedúceho
PosúvačeAbsolútna cieľová poloha, poslané na endpoint set prevzatiaNajviac 6 stupňov cestovného smerom k cieľu na voláni; rozhranie naďalej posiela približne desať krát za sekunduOdmietnuté s 409, ak bolo prevzatie spustené v režime vedúceho

Svorky sú vynútené na strane servera, nie v rozhraní, pretože chybne napísaná delta na ramene s busservom je zrážka. Klávesové opravy vychádzajú po krokoch a trochu hrubé; opravy posúvačov sú hladšie, pretože server ide k cieľu, zatiaľ čo rozhranie naďalej streamuje. V každom prípade stĺpec akcií prijíma plný prikázaný vektor polohy a označenie intervencie je identické ako v režime vedúceho, takže klávesové opravy pristávajú v rovnakom datasete bez formátovacieho rozdielu.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Rovnaké rozloženie klávesu ako všade inde v stacku, takže svalová pamäť z záznamu sa prenáša.
Tréningovým sprievodcom zobrazujúcim zoradené kroky GR00T fine-tuning behu na SO-100 datasete
Tréninková strana kola je rovnaká vedená sekvencia ako prvý beh; líši sa len poľom checkpoint.

Kedy stlačiť tlačidlo

Skôr ako neskôr. Oprava, ktorá sa spustí potom, čo sa gripy zavrel na nič, učí zotavenie sa z chyby, do ktorej by politika nemala vstúpiť, a údaje o zotavení sa majú ďaleko menej ceny ako údaje o vyhýbaní. Prerušte v prvom okamihu, keď ste si istí, že trajektória je nesprávna, opravte cez ťažkú časť, vrátite hneď, ako je stav jeden, ktorý politika zvládla predtým. ThriftyDAgger automatizuje toto rozhodnutie bránením intervenciám na novosti a odhadovanom riziku za pevného ľudského rozpočtu, ale na jednom ramene s človekom, ktorý už pozerá, je ľudská brána lacnejšia a lepšie kalibrovaná ako čokoľvek, čo budete ladiť.

Možné s otvorenkodovým stackom a pár skriptmi. Čo to stojí, je účtovnictvo, a účtovnictvo je miesto, kde DAgger kolá zomrú.

  1. Napíšte snímky z vlastného inference skriptu do LeRobot datasetu s reťazcom úlohy, na ktorom bola politika trénovaná.
  2. Pozastavte smyčku politiky, prepnite zdroj príkazov a označte každý snímok, ktorý vedete, ako intervenciu. Bez príznaku vyzerajú opravy ako bežné demonštrácie.
  3. Намеренно sa rozhodnite, čo sa stane s prechodovými snímkami medzi uvoľnením kontroly politikou a vašim prvým vstupom.
  4. Udržiavajte opravy v ich vlastnom datasete podľa politiky a sledujte indexy epizód ručne, aby bola zmes reprodukovateľná.
  5. Nasmerojte vstupný bod fine-tuningu na predchádzajúci checkpoint a skontrolujte v zázname, že načítaval tieto váhy.

Krok 3 v detailu: triáž rozhoduje o kvalite

Po behu máte záznam s niektorými snímkami označenými ako intervencie. Tri cieľové miesta existujú a nesprávne ticho otrávi ďalšie kolo.

  • Archivujte ako opravu, keď bola intervencia skutočným riešením: politika smerovala niekam nesprávne a váš vstup ukázal správnu vec zo stavu, ktorý samotná politika vytvorila.
  • Udržiavajte ako vyhodnotenie čistých autonómnych behov a behov, ktoré ste prevzali z opatrnosti. Vyhodnocovací epizódy sú ako meriate ďalší checkpoint a nikdy sa nemajú trénovať.
  • Zaraďte behy zničené niečím nesúvisiacim - preklopeným snímkom kamery, staleným servom, objektom, ktorý ste náhodne zvrhli. Zmiešaná oprava je horšia ako žiadna oprava.
Freeze frames patria do surového záznamu, nie do tréningových údajov

Medzi uvoľnením kontroly politikou a vašim prvým vstupom rameno stojí na mieste, zatiaľ čo záznamník piše - beh identických pozícií spárovaných s mierne odlišnými obrazmi. Tu tie handover snímky zostávajú v surovanom zázname a von z datasetu opravy. Ak si budujete slučku sám, odrežte ich zámerne: politika trénovaná na nich sa naučí pozastaviť, kde by mala konať.

Krok 5 v detailu: skladanie zmesi

Zloženie vezme pôvodný dataset plus dataset opravy a vytvorí nový, bežný LeRobot dataset ktorý sa tréni ako akýkoľvek iný. Dôležitá vlastnosť je, že výber epizódy je explicitný podľa zdroja - nič sa nie je automaticky zmesené. Znie to nepatrne, kým prvýkrát sa politika chová čudne a musíte rekonštruovať, na čom bola trénovaná.

Otvoreným otázkou je pomer a nikto nemá číslo, ktoré by sa prenášalo. Čo literatúra súhlasí je, že opravy by mali počítať viac ako ich časový podiel. Mandlekar et al. pretrénujú iteratívne na údajoch, ktoré ich systém intervencie zbiera, aby sa politika naučila prechádzať cez úzke miesta, a správu, že agenti trénovaní takto prekročia agentov trénovaných na ekvivalentnom počte vzoriek od non-intervencional demonstratorov. Sirius ide ďalej a zaaže vzorky tréningu podľa aproximovanej ľudskej dôvery, správu o 8 percentuálnom zisku v simulácii a 27 percentiálny na skutočnom hardvéri v poberateľnosti politiky proti metódam, s ktorými sa porovnáva, o dvojnásobnej rýchlosti konvergencie. Žiadny z vstupných bodov tréningu tu nedostane vzork-vážiace tlačítko, takže surový náhrada je, aby ste udržali každú opravnú epizódu, zatiaľ čo subsampluje pôvodné demonštrácie - a napíšte, čo ste urobili.

Pohľad na záznam datasetu zobrazujúci epizódy SO-100 datasetu s video prúdmi kamery
Opravné epizódy sú bežné epizódy s príznaku intervencie per-frame, takže sa zložitia s pôvodným datasetom bez konverzie.

Krok 6 v detailu: čo pokračovanie z checkpointu skutočne znamená

Tréning zmesi zo základného modelu funguje, ale vyhodí predchádzajúce kolo a stojí plný beh. Pokračovanie z predchádzajúceho checkpoint je rýchlejšie a zvyčajne lepšie. Je tiež obmedzenejšie ako veta naznačuje.

Inicializácia váh nie je optimizer resume

Checkpoint iba s váhami obsahuje parametre a nič iné. Načítanie mu dáva nasledujúcemu behu lepší východný bod ako základný model, ale okamihy optimizátora, pozícia plánu učenia a poradie údajov všetci začínajú od nuly. Očakávajte stratu na začiatku pokračovacieho behu, nečítajte to ako zlyhanie a nevolaťte kolo resume. Je to teplý štart.

PolitikaVeľkosťGPU tierInference na krok akcieFormát datasetuEpizódy, kým nie je väčší pokus
GR00T N1.7približne 3 B, približne 40 M trénované počas fine-tuninguA100 80 GB alebo H100 80 GBpribližne 152 msLeRobot v2.0 alebo v2.150
GR00T N1.5približne 3 BA100 80 GB alebo H100 80 GBpribližne 165 msLeRobot v2.0 alebo v2.150
Pi0.5približne 3 B na PaliGemma backboneA100 80 GB alebo H100 80 GBpribližne 485 msLeRobot v3.050
SmolVLApribližne 450 MRTX 4090 alebo akákoľvek 24 GB kartapribližne 245 msLeRobot v3.030
ACTpribližne 80 M, trénované od začiatkuRTX 4090 alebo akákoľvek 24 GB kartapribližne 20 msLeRobot v3.050

Latencia sa skladá v DAgger slučke spôsobom, akým to nie je počas demo: pri približne 485 ms za krok akcie prevzaté, pretože rameno váhalo, nie pretože to bolo nesprávne, a váhavosť opravy nie je užitočné tréningovými údajmi. Ak opakujete na údajoch skôr ako sa čeňa poslednej úspešnosti, opakujte na rýchlom modeli. Shukor et al. popisujú SmolVLA ako navrhnuté na tréning na jednom GPU a nasadenie na spotrebiteľskych GPU alebo CPU, s asynchrónnym stackom inference, ktorý odpája predpovedanie akcií od vykonávania, aby umožňoval vyššie rýchlosti ovládania - vlastnosť, ktorá udržuje slučku prevzatia reaktívnu.

Formáty datasetov nie sú vzájomne zameniteľné. GR00T vezme LeRobot v2.0 alebo v2.1, a Isaac-GR00T úložisko popisuje vstup ako chute LeRobot v2 formátu s pridaným súborom popisu modality; novší tréner tu očakáva v3.0. Zmes zložená v nesprávnej verzii zlyhá pri zavádzaní spôsobom, ako vytvára zlú politiku - lepší režim zlyhania, stále zmätený slot frontu. dokumentácia datasetu uvádza, ktorý formát každý tréner vezme.

Slučka, s účtovnictvom už hotovým

Prevzatie s vedúcim ramenom, klávesnicou alebo posúvačmi; označenie intervencie per-frame; archivovanie behov ako opravy alebo vyhodnotenia; zloženie zmiešaného datasetu s explicitným výberom epizódy podľa zdroja; a pokračovanie tréningu z checkpointu namiesto základného modelu. Čo ostáva vaším rozhodnutím je, ktoré kolo sa počíta ako oprava, čo ide do zmesi a kedy intervention rate prestal padať.

Pozrite si, ako je DAgger slučka zapojená

Štyri spôsoby, ako premrhať kolo

1. Tréning len na opravách

Najčastejšie zlyhanie a najväčšia pokušenie skrátenia. Dataset iba s opravami je takmer celý ťažký stred úlohy, s príchodom a ústupom chýbajúcim; politika sa zlepší na ťažkej časti a zabudne, ako sa tam dostať. Agregácia nie je detail implementácie metódy, je to mechanizmus: staré údaje sú to, čo udržuje zvyšok správania na mieste, zatiaľ čo opravy pohybujú jednou časťou.

2. Pohyb kamery medzi kolami

Kamera, ktorá sa posúva dva centimetre medzi kolami, vytvára politiku horší ako tá, s ktorou ste začali, a diagnostiku, ktorá stojí deň. Každá VLA tu je podmienená na obrázky; stavový kĺb sám nedisambiguous, kde je objekt. Fotografujte nastavenie pred prvým kolom a skontrolujte túto fotografiu pred každou neskôr.

3. Nechanie handover artefaktov do tréningu

Pokryté vyššie a na zozname, pretože je neviditeľné. Príznaky je politika, ktorá sa zastaví na zlomok sekundy presne tam, kde operátor predchádzajúceho kola prevzal. Vyzerá to ako váhavosť; je to imitácia.

4. Volanie teplého štartu resume

Ak sa domnievate, že stav optimizátora sa preniesol, počiatočná strata spike sa javí ako chyba a idete na lov po poškodených údajoch. Ak viete, že optimizátor sa spustil sviežo, kolík je očakávaný a pozeráte sa na to, čo po ňom nasleduje. Rovnaké čísla, opačné závery.

Meranie kola

Metrika pre ľudskou-brananú slučku je intervention rate: snímky zaznamenané, kým ste boli v kontrole, delené celkovými snímkami behu. Je to v stave prevzatia a je to jediné číslo, ktoré odpovedá na otázku, ktorú kolo položilo. Tréninková strata klesá bez ohľadu na to, či sa politika zlepšila; úspešnosť je binárna a hlučná pri veľkostiach vzoriek, ktoré rameno na stole produkuje. Intervention rate je nepretržitá, meraná na stavoch, ktoré politika sama spôsobila, a klesá, keď ju politika potrebuje menej.

Porovnajte to len v behoch zaznamenaných v identických podmienkach. Úplný argument a ako vytvoriť súbor vyhodnotenia, ktorý prežije viac ako dve kolá, je v článku o meraní DAgger slučky. Prvé kolo je realisticky test uskutočniteľnosti: kontrolujete, že prevzatie funguje na vašom hardvéri, že opravy pristávajú so svojimi príznakmi a že pokračovací beh načítaval checkpoint, ktorý ste pomenovali. Kolá dva a tri sú miesta, kde by sa sadzba mala začať pohybovať. Ak sa do štvrtého kola nepohybovalo, problém je upstream z DAgger.

Napíšte dolu podľa kolaPrečo to neskôr záleží
Checkpoint, ktorý bol jazdenýBez neho nemôžete pripísať zlepšenie zmesi
Režim vstupu použitý pre prevzatieKlávesové opravy sú hrubšie ako vedúce opravy a je vidieť v údajoch
Počet behov a ako každé bolo triážČi malo kolo dosť opravy, aby malo vážnosť
Intervention rate za beh a priemerMetrика pokroku slučky
Presný výber epizódy podľa zdrojaJediný spôsob, ako reprodukovať alebo zrušiť kolo
Teplý štart alebo čerstvý tréningVysvetľuje krivku straty, na ktorú budete pozerať za týždeň

Ak ešte nemáte checkpoint

Slučka nemá vstupný bod bez jedného. Zaznamenajte prvý dataset, trénujte prvú politiku, spustite ho - záznam, tréning a spustenie politiky pokrývajú túto cestu. Záznamnícky klient je na stránke sťahovania, GPU tier a hodinové sadzby na stránke cien, a čo vyzerá ako použiteľná epizóda v sprievodcu zberom údajov SO-100. Skôr ako opravy získajte demonštrácie správne: DAgger je oprávný mechanizmus a funguje ďaleko lepšie na niečom, čo bolo takmer správne.

Môžem spúšťať DAgger slučku bez vedúceho ramena?

Áno. Zvoľte si vstup z klávesnice alebo posúvača, keď stlačíte Take over: prevzatie je okamžité a manuálne, bez druhého ramena na zarovnanie. Klávesnica posiela relatívne nudge, ktoré server hard upáva na 2 stupňoch na kĺb a 4 pre gripy; posúvače posielajú absolútny cieľ a server sa posúva najviac 6 stupňov smerom k nemu na voláni, kým rozhranie naďalej streamuje. Stĺpec akcií a označenie intervencie sú rovnaké ako v režime vedúceho, takže opravy sú v datasete nerozlíšiteľné.

Koľko opravy potrebuje jedno kolo?

Neexistuje obhájiteľné univerzálne číslo a počet snímkov sa počíta viac ako počet epizód. Pracovné pravidlo je, že opravy nesmú byť stratené v zmesi: s 200 originálnymi epizódami a troma opravnými epizódami sa nič nepohne. Zamerajte sa na opravy, ktoré pokrývajú zlyhajúce správanie z niekoľkých počiatočných konfigurácií skôr ako tri opakovania rovnakého záchranu.

Prečo je tréning len na opravách taká zlá myšlienka?

Pretože opravy sú takmer celý ťažký stred úlohy. Príchod, zarovnanie a ústup chýbajú, takže politika stratí to, čo už dobre urobila, zatiaľ čo sa zlepší v časti, ktorú ste opravili. Udržiavanie starých údajov a pridávanie k nemu je samotný mechanizmus, nie voliteľný extra.

Znamená pokračovanie z checkpointu obnovenie predchádzajúceho tréningového behu?

Nie. Checkpoint iba s váhami obnovuje parametre a nič iné: okamihy optimizátora, pozícia plánu učenia a poradie údajov sa spúšťajú sviežo. Je to teplý štart a počiatočná strata spike je skôr očakávaná ako príznak. Napíšte si, ktorý z nich ste skutočne urobili, aby ste krivku správne čítali o týždeň neskôr.

Čo ak intervention rate nepadá?

Prestať pridávať kolá. Plochá sadzba znamená, že opravy neurčujú, čo si myslíte. Obvyklé príčiny sú upstream: kamera sa pohybovala, opravy sa spúšťajú príliš neskoro, aby boli údajmi o vyhýbaní, handover snímky sú v tréningovej sade, alebo úloha je podurčená z pozorovaní, ktoré politika skutočne dostáva.

Nič z toho nie je vyriešený problém a nič z toho nie je jeden klik. Interaktívne učenie imitácie je aktívna oblasť výskumu presne preto, lebo jej otázky - kedy vstúpiť, ako vážiť to, čo čin urobil, koľko starých údajov udržať - nemajú usadené odpovede; prieskum od Celemin et al. mapuje to, čo je stále otvorené. Čo slučka má, je merateľná konvergencia, keď je vedené opatrne, na hardvéri, ktorý stojí pár stoviek eur. Zamrazte nastavenie, vstúpte skoro, triáž úprimne, zložite zámerne a zaznamenajte intervention rate zakaždým.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started