
Detailný popis jedného ľudmi riadeného DAgger kola na ramene SO-100: spustite politiku a záznam, prevezme ju v prípade chyby, archivujte ako opravu, zložte zmiešaný dataset a pokračujte v tréningu z checkpointu. Obsahuje cestu prevzatia cez klávesnicu a posúvače pre ľudí bez vedúceho ramena a štyri chyby, ktoré robia kolo bezcenným.
Vaša politika beží. Dosahuje na kocku, zatvára chyť milimeter príliš skoro a pokračuje, akoby ju mala. Nič sa nechá chybou a žiadne množstvo pozerania sa na tréningovú stratu to nevysvetlí. Riešenie nie je ďalších 20 000 gradient krokov na rovnakých demonštráciách. Je to vrátenie rúk späť na rameno presne tam, kde ide nesprávne, záznam toho, čo ste urobili namiesto toho, a tréning ďalšieho checkpointu na starých dátach plus tej opravu. To je DAgger kolo a tu je spôsob, ako sa spúšťa na SO-100 s vision-language-action politikou.
Teória je inde: prečo dataset aggregation vôbec funguje a čo human gating zmení na tom. Toto je prevádzkovacia príručka, a predpokladá natrénovaný checkpoint, pracovnú sadu kamery a rameno, ktoré sa pohybuje. Šesť krokov nižšie sú slučka tak, ako je implementovaná na stránke DAgger tejto platformy, ale poradie je rovnaké z vašich vlastných skriptov.
Jedno kolo v skratke
- •Spustite natrénovanú politiku a záznam, s textom úlohy kola namiesto obecného teleoprácovacieho štítka.
- •Prevezme ju v momente, keď sa správanie pokazí: зеркальный handover s vedúcim ramenom, okamžitý a manuálny cez klávesnicu alebo posúvače bez jedného.
- •Triáž každého kola: archivujte ako opravu, udržiavajte ako epizódu vyhodnotenia alebo zaraďte.
- •Zložte zmes ručne - pôvodné demonštrácie plus opravy, epizódy vybrané podľa zdroja. Nikdy netrénujte len na opravách.
- •Pokračujte v tréningu z posledného checkpointu a poznamenajte si, ktorý checkpoint vytvoril ktorú zmes.
- •Číslo, ktoré hovorí, či bolo kolo niečo wert, je intervention rate, nie tréninková strata.
Prečo druhé kolo nie je len viac údajov
Behavior cloning tréni na stavoch, ktoré navštívil človek. V čase testu politika navštevuje stavy, ktoré spôsobuje, a malé chyby akcií sa zložitosti do stavov, ktoré demonštrácia nikdy nepokryla. Ross, Gordon a Bagnell formalizovali tú chybu na AISTATS 2011 a odpovedali algoritmu, ktorý tréni stacionárnu deterministickú politiku a pod ich redukciou sa musí správať dobre pod stavovej distribúcie, ktorú indukuje: spustite súčasnú politiku, nechajte experta označiť stavy, ktoré skutočne dosiahla, pridajte ich do datasetu, pretrénujte, opakujte. Kelly et al. urobili query praktické s HG-DAgger, kde sa človek rozhoduje, kedy prevziať kontrolu namiesto označovania stavov bez držania ovládačov; hlásia zlepšenú výkonnosť oproti DAgger a behavior cloning na simulovanej aj reálnej autonómnej jazdy. Human gating je to, čo robí slučku znesiteľnou na stole s ramenom - pohybujete rukami len vtedy, keď niečo ide nesprávne.
Dve následnosti sa v praxi zdajú byť viac dôležité ako teória. Opravy nie sú bežné demonštrácie: koncentrujú sa na kritických oblastiach, ktoré popisujú Mandlekar et al., kde malá odchýlka spustí politiku do stavov, ktoré demonštrácie nikdy nepokryli. A dataset vytvorený len z týchto ťažkých častí je zle formovaný dataset - Belkhale, Cui a Sadigh tvrdia z dátovej strany, že state diversity nie je vždy užitočný, a že action divergence a transition diversity spolu rozhodujú o kvalite datasetu. Zmiešaný dataset nie je kompromis, je to bod.
Zamrazte tieto pred prvým kolom
DAgger kolo porovnáva politiku so sebou v čase. Čokoľvek, čo zmeníte medzi kolami, čo nie je dataset, robí toto porovnanie bezpredmetným.
- Pozície kamery a montážu, vrátane kamery na zápestí. Uvoľnite jednu svorku a zmenili ste distribúciu pozorovaní, nie politiku.
- Expozícia a white balance, ak vám to umožňuje váš záchytný stack. Auto-expozícia pohyb medzi kolami je pomalá, neviditeľná domain shift.
- Kalibrácia ramena a servo nulové pozície. Ak musíte rekalibrovať, považujte všetko zaznamenané pred tým za samostatný dataset.
- Text úlohy. Každá VLA tu je podmienená; prepísanie uprostred slučky je iná úloha.
- Osvetlenie, povrch stola, súbor objektov. Nový objekt je nový experiment, nie ďalšie kolo.
- Frekvencia snímkования záznamu. Porovnávanie intervention rates naprieč dvoma vzorkovacími rastrami dáva rozdiely, ktoré pochádzajú z rastru.
Hsu et al. porovnali pohľad zameraný na ruku oproti obvyklému pohľadu tretej osoby a zistili, že perspektíva eye-in-hand konzistentne zlepšila efektívnosť tréningu a out-of-distribution generalizáciu, napriek menej videní scény. Na pätspojovom ramene je časovanie gripu zvyčajne to, čo vaše opravy opravujú, a gripy timing je to, čo nesiete v pohľade zápestia.
Kolo, koniec do konca
- 1Spustite inference a záznam
Spustite beh proti checkpointu, ktorý chcete zlepšiť, potom spustite záznam do inference koreňa. Zaznamenaný takto dědí text úlohy samotného behu, čo je to, na čom bola politika trénovaná, namiesto predvoleného teleoprácovacieho štítka. Bez záznamu môžete sledovať chybu, ale nie ju trénovať.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Prevezme ju, keď sa pokazí
Stlačte Take over a vyberte režim vstupu: vedúce rameno, klávesnica alebo posúvače. Runner sa pozastavuje, opravíte, vrátite. Snímky zaznamenané, kým ste viedli, sú automaticky označené ako intervencie.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Triáž epizódy
Rozhodnite podľa epizódy: archivujte ako opravu, udržiavajte ako vyhodnotenie, alebo zaraďte. Beh, ktorý politika dokončila bez pomoci, je vyhodnocovací data.
- 4Synchronizujte dataset opravy
Opravy sa zbierajú v lokálnom datasete podľa politiky a idú do cloudového úložiska automatickou synchronizáciou. Nič sa tam zmiešava, čo ste tam nepoložili.
- 5Zložte zmiešaný dataset
Spojte pôvodný dataset s datasetom opravy, výberom epizód explicitne podľa zdroja. Výsledok je bežný dataset od tej chvíle ďalej.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Pokračujte v tréningu z checkpointu
Trénujte zmes z predchádzajúceho checkpointu namiesto základného modelu. Poznamenajte si, ktorý checkpoint a ktorá zmes; bez tej dvojice kolo nie je reprodukovateľné.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Krok 2 v detailu: dva spôsoby prevzatia
S vedúcim ramenom
V leader-follower režime je prevzatie handover medzi dvoma ramenami, ktoré nie sú v rovnakej polohe. Stlačením Take over runner pozastavy a vedie vedúceho do aktuálnej polohy nasledujúceho, aby nič nevyskočilo, keď sa krútiaci moment prenáša. Ak je táto zarovnávacia jednotka vypršaná, zarovnajte vedúceho ručne a uvoľnite len po tom, čo sú obe v rámci piatich stupňov. Od tej chvíle ovládaš normálne a stĺpec akcií zaznamenáva to, čo si prikázal.
Buďte úprimní k tejto ceste: zarovnávacia jednotka a handover krútiaceho momentu sú najmenej testovaná časť slučky na skutočnom hardvéri. Pred spoľahnutím sa na handover v behu, na ktorom vám záleží, testujte na pomalej, neškodnej polohe. Vedúce rameno vytvára najhladšie opravy z troch módov a tiež má najviac, čo sa dá pokaziť mechanicky.
Bez vedúceho ramena: klávesnica a posúvače
Väčšina ľudí čítajúcich toto vlastní jedno rameno. Toho je dosť. Vyberte si vstup z klávesnice alebo posúvača v momente, keď stlačíte Take over, a prevzatie je okamžité a manuálne - nie je druhé rameno na zarovnanie, takže nie je žiadny zarovnávací krok. Nasledujúce udržuje svoju polohu a čaká na vstup.
| Režim vstupu | Ako sa rameno pohybuje | Limit per-call vynútený serverom | Zamknutý, keď |
|---|---|---|---|
| Vedúce rameno | Zrkadlo vedie nasledujúceho z uhlov kĺbov vedúceho | Žiadne nudge alebo set volania v tomto režime; zrkadlo piše ciele nasledujúceho nepretržite | Nikdy uzamknutý, a predvolený, ak nie je zadaný žiadny režim vstupu - ale potrebuje druhé rameno; bez vedúceho id je prevzatie odmietnuté |
| Klávesnica | Relatívna nudge za stlačenie klávesu, poslané na endpoint nudge prevzatia | Tvrdá svorka pri 2 stupňoch na kĺb, 4 stupne na gripy | Odmietnuté s 409, ak bolo prevzatie spustené v režime vedúceho |
| Posúvače | Absolútna cieľová poloha, poslané na endpoint set prevzatia | Najviac 6 stupňov cestovného smerom k cieľu na voláni; rozhranie naďalej posiela približne desať krát za sekundu | Odmietnuté s 409, ak bolo prevzatie spustené v režime vedúceho |
Svorky sú vynútené na strane servera, nie v rozhraní, pretože chybne napísaná delta na ramene s busservom je zrážka. Klávesové opravy vychádzajú po krokoch a trochu hrubé; opravy posúvačov sú hladšie, pretože server ide k cieľu, zatiaľ čo rozhranie naďalej streamuje. V každom prípade stĺpec akcií prijíma plný prikázaný vektor polohy a označenie intervencie je identické ako v režime vedúceho, takže klávesové opravy pristávajú v rovnakom datasete bez formátovacieho rozdielu.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Kedy stlačiť tlačidlo
Skôr ako neskôr. Oprava, ktorá sa spustí potom, čo sa gripy zavrel na nič, učí zotavenie sa z chyby, do ktorej by politika nemala vstúpiť, a údaje o zotavení sa majú ďaleko menej ceny ako údaje o vyhýbaní. Prerušte v prvom okamihu, keď ste si istí, že trajektória je nesprávna, opravte cez ťažkú časť, vrátite hneď, ako je stav jeden, ktorý politika zvládla predtým. ThriftyDAgger automatizuje toto rozhodnutie bránením intervenciám na novosti a odhadovanom riziku za pevného ľudského rozpočtu, ale na jednom ramene s človekom, ktorý už pozerá, je ľudská brána lacnejšia a lepšie kalibrovaná ako čokoľvek, čo budete ladiť.
Možné s otvorenkodovým stackom a pár skriptmi. Čo to stojí, je účtovnictvo, a účtovnictvo je miesto, kde DAgger kolá zomrú.
- Napíšte snímky z vlastného inference skriptu do LeRobot datasetu s reťazcom úlohy, na ktorom bola politika trénovaná.
- Pozastavte smyčku politiky, prepnite zdroj príkazov a označte každý snímok, ktorý vedete, ako intervenciu. Bez príznaku vyzerajú opravy ako bežné demonštrácie.
- Намеренно sa rozhodnite, čo sa stane s prechodovými snímkami medzi uvoľnením kontroly politikou a vašim prvým vstupom.
- Udržiavajte opravy v ich vlastnom datasete podľa politiky a sledujte indexy epizód ručne, aby bola zmes reprodukovateľná.
- Nasmerojte vstupný bod fine-tuningu na predchádzajúci checkpoint a skontrolujte v zázname, že načítaval tieto váhy.
Rovnakých šesť krokov existuje ako tlačidlá. Čo je automatizované, je to, čo sa ľahko pokazí ručne: príznaky intervencie per-frame, rozdelenie medzi opravy a vyhodnotenia a záznam toho, ktorý checkpoint vytvoril ktorú zmes. Nič nevstúpi do zloženého datasetu, ktorý ste nevybral.
Nerozhoduje sa za vás. Ktoré kolo sa počíta ako oprava, ktoré epizódy idú do zmesi a kedy bola intervention rate prestať padať sú stále rozhodnutím. Polia sú zdokumentované pod tréning, vstupné režimy pod teleoprácovanie.
Krok 3 v detailu: triáž rozhoduje o kvalite
Po behu máte záznam s niektorými snímkami označenými ako intervencie. Tri cieľové miesta existujú a nesprávne ticho otrávi ďalšie kolo.
- Archivujte ako opravu, keď bola intervencia skutočným riešením: politika smerovala niekam nesprávne a váš vstup ukázal správnu vec zo stavu, ktorý samotná politika vytvorila.
- Udržiavajte ako vyhodnotenie čistých autonómnych behov a behov, ktoré ste prevzali z opatrnosti. Vyhodnocovací epizódy sú ako meriate ďalší checkpoint a nikdy sa nemajú trénovať.
- Zaraďte behy zničené niečím nesúvisiacim - preklopeným snímkom kamery, staleným servom, objektom, ktorý ste náhodne zvrhli. Zmiešaná oprava je horšia ako žiadna oprava.
Medzi uvoľnením kontroly politikou a vašim prvým vstupom rameno stojí na mieste, zatiaľ čo záznamník piše - beh identických pozícií spárovaných s mierne odlišnými obrazmi. Tu tie handover snímky zostávajú v surovanom zázname a von z datasetu opravy. Ak si budujete slučku sám, odrežte ich zámerne: politika trénovaná na nich sa naučí pozastaviť, kde by mala konať.
Krok 5 v detailu: skladanie zmesi
Zloženie vezme pôvodný dataset plus dataset opravy a vytvorí nový, bežný LeRobot dataset ktorý sa tréni ako akýkoľvek iný. Dôležitá vlastnosť je, že výber epizódy je explicitný podľa zdroja - nič sa nie je automaticky zmesené. Znie to nepatrne, kým prvýkrát sa politika chová čudne a musíte rekonštruovať, na čom bola trénovaná.
Otvoreným otázkou je pomer a nikto nemá číslo, ktoré by sa prenášalo. Čo literatúra súhlasí je, že opravy by mali počítať viac ako ich časový podiel. Mandlekar et al. pretrénujú iteratívne na údajoch, ktoré ich systém intervencie zbiera, aby sa politika naučila prechádzať cez úzke miesta, a správu, že agenti trénovaní takto prekročia agentov trénovaných na ekvivalentnom počte vzoriek od non-intervencional demonstratorov. Sirius ide ďalej a zaaže vzorky tréningu podľa aproximovanej ľudskej dôvery, správu o 8 percentuálnom zisku v simulácii a 27 percentiálny na skutočnom hardvéri v poberateľnosti politiky proti metódam, s ktorými sa porovnáva, o dvojnásobnej rýchlosti konvergencie. Žiadny z vstupných bodov tréningu tu nedostane vzork-vážiace tlačítko, takže surový náhrada je, aby ste udržali každú opravnú epizódu, zatiaľ čo subsampluje pôvodné demonštrácie - a napíšte, čo ste urobili.

Krok 6 v detailu: čo pokračovanie z checkpointu skutočne znamená
Tréning zmesi zo základného modelu funguje, ale vyhodí predchádzajúce kolo a stojí plný beh. Pokračovanie z predchádzajúceho checkpoint je rýchlejšie a zvyčajne lepšie. Je tiež obmedzenejšie ako veta naznačuje.
Checkpoint iba s váhami obsahuje parametre a nič iné. Načítanie mu dáva nasledujúcemu behu lepší východný bod ako základný model, ale okamihy optimizátora, pozícia plánu učenia a poradie údajov všetci začínajú od nuly. Očakávajte stratu na začiatku pokračovacieho behu, nečítajte to ako zlyhanie a nevolaťte kolo resume. Je to teplý štart.
| Politika | Veľkosť | GPU tier | Inference na krok akcie | Formát datasetu | Epizódy, kým nie je väčší pokus |
|---|---|---|---|---|---|
| GR00T N1.7 | približne 3 B, približne 40 M trénované počas fine-tuningu | A100 80 GB alebo H100 80 GB | približne 152 ms | LeRobot v2.0 alebo v2.1 | 50 |
| GR00T N1.5 | približne 3 B | A100 80 GB alebo H100 80 GB | približne 165 ms | LeRobot v2.0 alebo v2.1 | 50 |
| Pi0.5 | približne 3 B na PaliGemma backbone | A100 80 GB alebo H100 80 GB | približne 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | približne 450 M | RTX 4090 alebo akákoľvek 24 GB karta | približne 245 ms | LeRobot v3.0 | 30 |
| ACT | približne 80 M, trénované od začiatku | RTX 4090 alebo akákoľvek 24 GB karta | približne 20 ms | LeRobot v3.0 | 50 |
Latencia sa skladá v DAgger slučke spôsobom, akým to nie je počas demo: pri približne 485 ms za krok akcie prevzaté, pretože rameno váhalo, nie pretože to bolo nesprávne, a váhavosť opravy nie je užitočné tréningovými údajmi. Ak opakujete na údajoch skôr ako sa čeňa poslednej úspešnosti, opakujte na rýchlom modeli. Shukor et al. popisujú SmolVLA ako navrhnuté na tréning na jednom GPU a nasadenie na spotrebiteľskych GPU alebo CPU, s asynchrónnym stackom inference, ktorý odpája predpovedanie akcií od vykonávania, aby umožňoval vyššie rýchlosti ovládania - vlastnosť, ktorá udržuje slučku prevzatia reaktívnu.
Formáty datasetov nie sú vzájomne zameniteľné. GR00T vezme LeRobot v2.0 alebo v2.1, a Isaac-GR00T úložisko popisuje vstup ako chute LeRobot v2 formátu s pridaným súborom popisu modality; novší tréner tu očakáva v3.0. Zmes zložená v nesprávnej verzii zlyhá pri zavádzaní spôsobom, ako vytvára zlú politiku - lepší režim zlyhania, stále zmätený slot frontu. dokumentácia datasetu uvádza, ktorý formát každý tréner vezme.
Slučka, s účtovnictvom už hotovým
Prevzatie s vedúcim ramenom, klávesnicou alebo posúvačmi; označenie intervencie per-frame; archivovanie behov ako opravy alebo vyhodnotenia; zloženie zmiešaného datasetu s explicitným výberom epizódy podľa zdroja; a pokračovanie tréningu z checkpointu namiesto základného modelu. Čo ostáva vaším rozhodnutím je, ktoré kolo sa počíta ako oprava, čo ide do zmesi a kedy intervention rate prestal padať.
Pozrite si, ako je DAgger slučka zapojenáŠtyri spôsoby, ako premrhať kolo
1. Tréning len na opravách
Najčastejšie zlyhanie a najväčšia pokušenie skrátenia. Dataset iba s opravami je takmer celý ťažký stred úlohy, s príchodom a ústupom chýbajúcim; politika sa zlepší na ťažkej časti a zabudne, ako sa tam dostať. Agregácia nie je detail implementácie metódy, je to mechanizmus: staré údaje sú to, čo udržuje zvyšok správania na mieste, zatiaľ čo opravy pohybujú jednou časťou.
2. Pohyb kamery medzi kolami
Kamera, ktorá sa posúva dva centimetre medzi kolami, vytvára politiku horší ako tá, s ktorou ste začali, a diagnostiku, ktorá stojí deň. Každá VLA tu je podmienená na obrázky; stavový kĺb sám nedisambiguous, kde je objekt. Fotografujte nastavenie pred prvým kolom a skontrolujte túto fotografiu pred každou neskôr.
3. Nechanie handover artefaktov do tréningu
Pokryté vyššie a na zozname, pretože je neviditeľné. Príznaky je politika, ktorá sa zastaví na zlomok sekundy presne tam, kde operátor predchádzajúceho kola prevzal. Vyzerá to ako váhavosť; je to imitácia.
4. Volanie teplého štartu resume
Ak sa domnievate, že stav optimizátora sa preniesol, počiatočná strata spike sa javí ako chyba a idete na lov po poškodených údajoch. Ak viete, že optimizátor sa spustil sviežo, kolík je očakávaný a pozeráte sa na to, čo po ňom nasleduje. Rovnaké čísla, opačné závery.
Meranie kola
Metrika pre ľudskou-brananú slučku je intervention rate: snímky zaznamenané, kým ste boli v kontrole, delené celkovými snímkami behu. Je to v stave prevzatia a je to jediné číslo, ktoré odpovedá na otázku, ktorú kolo položilo. Tréninková strata klesá bez ohľadu na to, či sa politika zlepšila; úspešnosť je binárna a hlučná pri veľkostiach vzoriek, ktoré rameno na stole produkuje. Intervention rate je nepretržitá, meraná na stavoch, ktoré politika sama spôsobila, a klesá, keď ju politika potrebuje menej.
Porovnajte to len v behoch zaznamenaných v identických podmienkach. Úplný argument a ako vytvoriť súbor vyhodnotenia, ktorý prežije viac ako dve kolá, je v článku o meraní DAgger slučky. Prvé kolo je realisticky test uskutočniteľnosti: kontrolujete, že prevzatie funguje na vašom hardvéri, že opravy pristávajú so svojimi príznakmi a že pokračovací beh načítaval checkpoint, ktorý ste pomenovali. Kolá dva a tri sú miesta, kde by sa sadzba mala začať pohybovať. Ak sa do štvrtého kola nepohybovalo, problém je upstream z DAgger.
| Napíšte dolu podľa kola | Prečo to neskôr záleží |
|---|---|
| Checkpoint, ktorý bol jazdený | Bez neho nemôžete pripísať zlepšenie zmesi |
| Režim vstupu použitý pre prevzatie | Klávesové opravy sú hrubšie ako vedúce opravy a je vidieť v údajoch |
| Počet behov a ako každé bolo triáž | Či malo kolo dosť opravy, aby malo vážnosť |
| Intervention rate za beh a priemer | Metrика pokroku slučky |
| Presný výber epizódy podľa zdroja | Jediný spôsob, ako reprodukovať alebo zrušiť kolo |
| Teplý štart alebo čerstvý tréning | Vysvetľuje krivku straty, na ktorú budete pozerať za týždeň |
Ak ešte nemáte checkpoint
Slučka nemá vstupný bod bez jedného. Zaznamenajte prvý dataset, trénujte prvú politiku, spustite ho - záznam, tréning a spustenie politiky pokrývajú túto cestu. Záznamnícky klient je na stránke sťahovania, GPU tier a hodinové sadzby na stránke cien, a čo vyzerá ako použiteľná epizóda v sprievodcu zberom údajov SO-100. Skôr ako opravy získajte demonštrácie správne: DAgger je oprávný mechanizmus a funguje ďaleko lepšie na niečom, čo bolo takmer správne.
Môžem spúšťať DAgger slučku bez vedúceho ramena?▾
Áno. Zvoľte si vstup z klávesnice alebo posúvača, keď stlačíte Take over: prevzatie je okamžité a manuálne, bez druhého ramena na zarovnanie. Klávesnica posiela relatívne nudge, ktoré server hard upáva na 2 stupňoch na kĺb a 4 pre gripy; posúvače posielajú absolútny cieľ a server sa posúva najviac 6 stupňov smerom k nemu na voláni, kým rozhranie naďalej streamuje. Stĺpec akcií a označenie intervencie sú rovnaké ako v režime vedúceho, takže opravy sú v datasete nerozlíšiteľné.
Koľko opravy potrebuje jedno kolo?▾
Neexistuje obhájiteľné univerzálne číslo a počet snímkov sa počíta viac ako počet epizód. Pracovné pravidlo je, že opravy nesmú byť stratené v zmesi: s 200 originálnymi epizódami a troma opravnými epizódami sa nič nepohne. Zamerajte sa na opravy, ktoré pokrývajú zlyhajúce správanie z niekoľkých počiatočných konfigurácií skôr ako tri opakovania rovnakého záchranu.
Prečo je tréning len na opravách taká zlá myšlienka?▾
Pretože opravy sú takmer celý ťažký stred úlohy. Príchod, zarovnanie a ústup chýbajú, takže politika stratí to, čo už dobre urobila, zatiaľ čo sa zlepší v časti, ktorú ste opravili. Udržiavanie starých údajov a pridávanie k nemu je samotný mechanizmus, nie voliteľný extra.
Znamená pokračovanie z checkpointu obnovenie predchádzajúceho tréningového behu?▾
Nie. Checkpoint iba s váhami obnovuje parametre a nič iné: okamihy optimizátora, pozícia plánu učenia a poradie údajov sa spúšťajú sviežo. Je to teplý štart a počiatočná strata spike je skôr očakávaná ako príznak. Napíšte si, ktorý z nich ste skutočne urobili, aby ste krivku správne čítali o týždeň neskôr.
Čo ak intervention rate nepadá?▾
Prestať pridávať kolá. Plochá sadzba znamená, že opravy neurčujú, čo si myslíte. Obvyklé príčiny sú upstream: kamera sa pohybovala, opravy sa spúšťajú príliš neskoro, aby boli údajmi o vyhýbaní, handover snímky sú v tréningovej sade, alebo úloha je podurčená z pozorovaní, ktoré politika skutočne dostáva.
Nič z toho nie je vyriešený problém a nič z toho nie je jeden klik. Interaktívne učenie imitácie je aktívna oblasť výskumu presne preto, lebo jej otázky - kedy vstúpiť, ako vážiť to, čo čin urobil, koľko starých údajov udržať - nemajú usadené odpovede; prieskum od Celemin et al. mapuje to, čo je stále otvorené. Čo slučka má, je merateľná konvergencia, keď je vedené opatrne, na hardvéri, ktorý stojí pár stoviek eur. Zamrazte nastavenie, vstúpte skoro, triáž úprimne, zložite zámerne a zaznamenajte intervention rate zakaždým.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started