
Detaljno izveštavanje o jednoj DAgger rundi sa ljudskom kontrolom na SO-100 ruki: pokrenite politiku i snimite je, preuzimite je kada nešto krene naopako, obeležite trčanje kao ispravljanje, sastavite mešoviti skup podataka i nastavite obuku od kontrolne tačke. Uključuje putanju sa tastaturom i klizačima za ljude bez voditeljske ruke, kao i četiri greške koje čine rundu beskorisnom.
Vaša politika radi. Doseže kocku, zatvara zahvat centimetar preurano i nastavlja kao da je ima. Ništa se ne javlja kao greška, i nijedan obim gledanja na gubitak obuke ne objašnjava. Popravka nije još 20 000 koraka gradijenta na istim demonstracijama. To je vraćanje vaše ruke na ruku tačno gde ide naopako, snemanje šta ste umesto toga uradili, i obuka sledeće kontrolne tačke na starim podacima plus toj ispravci. To je DAgger runda, i evo kako se pokušava na SO-100 sa politikom vizije-jezika-akcije.
Teorija je drugdje: zašto agregacija skupa podataka uopće radi i šta ljudska kontrola menja kod toga. Ovo je priručnik za rad, i pretpostavlja obučenu kontrolnu tačku, radio kamere i ruku koja se kreće. Šest koraka ispod su petlja kao što je implementirana na DAgger stranica ove platforme, ali sekvenca je ista iz vaših sopstvenih skripti.
Jedna runda u kratko
- •Pokrenite obučenu politiku i snimite je, sa tekstom zadatka trčanja umesto opšte etikete teleoperacije.
- •Preuzimite čim ponašanje krene naopako: zrcalna predaja sa voditeljskom rukom, odmah i ručno preko tastature ili klizača bez nje.
- •Trijaž svako trčanje: klasifikujte ga kao ispravljanje, čuvajte ga kao epizodu evaluacije ili ga odbacite.
- •Sastavite mešavinu ručno - originalne demonstracije plus ispravke, epizode odabrane po izvoru. Nikada ne obučavajte samo na ispravkama.
- •Nastavite obuku od poslednje kontrolne tačke, i zabeležite koju kontrolnu tačku je stvorila koja mešavina.
- •Broj koji govori da li je runda bila vredna nečega je stopa intervencije, ne gubitak obuke.
Zašto druga runda nije samo više podataka
Kloniranje ponašanja obučava se na stanjima koja je čovjek posjetio. U vrijeme testiranja politika posjećuje stanja koja uzrokuje, a male greške u akciji se skupljaju u stanja koja ni jedna demonstracija nije pokrivala. Ross, Gordon i Bagnell su formalizirali tu grešku za AISTATS 2011 i odgovorili sa iterativnim algoritmom koji obučava determinističku politiku i, prema njihovoj redukciji, mora dobro funkcionisati pod distribucijom stanja koju inducirava: pokrenite trenutnu politiku, imajte eksperta da označava stanja koja je zaista dostigla, dodajte ih skupu podataka, ponovo obučite, ponovite. Kelly et al. su učinili upit praktičnim sa HG-DAggerom, gde čovek odlučuje kada preuzeti kontrolu umesto da označava stanja bez držanja kontrola; oni izveštavaju o poboljšanoj performansi i DAggerom i kloniranjem ponašanja na simuliranom i stvarnom autonomnom vožnjom. Ljudska kontrola je ono što čini petlju podnošljivom na stolu ruke - ruke vam se pomeraju samo kad nešto krene naopako.
Dvije posledice su važnije u praksi nego u teoriji. Ispravke nisu obične demonstracije: one se koncentruju u regijama uskih grla koje Mandlekar et al. opisuju, gde malo odstupanje spušta politiku u stanja koja demonstracije nikada nisu pokrivale. A skup podataka napravljen samo od tih teških delova je loše oblikovan skup podataka - Belkhale, Cui i Sadigh tvrde sa strane podataka da raznolikost stanja nije uvek korisna, i da divergencija akcije i raznolikost prelaza zajedno odlučuju kvalitet skupa podataka. Mešoviti skup podataka nije kompromis, on je suština.
Zamrznite ove pre prve runde
DAgger runda upoređuje politiku sa sobom kroz vreme. Sve što promenite između rundi koje nije skup podataka čini to poređenje besmislenim.
- Položaje i montaže kamera, uključujući kameru na zapešću. Otpustite jednu stezaljku i promenili ste distribuciju opažanja, ne politiku.
- Ekspozicija i balans belina, ako vam stek hvatanja dozvoljava da ih pričvrstite. Drift auto-ekspozicije između rundi je spora, nevidljiva promena domena.
- Kalibracijski arm i pozicije servo nule. Ako morate da rekalibrujete, tretiraite sve snimljeno pre toga kao odvojen skup podataka.
- Tekst zadatka. Svaka VLA ovdje uslovljava na njega; preformulacija tokom petlje je drugačiji zadatak.
- Osvetljenje, površina stola, skup objekata. Novi objekat je novi eksperiment, ne sledeća runda.
- Brzina kadriranja snimanja. Poređenje stopa intervencije kroz dva rastora uzorkovanja proizvodi razlike koje dolaze od rastera.
Hsu et al. su uporedili pogled fokusiran na ruku nasuprot običnom tercijskom pogledu i otkrili da perspektiva oka u ruci konzistentno poboljšava efikasnost obuke i uopštavanje van distribucije, uprkos tome što vidi manje scene. Na ruki od pet zglobova, vremenovanje zahvata je obično ono što vaše ispravke ispravka, i vremenovanje zahvata je ono što vidi zahvatač zapešća.
Runda, od kraja do kraja
- 1Pokrenite zaključivanje i snimite ga
Pokrenite trčanje nasuprot kontrolnoj tački koju želite da poboljšate, zatim pokrenite snimanje u koren zaključivanja. Snimljeno na taj način nasljeđuje tekst zadatka samog trčanja, što je ono na čemu je politika obučavana, umesto zadane etikete teleoperacije. Bez snimanja možete gledati grešku ali je ne možete obučavati.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Preuzimite kada krene naopako
Pritisnite Preuzimanje i odaberite režim unosa: voditeljska ruka, tastatura ili klizači. Trkač se pauzira, vi ispravljate, vraćate. Kadri snimljeni dok ste vozili označavaju se kao intervencije automatski.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Trijaž epizode
Odlučite po epizodi: klasifikujte kao ispravljanje, čuvajte kao evaluaciju, ili odbacite. Trčanje koje je politika završila bez pomoći je evaluacijski podatak.
- 4Sinhronizujte skup podataka za ispravljanje
Ispravke se skupljaju u lokalni skup podataka po politici i odlaze u skladište u oblaku kroz automatsku sinhronizaciju. Ništa se ne meša što niste tamo stavili.
- 5Sastavite mešoviti skup podataka
Kombinujte originalni skup podataka sa skupom podataka za ispravke, eksplicitno biraju epizode po izvoru. Rezultat je obični skup podataka od tada napred.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Nastavite obuku od kontrolne tačke
Obučite mešavinu od prethodne kontrolne tačke umesto osnovnog modela. Zabeležite koju kontrolnu tačku i koju mešavinu; bez tog para runda nije ponovljiva.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Korak 2 detaljno: dva načina preuzimanja
Sa voditeljskom rukom
U voditeljskom-sledbeniku režimu preuzimanje je predaja između dve ruke koje nisu u istoj pozi. Pritiskanjem Preuzimanja trkač se pauzira i vodi vođenja na trenutnu pozu sledbenika, tako da se ništa ne skoči kada se moment prenese. Ako ta vožnja poravnanja vremenski istekne, ručno poravnate vođenje i oslobađate samo kad su dva u pet stepeni. Od tada teleoperujete normalno i kolona akcije beleži šta ste naručili.
Budite pošten o ovoj putanji: vožnja poravnanja i rukovanje momentom su najmanje testirani deo petlje na stvarnom hardveru. Testirajte predaju na sporoj, neškodljivoj pozi pre nego što se na nju oslanjate u trčanju kojem vas briga. Voditeljska ruka proizvodi najgladnije ispravke od tri režima, i takođe ima najviše što može poći naopako mehanički.
Bez voditeljske ruke: tastatura i klizači
Većina ljudi koji čitaju ovo poseduje jednu ruku. To je dovoljno. Odaberite unos tastaturom ili klizačima u trenutku kad pritisnete Preuzimanje, i preuzimanje je odmah i ručno - nema druge ruke da se poravna, zato nema koraka poravnanja. Sledbenski drži svu pozu i čeka unos.
| Režim unosa | Kako se ruka kreće | Ograničenje po pozivu nametnuto od strane servera | Zaključano kada |
|---|---|---|---|
| Voditeljska ruka | Ogledalo vozi sledbenika sa uglova zglobova vođe | Nema gurnisa ili postavki poziva u ovom režimu; ogledalo piše ciljeve sledbenika kontinuirano | Nikada zaključano, i podrazumevan ako nema datog režima unosa - ali treba drugu ruku; bez voditeljskog ID-a preuzimanje je odbijeno |
| Tastatura | Relativno guranje po pritisku na taster, poslano zaključiteljskom gurlanju | Tvrda stezanja na 2 stepena po zglobu, 4 stepena za zahvat | Odbijeno sa 409 ako je preuzimanje pokrenuto u režimu vođe |
| Klizači | Apsolutna ciljana poza, poslana zaključiteljskoj postavci | Najviše 6 stepeni putovanja prema cilju po pozivu; interfejs nastavlja slanje oko deset puta u sekundi | Odbijeno sa 409 ako je preuzimanje pokrenuto u režimu vođe |
Stezanja se nameću sa strane servera, ne u interfejsu, jer je pogrešan delta na magistrali sa servo rukom sudara. Korekcije tastature dolaze stepwise i blago grube; korekcije klizača su glatke, jer server hoda prema cilju dok interfejs nastavlja strujanje. Na bilo koji način kolona akcije prima pune komande poza i intervencije oznaku je identična voditeljskoj putanji, tako da se korekcije tastature smeštaju u isti skup podataka bez razlike u formatu.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Kada pritisnuti dugme
Ranije nego kasnije. Ispravka koja počinje nakon što se zahvat zatvori na ništa uči oporavak od greške koju politika nije trebala da uđe, i podaci oporavka vrede daleko manje od podataka izbegavanja. Prekinite u prvom trenutku kada ste sigurni da je putanja pogrešna, ispravite kroz teški deo, vratite čim je stanje ono što je politika vredala pre. ThriftyDAgger automatizira tu odluku kapljanjem intervencija o novosti i procenjenom riziku pod fiksnim ljudskim budžetom, ali na jednoj ruki sa čovekom koji već gleda, ljudska kaplja je jeftinija i bolje kalibrirana od bilo šta što ćete tunovati.
Izvedivo sa otvorenim stekom i nekoliko skripti. Šta to košta je čitara, i čitara je gde DAgger runde umiru.
- Napišite kadre iz vaše sopstvene skripte zaključivanja u LeRobot skup podataka, sa stringom zadatka na koji je politika obučavana.
- Pauzira politiku petlje, prebacite izvor komande, i označite svaki kadr koji vozite kao intervenciju. Bez zastavice, ispravke izgledaju kao obične demonstracije.
- Odlučite svesno šta se dešava na kadrama prelaza između politike da oslobodi kontrolu i vašeg prvog unosa.
- Čuvajte ispravke u njihovom vlastitom skupu podataka po politici, i pratite indekse epizoda ručno kako bi se mešavina mogla rekonstruisati.
- Pokažite unos fine-tuning na prethodnu kontrolnu tačku, i proverite u dnevniku da je učitao te težine.
Istu šest koraka postoji kao dugmići. Šta je automatizovano je ono što je lako pogriješiti ručno: zastavica intervencije po kadru, podela između ispravki i evaluacija, i zapis koji je kontrolna tačka proizvedla koju mešavinu. Ništa ne ulazi u komponovan skup podataka što niste odabrali.
Ne odlučuje za vas. Koje trčanje računa kao ispravljanje, koje epizode ulaze u mešavinu, i kad treba zaustaviti ostaju prosudbe. Polja su dokumentovana pod obuka, režimi unosa pod teleoperacija.
Korak 3 detaljno: trijaž odlučuje kvalitet
Posle trčanja imate snimak sa nekim kadrima označenim kao intervencije. Tri odredišta postoje, i pogrešna tiho truje sledeću rundu.
- Klasifikujte kao ispravljanje kad je intervencija bila pravi popravak: politika je išla na neki pogrešan lugar i vaš unos je pokazao desnu stvar iz stanja koju je politika sama proizvela.
- Čuvajte kao evaluaciju za čista autonomna trčanja i za trčanja gde ste preuzeli od opreza. Epizode evaluacije su kako mererate sledeću kontrolnu tačku, i oni se nikada ne smeju obučavati.
- Odbacite trčanja pokvarejena od nečega nepovezanog - ispušteni kadr kamere, zaustavljen servo, objekat koji ste oborili. Prljava ispravka je gora od bez ispravke.
Između politike da oslobodi kontrolu i vašeg prvog unosa, ruka drži mirno dok snimač nastavlja pisanje - trčanje identičnih poza parunjenih sa malo različitim slikama. Tu su kadri predaje ostaju u raw snimanju i van skupa podataka za ispravljanje. Ako sami gradite petlju, režite ih svesno: politika obučavana na njima uči da se pauzira gde treba da deluje.
Korak 5 detaljno: komponovanje mešavine
Skladba uzima originalni skup podataka plus skup podataka za ispravke i proizvodi novi, obični LeRobot skup podataka koji obučava kao bilo koji drugi. Važna svojstva je da je selekcija epizode eksplicitna po izvoru - ništa se ne meša automatski. To zvuči manje dok prvi put politika deluje čudno i morate rekonstruisati šta je na njemu obučavana.
Otvoreno pitanje je odnos, i niko nema broj koji se prenosi. Ono što se slaže literature je da ispravke trebaju broj više od njihovog dela frejm. Mandlekar et al. retrain iterativno na podacima koju njihov sistem intervencije skuplja, tako da politika uči da prođe kroz uska grla, i izveštavaju da agenti obučeni na taj način nadmašu agente obučene na ekvivalentnom broju uzoraka od ne-intervencijskih instruktora. Sirius ide dalje i ponovo teži trening uzoraka sa približenom ljudskom poverenjem, izveštavajući 8 procentnu dobit u simulaciji i 27 procenata na stvarnom hardveru u stopi uspeha politike naspram metoda sa kojima upoređuje, na dvostruko brzoj konvergenciji. Nijedan od unosa obuke ovde ne izlože gumb prepondiranja uzorka, pa je gruba zamena da čuvate svaku epizodu ispravke dok subsamolirate originalne demonstracije - i da napišete šta ste uradili.

Korak 6 detaljno: šta zaista znači nastavak od kontrolne tačke
Obuka mešavine od osnovnog modela radi ali baca prethodnu rundu i košta puno trčanja. Nastavak od prethodne kontrolne tačke je brži i obično bolji. To je takođe ograničenije nego što fraza sugeriše.
Kontrolna tačka samo težina sadrži parametre i ništa drugo. Učitavanje je daje sledećem trčanju bolji početak nego osnovni model, ali momenti optimizatora, pozicija rasporeda stope učenja i redosled podataka svi počinju od nule. Očekujte gubitak u početku nastavka trčanja, ne čitajte ga kao neuspeh, i ne pozivajte rundu rezime. To je topao početak.
| Politika | Veličina | GPU tiera | Zaključivanje po stepenu akcije | Format skupa podataka | Epizode pre nego što je vredna pokušavanja |
|---|---|---|---|---|---|
| GR00T N1.7 | oko 3 B, otprilike 40 M obučeno tokom fine-tuning | A100 80 GB ili H100 80 GB | oko 152 ms | LeRobot v2.0 ili v2.1 | 50 |
| GR00T N1.5 | oko 3 B | A100 80 GB ili H100 80 GB | oko 165 ms | LeRobot v2.0 ili v2.1 | 50 |
| Pi0.5 | oko 3 B na PaliGemma kičmi | A100 80 GB ili H100 80 GB | oko 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | oko 450 M | RTX 4090 ili bilo koja 24 GB kartica | oko 245 ms | LeRobot v3.0 | 30 |
| ACT | oko 80 M, obučeno od nule | RTX 4090 ili bilo koja 24 GB kartica | oko 20 ms | LeRobot v3.0 | 50 |
Kašnjenje se sabira unutar DAgger petlje na način na koji se ne javlja tokom demon: na otprilike 485 ms po koraku akcije preuzimate jer je ruka oklevala, ne zato što je pogrešna, i oklevanja ispravke nisu korisni podaci obuke. Ako iterujete na podacima umesto da jurite konačnom stope uspеha, iterujte na brzom modelu. Shukor et al. opisuju SmolVLA kao dizajnirano da se obučava na jednom GPU-u i rasporedbuje na potrošačkim GPU-u ili CPU-ovima, sa asinhronim stekom zaključivanja koja odvaja predviđanje akcije od izvršavanja kako bi dozvolilo veće stope kontrole - svojstvo koje drži petlju preuzimanja odgovrajućom.
Formati skupa podataka nisu zamenjivi. GR00T uzima LeRobot v2.0 ili v2.1, i Isaac-GR00T repozitorijum opisuje svoj unos kao ukus LeRobot v2 formata sa datotekom dodane modaliteta opisa; novije trenere ovde očekuju v3.0. Mešavina sastavljena u pogrešnoj verziji pada tokom učitavanja umesto da proizvede lošu politiku - bolji način pada, i dalje propušten rezon u redu čekanja. dokumentacija skupa podataka navodi koji format svaki trener uzima.
Petlja, sa beleškama već završenim
Preuzimanje sa voditeljskom rukom, tastaturom ili klizačima; označavanje intervencije po kadru; klasifikovanje trčanja kao ispravki ili evaluacija; komponovanje mešovitog skupa podataka sa eksplicitnom selekcijom epizode po izvoru; i nastavak obuke od kontrolne tačke umesto osnovnog modela. Ono što ostaje vaša odluka je koje trčanje računa kao ispravljanje, šta ide u mešavinu, i kad je stopa intervencije prestala padati.
Pogledajte kako je DAgger petlja žičanaČetiri načina za rasipanje runde
1. Obuka samo na ispravkama
Najčešća greška i najokušavajuća prečica. Skup podataka samo ispravka je gotovo potpuno teški srednji deo zadatka, sa pristupom i povlačenjem nedostatak; politika postaje bolja u težom delu i zaboravlja kako tamo stići. Agregacija nije detalj implentacije metode, to je mehanizam: stari podaci su ono što drži ostatak ponašanja na mestu dok ispravke kreću jedan deo toga.
2. Premeštanje kamere između rundi
Kamera koja se pomera dva centimetra između rundi proizvodi politiku goru nego ona sa kojom ste počeli, a dijagnoza koja košta dan. Svaka VLA ovde se uslovi na slike; stanje zglobova samo ne razjašnjava gde je objekat. Fotografirajte postavku pre prve runde i proverite tu fotografiju pre svake kasnije.
3. Dozvoljavanje artefakata predaje u obuku
Pokriveno gore, i na listi jer je nevidljivo. Simptom je politika koja staje frakciju sekunde tačno gde je operator prethodne runde preuzeo. Izgleda kao oklevanje; to je imitacija.
4. Zivanje toplog početka rezimea
Ako verujete da je stanje optimizatora preneto, početni gubitak čini se kao greška i idete loviti poljoprivredno prikivanu podatke. Ako znate da je optimizator počeo ispočetka, skok je očekivan i gledate šta dolazi posle njega. Isti brojevi, suprotni zaključci.
Meravanje runde
Metrika za ljudsku kontrolu petlje je stopa intervencije: kadri snimljeni dok ste bili u kontroli, deljeni sa ukupnim okvirima trčanja. Nalazi se u statusu preuzimanja, i to je jedini broj koji odgovara na pitanje koje je runda postavila. Gubitak obuke pada da li je ili ne politika poboljšana; stopa uspeha je binarna i bučna sa veličinama uzorka koje ruka na stolu proizvodi. Stopa intervencije je kontinuirana, merena na stanjima koja politika sama uzrokuje, i pada kako politika vas manje treba.
Uporedite je samo kroz trčanja snimljena pod identičnim uslovima. Puno argument, i kako da napravite skup evaluacije koja drži više od dve runde, je u članku o meranju DAgger petlje. Runda jedan je realno test izvedljivosti: proveravate da preuzimanje deluje na vašem hardveru, da ispravke smeštaju sa zastavicama, i da je nastavljena obuka učitala kontrolnu tačku koju ste imenovali. Runde dva i tri su gde bi stopa trebala početi da se kreće. Ako se nije pomerila do runde četiri, problem je uzvodno od DAgger.
| Napišite po rundi | Zašto je kasnije važno |
|---|---|
| Kontrolna tačka koja je vozana | Bez toga ne možete pripisati poboljšanje mešavini |
| Režim unosa korišćen za preuzimanje | Ispravke tastature su grube nego ispravke vođe, i viđa se u podacima |
| Broj trčanja i kako je svako trijaž | Da li je runda imala dovoljno ispravki da bude važne |
| Stopa intervencije po trčanju, i srednja vrednost | Metrički napredak petlje |
| Tačna selekcija epizode po izvoru | Jedini način da se reprodukuje ili otkaže runda |
| Topao početak ili nova obuka | Objašnjava krivulju gubitka koju ćete pogledati za nedelju dana |
Ako još nemaš kontrolnu tačku
Petlja nema ulazne tačke bez one. Snimite prvi skup podataka, obučite prvu politiku, pokrenite je - snimanje, obuka i pokretanje politike pokrivaju tu putanju. Klijent snimanja je na stranici za preuzimanje, GPU tierovi i satne cene na stranici cena, i šta dobra epizoda izgleda u SO-100 vodiču za prikupljanje podataka. Prvo ispravite demonstracije pre ispravki: DAgger je mehanizam popravke, i radi daleko bolje na nečem što je bilo skoro u redu.
Mogu li pokrenuti DAgger petlju bez voditeljske ruke?▾
Da. Odaberite unos tastaturom ili klizačima kad pritisnete Preuzimanje: preuzimanje je odmah i ručno, bez druge ruke da se poravna. Tastatura šalje relativne šibice koju server teško stiska na 2 stepena po zglobu i 4 za zahvat; klizači šalju apsolutni cilj i server se kreće najviše 6 stepeni prema njemu po pozvu, dok interfejs nastavlja strujanje. Kolona akcije i intervencije oznaka su iste kao u voditeljskom režimu, tako da su ispravke tastature nerazlučive u skupu podataka.
Koliko ispravki treba jednoj rundi?▾
Nema branivih univerzalnih brojeva, i broj kadriranja važniji je od broja epizode. Radna pravila je da ispravke ne smeju biti izgubljene u mešavini: sa 200 originalnih epizoda i tri epizode ispravke, ništa se neće pomeriti. Cilj je ispravke koje pokrivaju propadajuće ponašanje iz nekoliko početnnih konfiguracija umesto tri ponavljanja iste spasavanja.
Zašto je obuka samo na ispravkama tolika loša ideja?▾
Jer su ispravke gotovo potpuno teški deo sredine zadatka. Pristup, poravnanje i povlačenje nedostaju, tako da politika gubi šta je već dobro uradila dok poboljšava deo koji ste ispravili. Čuvanje starog podataka i dodavanje je sam mehanizam, ne opciono ekstra.
Da li nastavak od kontrolne tačke nastavlja prethodno trčanje obuke?▾
Ne. Kontrolna tačka samo težine vraća parametre i ništa drugo: momenti optimizatora, pozicija rasporeda stope učenja i redosled podataka počinju ispočetka. To je topao početak, i početni gubitak je očekivan umesto simptoma. Napišite koji od dva ste zaista uradili, tako da čitate krivu ispravno za nedelju dana.
Šta ako stopa intervencije ne pada?▾
Prestanite da dodajete runde. Ravna stopa znači da ispravke ne poučavaju šta mislite. Uobičajeni uzroci su uzvodno: kamera se pomerila, ispravke počinju prekasno da budu podaci izbegavanja, kadri predaje su u skupu obuke, ili je zadatak neodređen iz opažanja koja politika zaista dobija.
Ništa od toga nije rešeni problem i ništa od toga nije jedan klik. Interaktivno učenje imitacijom je aktivna oblast istraživanja upravo zato što su joj pitanja - kad intervenisati, kako ponderisati šta je čovek uradio, koliko starog podataka čuvati - nemaju utvrđene odgovore; anketa Celemin et al. mapira šta je još otvoreno. Ono što petlja ima je merljiva konvergencija kad se vodim pažljivo, na hardveru koji košta nekoliko stotina evra. Zamrznite postavku, intervenisati rano, trijaž pošteno, mešavaju namerno, i zabeležite stopu intervencije svaki put.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started