
Korak po korak opis jedne ljudski vođene DAgger runde na SO-100 kraku: pokrenite politiku i snimite je, preuzimite kada nešto pođe po zlu, zabilježite kao korekciju, sastavite mješoviti skup podataka i nastavite treniranje od kontrolne točke. Uključuje putanju preuzimanja putem tipkovnice i klizača za ljude bez voditeljskog kraka, te četiri greške koje čine rundu beskorisnom.
Vaša politika se pokreće. Doseže kocku, zatvara hvatač centimetar prerano i nastavlja kao da je ima. Ništa se ne javlja kao greška, i bez obzira koliko gledali u gubitak treniranja, ne objašnjava se. Rješenje nije dodatnih 20 000 koraka gradijenta na istim demonstracijama. Trebate vratiti ruku na krak točno gdje nešto pođe po zlu, snimiti što ste umjesto toga učinili, i trenirati sljedeću kontrolnu točku na starim podacima plus toj korekciji. To je DAgger runda, i evo kako se pokreće na SO-100 s politikom vizije-jezika-akcije.
Teorija je drugdje: zašto agregacija skupa podataka uopće funkcionira i što ljudsko vođenje mijenja u vezi toga. Ovo je priručnik za rad i pretpostavlja trenirani kontrolnu točku, funkcionalan skup kamera, i krak koji se pokreće. Šest koraka u nastavku je petlja kako je implementirana na DAgger stranici ove platforme, ali redoslijed je isti iz vlastitih skripti.
Jedna runda ukratko
- •Pokrenite trenirane politike i snimite je, s tekstom zadatka rundy umjesto generičke etikete teleopercije.
- •Preuzimite u trenutku kada ponašanje pođe po zlu: zrcalna preuzimanja s voditeljem, odmah i ručno kroz tipkovnicu ili klizače bez njega.
- •Sortira svaku rundu: zabilježite kao korekciju, čuvajte kao evaluacijski epizod, ili odbacite.
- •Sastavite mix ručno - originalne demonstracije plus korekcije, epizode odabrane po izvoru. Nikad ne trenirajte samo na korekcijama.
- •Nastavite treniranje od zadnje kontrolne točke i zabilježite koja kontrolna točka je proizvela koji mix.
- •Broj koji govori je li runda nešto vrijedna je stopa intervencije, ne gubitak treniranja.
Zašto druga runda nije samo više podataka
Kloniranje ponašanja trenira se na stanjima koja je čovjek posjetio. U vrijeme testiranja politika posjeća stanja koja uzrokuje, i male greške akcije se nagomilavaju u stanja koja niti jedna demonstracija nije pokrivala. Ross, Gordon i Bagnell su formalizirali taj neuspjeh za AISTATS 2011 i odgovorili s iterativnim algoritmom koji trenira stacionarnu determinističku politiku i, u okviru njihove redukcije, mora biti dobra pod distribucijom stanja koju uzrokuje: pokrenite trenutnu politiku, neka ekspert označi stanja do kojih je zaista stigla, dodajte u skup podataka, retjenirajte, ponavljajte. Kelly i drugi su učinili upiti praktičnim s HG-DAgger, gdje čovjek odlučuje kada preuzeti kontrolu umjesto označavanja stanja bez držanja kontrola; izvješćuju poboljšanu izvedbu nad DAgger i kloniranjem ponašanja na simuliranom i stvarnom zadatku autonomne vožnje. Ljudsko vođenje je ono što čini petlju podnošljivom na kraku na stolu - trebate rukovati samo kada nešto ide po zlu.
Dvije posljedice su važnije u praksi nego što je teorija. Korekcije nisu obične demonstracije: koncentriraju se u regijama grlog boca koje Mandlekar i drugi opisuju, gdje mala devijacija baci politiku u stanja koja demonstracije nikad nisu pokrivala. I skup podataka napravljeni samo od tih težih dijelova je loše oblikovan skup - Belkhale, Cui i Sadigh argumentiraju sa strane podataka da raznolikost stanja nije uvijek korisna, i da divergencija akcije i raznolikost prijelaza zajedno odlučuju kvalitetu skupa podataka. Mješoviti skup podataka nije kompromis, to je poanta.
Zamrzni ove stvari prije runde jedan
DAgger runda uspoređuje politiku protiv sebe kroz vrijeme. Bilo što što trebate promijeniti između rundi što nije skup podataka čini tu usporedbu besmislenom.
- Položaje i montaže kamera, uključujući kameru na zapešću. Otpustite jednu kopču i trebate promijeniti distribuciju opažanja, ne politiku.
- Ekspozicija i balans bijele, ako vam slog slike omogućava da ih fiksnirate. Automatska ekspozicija koja pluta između rundi je spora, nevidljiva domena promjena.
- Kalibracija kraka i pozicije nule servo motora. Ako trebate ponovno kalibrirati, sve snimljeno prije toga tretirajte kao zaseban skup podataka.
- Tekst zadatka. Svaka VLA ovdje je uvjetovana na njega; preformuliranje usred petlje je drugačiji zadatak.
- Osvjetljenje, površina stola, skup objekata. Novi objekt je novi pokus, ne sljedeća runda.
- Brzina snimanja okvira. Uspoređivanje stopa intervencije između dva rastra uzorkovanja proizvodi razlike koje dolaze iz rastera.
Hsu i drugi su usporedili vidik usmjeren na ruku protiv uobičajenog vidika treće osobe i otkrili da je perspektiva oka-u-ruci dosljedno poboljšala učinkovitost treniranja i generalizaciju izvan distribucije, unatoč viđenju manje scene. Na kraku s pet zglobova, timing grifera je obično ono što trebate ispraviti, a timing grifera je ono što nosi vidik zapešća.
Runda, od kraja do kraja
- 1Pokrenite zaključivanje i snimite ga
Pokrenite rundu na kontrolnoj točki koju trebate poboljšati, zatim pokrenite snimanje u korijen zaključivanja. Snimljena na taj način, naslijedi tekst zadatka vlastite rundy, što je politika bila trenirana, umjesto zadane etikete teleopercije. Bez snimanja možete gledati neuspjeh ali ga ne možete trenirati.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Preuzimite kada nešto pođe po zlu
Pritisnite Preuzmi i odaberite način unosa: voditeljski krak, tipkovnica ili klizači. Pokretač se pauzira, trebate ispraviti, trebate vratiti. Okviri snimljeni dok ste vozili su automatski označeni kao intervencije.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Sortirajte epizode
Odlučite po epizodi: zabilježite kao korekciju, čuvajte kao evaluaciju, ili odbacite. Runda koju je politika završila bez pomoći je evaluacijski podatak.
- 4Sinkronizirajte skup podataka korekcije
Korekcije se skupljaju u lokalni skup podataka po politici i odlaze u oblačno spremište kroz automatsku sinkronizaciju. Ništa se ne miješa što niste tamo stavili.
- 5Sastavite mješoviti skup podataka
Kombinirajte originalni skup podataka s korekcijama, odabirući epizode eksplicitno po izvoru. Rezultat je obični skup podataka od tada naviše.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Nastavite treniranje od kontrolne točke
Trenirajte mix od prethodne kontrolne točke umjesto početnog modela. Zabilježite koja kontrolna točka i koji mix; bez te veze runda nije ponovljiva.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Korak 2 detaljno: dva načina preuzimanja
S voditeljem
U voditeljski-pratitelj modu je preuzimanje rukovanje između dva kraka koja nisu u istoj poziciji. Pritisak na Preuzmi pauzira pokretač i pokreće voditelja na poziciju pratitelja, tako da se ništa ne skače kada se moment prenosi. Ako se vožnja poravnanja istekne, trebate ručno poravnati voditelja i osloboditi samo kad su dva unutar pet stupnjeva. Od tada rade normalno teleoperciju i stupac akcije bilježi što ste trebali.
Budite iskreni o ovoj putanji: vožnja poravnanja i moment rukovanja su najmanje testirani dio petlje na stvarnom hardveru. Testirajte rukovanje na sporom, neškodnom položaju prije nego što se oslonite na njega u rundi koju trebate. Voditeljski krak proizvodi najgladnije korekcije od tri moda, i ima i najviše što može pići mehanički.
Bez voditeljskog kraka: tipkovnica i klizači
Većina ljudi koji ovo čitaju posjeduje jedan krak. To je dovoljno. Odaberite unos putem tipkovnice ili klizača u trenutku pritiska na Preuzmi, i preuzimanje je odmah i ručno - nema drugog kraka za poravnanje, tako da nema koraka poravnanja. Pratitelj drži svoju poziciju i čeka unos.
| Način unosa | Kako se krak pokreće | Ograničenje po pozivu nametnuto od strane poslužitelja | Zaključano kada |
|---|---|---|---|
| Voditeljski krak | Zrcalo pokreće pratitelja iz kutnih brzina voditeljskog kraka | Nema dodirivanja ili postavljanja poziva u ovom modu; zrcalo neprekidno piše ciljeve pratitelja | Nikad zaključano, i zadano ako nema danog moda unosa - ali trebate drugi krak; bez ID voditeljskog kraka preuzimanje je odbijeno |
| Tipkovnica | Relativno dodirivanje po pritisku na tipku, poslano na krajnju točku dodirivanja preuzimanja | Teško stisnuto na 2 stupnja po zglobu, 4 stupnja za hvatač | Odbijeno s 409 ako je preuzimanje počelo u modu voditeljskog kraka |
| Klizači | Apsolutna ciljna pozicija, poslana na krajnju točku postavljanja preuzimanja | Najviše 6 stupnjeva kretanja prema cilju po pozivu; sučelje šalje oko deset puta u sekundi | Odbijeno s 409 ako je preuzimanje počelo u modu voditeljskog kraka |
Stezanje se provodi na strani poslužitelja, a ne u sučelju, jer pogrešno tipkan delta na kraku s magistralnim servo motorima je sudar. Korekcije putem tipkovnice dolaze stepenasto i malo grubo; korekcije sa klizačima su glatke jer poslužitelj ide prema cilju dok sučelje neprekidno šalje. Ionako stupac akcije prima kompletan vektor trebane pozicije i označavanje intervencije je identično putanji voditeljskog kraka, tako da korekcije putem tipkovnice stanu u isti skup podataka bez razlike u obliku.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Kada pritisnuti gumb
Ranije nego li kasnije. Korekcija koja počinje nakon što je hvatač zatvoren na ništa učava oporavak od neuspjeha kojeg politika ne bi trebala ući, i podaci o oporavku vrijede daleko manje nego li podaci o izbjegavanju. Prekidite u prvom trenutku kada ste sigurni da je putanja pogrešna, trebate ispraviti kroz težak dio, trebate vratiti čim je stanje ono što je politika trebala prije. ThriftyDAgger automatizira tu odluku održavanjem intervencija na novosti i procijenjenom riziku pod fiksnom ljudskom budžetom, ali na jednom kraku s čovjekom koji već gleda, ljudska vrata su jeftinija i bolje kalibrirana od bilo čega što ćete trebati preporučiti.
Moguće s otvorenim kodom i nekoliko skripti. Što to košta je knjiženje, i knjiženje je gdje DAgger runde umiru.
- Napišite okvire iz vlastite skripte zaključivanja u LeRobot skup podataka, s tekstom zadatka na kojem je politika bila trenirana.
- Pauzirati petlju politike, prebaciti izvor naredbi, i označiti svaki okvir koji trebate voziti kao intervenciju. Bez oznake korekcije izgledaju kao obične demonstracije.
- Odlučite namjerno što se događa s okvirima prijelaza između puštanja kontrole politike i vašeg prvog unosa.
- Čuvajte korekcije u njihovom vlastitom skupu podataka po politici, i pratite indekse epizoda ručno tako da mix može biti ponovno konstruiran.
- Pokažite na unos finog podešavanja na prethodnu kontrolnu točku, i provjerite u dnevniku da je naložio te težine.
Ista šest koraka postoji kao gumbi. Ono što je automatizirano je ono što je lako pogriješiti ručno: oznaka intervencije po okviru, podjela između korekcija i evaluacija, i zapis koja kontrolna točka je proizvela koji mix. Ništa ne ulazi u sastavljen skup podataka što niste odabrali.
Ne odlučuje za vas. Koja runda računa kao korekcija, koji epizodi ulaze u mix, i kada stopa intervencije prestane padati ostaju sudi. Polja su dokumentirana ispod treniranja, načini unosa ispod teleopercije.
Korak 3 detaljno: sortiranje odlučuje o kvaliteti
Nakon rundy imate snimanje s nekim okvirima označenim kao intervencije. Tri odredišta postoje, a pogrešan zahtijeva tiho Crno zagađuju sljedeću rundu.
- Zabilježite kao korekciju kada je intervencija bila pravi popravak: politika je išla negdje pogrešno i vaš unos je pokazao pravu stvar iz stanja koje je politika sama proizvela.
- Čuvajte kao evaluaciju za čiste autonomne runde i runde u koje ste preuzeli oprezno. Epizodi za evaluaciju su kako mjerite sljedeću kontrolnu točku, i oni nikad ne smiju biti trenirani.
- Odbacite runde uništene nečim nepovezanim - ispušteni okvir kamere, zapaljeni servo motor, objekt koji ste srušili. Neuređena korekcija je gora nego li nema korekcije.
Između puštanja kontrole politike i vašeg prvog unosa, krak stoji dok bilježnik nastavlja pisati - niz identičnih pozicija uparenih s malo drugačijima slikama. Ovdje ti okviri rukovanja ostaju u sirovom snimanju i izvan skupa podataka korekcije. Ako trebate sami graditi petlju, trebate ih namjerno rezati: politika trenirana na njima učit će se pauzirati gdje trebate djelovati.
Korak 5 detaljno: sastavljanje mixa
Sastav uzima originalni skup podataka plus skup podataka korekcije i proizvodi novi, obični LeRobot skup podataka koji trenira kao bilo koji drugi. Važna svojstva je da je odabir epizode eksplicitan po izvoru - ništa se ne miješa automatski. To zvuči nedovoljno dok se prvi put politika ponaša čudno i trebate ponovno konstruirati na čemu je bila trenirana.
Otvoreno pitanje je omjer, i nitko nema broj koji se prenosi. Ono što literatura slažu je da korekcije trebaju vrijediti više od njihove akcije okvira. Mandlekar i drugi ponovno treniraju iterativno na podacima koje njihov sustav intervencije skuplja, tako da politika uči prelaziti grla, i izvješćuju da agenti trenirani na taj način nadilaze agente trenirane na ekvivalentnom broju primjeraka od ne-intervencionalne demonstrujuće osobe. Sirius ide dalje i ponovno težina uzorke treniranja procijenjenim ljudskim povjerenjem, izvješćujući 8 postotni dobitak u simulaciji i 27 posto na stvarnom hardveru u stopi uspjeha politike protiv metoda koje uspoređuje, na dvostruko bržoj brzini konvergencije. Niti jedan unos za treniranje ovdje izlaže nož za ponovno vaganje uzorka, tako da je grubi zamjena da čuvate svaki epizodu korekcije uz uzorkovanje originalnih demonstracija - i trebate zapisati što ste radili.

Korak 6 detaljno: što nastavak od kontrolne točke zaista znači
Treniranje mixa od početnog modela radi ali baca prethodnu rundu i košta cijelu rundu. Nastavak od prethodne kontrolne točke je brži i obično bolje. Također je ograničenije nego što fraza sugeriše.
Kontrolna točka samo-težine sadrži parametre i ništa više. Učitavanje ga daje sljedeću rundu bolji početak nego li početni model, ali momenti optimizatora, pozicija rasporeda brzine učenja i redoslijed podataka svi počinju od nule. Očekujete skok gubitka na početku nastavka rundy, ne čitajte kao neuspjeh, i ne pozivajte rundu kao povratak. To je topla početka.
| Politika | Veličina | GPU razred | Zaključivanje po koraku akcije | Oblik skupa podataka | Epizodi prije nego što je vrijedno pokušavanja |
|---|---|---|---|---|---|
| GR00T N1.7 | oko 3 B, otprilike 40 M trenirano tijekom finog podešavanja | A100 80 GB ili H100 80 GB | oko 152 ms | LeRobot v2.0 ili v2.1 | 50 |
| GR00T N1.5 | oko 3 B | A100 80 GB ili H100 80 GB | oko 165 ms | LeRobot v2.0 ili v2.1 | 50 |
| Pi0.5 | oko 3 B na PaliGemma hrbtu | A100 80 GB ili H100 80 GB | oko 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | oko 450 M | RTX 4090 ili bilo koja 24 GB kartica | oko 245 ms | LeRobot v3.0 | 30 |
| ACT | oko 80 M, trenirano od nule | RTX 4090 ili bilo koja 24 GB kartica | oko 20 ms | LeRobot v3.0 | 50 |
Latencija se sabira unutar DAgger petlje na način na koji se ne javlja tijekom demoa: s otprilike 485 ms po koraku akcije trebate preuzeti jer je krak oklijevao, ne jer je bio pogrešan, i oklijevanje korekcije nije korisni podatak za treniranje. Ako trebate iterirati na podacima umjesto janjanja konačne stope uspjeha, trebate iterirati na brzom modelu. Shukor i drugi su opisali SmolVLA kao dizajniran za treniranje na jednom GPU-u i razvoj na GPU-ama ili procesorima za potrošače, s asinkrono zaključivanjem stoga koji odvaja predviđanje akcije od izvršavanja kako bi se dopustile veće brzine kontrole - svojstvo koje čuva petlju preuzimanja reaktivnom.
Oblici skupa podataka se međusobno zamjenjivati. GR00T uzima LeRobot v2.0 ili v2.1, i spremište Isaac-GR00T opisuje svoj unos kao okus LeRobot v2 oblika s dodanom datotekom opisa modalnosti; noviji treneri ovdje očekuju v3.0. Mix sastavljen u pogrešnoj verziji ne uspijeva pri učitavanju umjesto proizvodnje loše politike - bolji način neuspjeha, ponovno uništena besplatan red. dokumentacija skupa podataka popisuje koji oblik svaki trener uzima.
Petlja, s odjeljenim knjiženju
Preuzimanje s voditeljem, tipkovnicom ili klizačima; označavanje intervencije po okviru; prikupljanje kao korekcije ili evaluacije; sastavljanje mješovitog skupa podataka s eksplicitnim odabirom epizode po izvoru; i nastavak treniranja od kontrolne točke umjesto početnog modela. Ono što ostaje vaša odluka je koja runda računa kao korekcija, što ulazi u mix, i kada stopa intervencije prestane padati.
Vidjeti kako je DAgger petlja vezanaČetiri načina uništiti rundu
1. Treniranje samo na korekcijama
Najveća greška i najtamnija prečica. Skup podataka samo korekcije je gotovo u cijelosti težak srednji dio zadatka, s prilaskom i povlačenjem koji nedostaje; politika postaje bolja na težom dijelu i zaboravlja kako doći tamo. Agregacija nije detalj implementacije metode, to je mehanizam: stari podaci su ono što čini ostatak ponašanja na mjestu dok korekcije pomičnu jedan dio toga.
2. Premještanje kamere između rundi
Kamera koja se pomakne dva centimetra između rundi stvara politiku lošijom od one s kojom ste počeli, i dijagnostiku koja traje dan. Svaka VLA ovdje je uvjetovana na slike; samo stanje zglobova ne razlikuje gdje je objekt. Fotografirajte postavku prije prve rundy i provjerite tu fotografiju prije svake kasnije.
3. Neuspješno rukovanju artefakte u treniranje
Pokriveno gore, i na popisu jer je nevidljivo. Simptom je politika koja stoji frakciju sekunde točno gdje je operator prethodne rundy preuzeo kontrolu. Izgleda kao oklijevanje; to je imitacija.
4. Pozivanje tople početke kao povratka
Ako vjerujete da je stanje optimizatora prešlo, skok gubitka na početku čita kao greška i trebate tražiti oštećene podatke. Ako znate da je optimizator počeo iznova, skok je očekivan i trebate pogledati što dolazi nakon njega. Isti brojevi, suprotni zaključci.
Mjerenje rundy
Metrika za ljudski-vođenu petlju je stopa intervencije: okviri snimljeni dok ste bili pod kontrolom, podijeljeni s ukupnim okvirima rundy. Nalazi se u stanju preuzimanja, i to je jedini broj koji odgovara na pitanje koje je runda postavila. Gubitak treniranja pada je li li politika poboljšana ili ne; stopa uspjeha je binarna i bučna na veličinama primjeraka koje krak na stolu proizvodi. Stopa intervencije je kontinuirana, mjerena na stanjima koja politika sama uzrokuje, i pada kako manje trebate vas.
Usporedite je samo kroz runde snimljene pod identičnim uvjetima. Cijeli argument, i kako trebate graditi niz evaluacija koji preživi više od dvije rundy, je u članku o mjerenju DAgger petlje. Runda jedan je realno test izvedivosti: trebate provjeriti da preuzimanje radi na vašem hardveru, da korekcije stanu sa svojim zastavama, i da nastavak rundy je naložio kontrolnu točku koju ste trebali. Runde dvije i tri su gdje bi stopa trebala početi pokretati. Ako se nije pokrenula do četvrte rundy, problem je gore u DAgger.
| Napišite po rundi | Zašto je to važno kasnije |
|---|---|
| Kontrolna točka koja je bila vozana | Bez toga ne možete pripisati poboljšanje mixa |
| Način unosa korišten za preuzimanje | Korekcije putem tipkovnice su grublje od korekcija voditeljskog kraka, i vidi se u podacima |
| Broj rundi i kako je svaka bila sortirane | Ima li runda dovoljno korekcija da stvara razliku |
| Stopa intervencije po rundi, i prosjek | Metrika napretka petlje |
| Točan odabir epizode po izvoru | Jedini način da trebate ponovno proizvedite ili poništite rundu |
| Topla početka ili свежо treniranje | Objašnjava krivulju gubitka koju ćete pogledati u tjednu |
Ako trebate nemate kontrolnu točku još
Petlja nema točku unosa bez nje. Snimite prvi skup podataka, trenirajte prvu politiku, pokrenite je - snimanja, treniranja i pokretanja politike pokrivaju tu putanju. Klijent za snimanje je na stranici preuzimanja, GPU razrede i satne stope na stranici cijena, i što izgleda kao iskoristiv epizoda u vodiču za prikupljanje podataka SO-100. Trebate biti pravi demografi prije korekcija: DAgger je mehanizam popravke, i radi daleko bolje na nečem što je bilo gotovo pravo već.
Mogu li trebam pokrenuti DAgger petlju bez voditeljskog kraka?▾
Da. Odaberite unos putem tipkovnice ili klizača kada trebate pritisnuti Preuzmi: preuzimanje je odmah i ručno, bez drugog kraka za poravnanje. Tipkovnica šalje relativne doditke koji poslužitelj kuća teško na 2 stupnja po zglobu i 4 za hvatač; klizači šalju apsolutni cilj i poslužitelj se kreće najviše 6 stupnjeva prema njemu po pozivu, dok sučelje neprekidno šalje. Stupac akcije i označavanje intervencije su isti kao u modu voditeljskog kraka, tako da su korekcije nerazlučive u skupu podataka.
Koliko korekcija trebam za jednu rundu?▾
Nema obranog univerzalnog broja, i broj okvira važnije je nego broj epizoda. Radno pravilo je da korekcije ne smiju biti izgubljene u mixa: s 200 originalnih epizoda i tri epizode korekcije, ništa se neće trebati. Trebajte za korekcije koje pokrivaju ponašanje s neuspjehom od nekoliko počinih konfiguracija umjesto tri ponavljanja istog spašavanja.
Zašto je treniranje samo na korekcijama tako loša ideja?▾
Jer su korekcije gotovo u cijelosti teški srednji dio zadatka. Pristupa, poravnanja i povučenje nedostaju, tako da politika gubi ono što je već dobro radila dok se poboljšava dio koji ste trebali. Čuvanje starih podataka i dodavanje njima je mehanizam sebe, ne opcijski dodatak.
Čini li nastavak od kontrolne točke nove pokretanje prethodnog treniranja?▾
Ne. Kontrolna točka samo-težine vraća parametre i ništa više: momenti optimizatora, pozicija rasporeda brzine učenja i redoslijed podataka počinju iznova. To je topla početka, i skok gubitka na početku je očekivan umjesto simptoma. Napišite koja od dva ste zaista radili, tako da čitate krivulju ispravno tjedan kasnije.
Što ako stopa intervencije ne pada?▾
Prestanite trebati rundi. Ravna stopa znači da korekcije nisu učile ono što trebate. Uobičajeni uzroci su gore: kamera se premjestila, korekcije počinju prekasno da budu podaci izbjegavanja, okviri rukovanja su u skupu podataka treniranja, ili zadatak je određen nedovoljan od opažanja koja politika zaista dobija.
Ništa od toga nije riješeni problem i ništa od toga nije jedan klik. Interaktivno učenje imitacijom je aktivno istraživanje jer su njegova pitanja - kada trebate intervenirati, kako trebate vagati što je čovjek radio, koliko starih podataka trebate čuvati - bez settled odgovora; pregled od Celemina i drugih mapira što je još otvoreno. Ono što petlja ima je mjerljiva konvergencija kada je pokrenuta pažljivo, na hardveru koji koštaju nekoliko stotina eura. Trebate zamrznuti postavku, trebate intervenirati rano, trebate sortirajte iskreno, trebate miksate namjerno, i trebate zabilježite stopu intervencije svaki put.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started