
Žingsnis po žingsnio ataskaitą iš vieno žmogaus prižiūrėto DAgger raundo ant SO-100 rankos: paleisti strategiją ir įrašyti ją, perimti, kai ji nuklydsta, failą kaip pataisą, suvienybinti mišrų duomenų rinkinį ir tęsti mokymąsi iš kontrolinio taško. Apima klaviatūros ir slankiklių perėmimo kelią žmonėms be vadovaujančios rankos ir keturis klaidus, kurie daro raundą bevertę.
Jūsų strategija veikia. Siekia kubo, uždaro griperį viena centimetru per anksti ir toliau eina, tarsi jį turėtų. Nieko neklaida, ir jokia treniravimo nuostolio žvilgsnys to nepaaiškina. Pataisymas nėra dar 20 000 gradiento žingsnių tuo pačiu demonstracijomis. Tai yra grąžinti savo ranką ant rankos tiksliai ten, kur ji klaidinga, įrašyti ką tu padarei, ir treniruoti kitą kontrolinį tašką pagal senus duomenis ir tą pataisą. Tai yra DAgger raundas, ir tai yra kaip jis veikia ant SO-100 su regėjimo kalbos veikimo strategija.
Teorija yra kitur: kodėl duomenų rinkinių agregacija iš viso veikia ir ką žmogaus prižiūrėjimas keičia apie ją. Tai yra naudojimo vadovas ir jis daro prielaidą, kad yra treniruota kontrolinio taško, veikiantis kamera rinkinys ir ranka, kuri juda. Šeši žemiau esantys žingsniai yra ciklas, kaip jis įdiegtas šioje platformos DAgger puslapyje, bet sekų seka yra tokia pat iš jūsų pačių scenarijų.
Vienas raundas trumpai
- •Paleisti treniruotą strategiją ir įrašyti ją, su raundo užduoties tekstu, o ne bendrinę teleopevimo žymę.
- •Perimti tą momentą, kai elgesys klaidinga: veidrodinė perdavimas su vadovaujanče ranke, nedelsdamas ir rankiniu klaviatūroje ar slankikliuose be vieno.
- •Kategorijuoti kiekvieną bėgimą: failui kaip pataisą, laikyti kaip įvertinimo epizodą arba atmesti.
- •Suvienybinti mišrį rankiniu - originali demonstracija ir pataisos, epizodai pasirinkti pagal šaltinį. Niekada nemokyti tik pataisų.
- •Tęsti mokymąsi iš paskutinio kontrolinio taško, ir atkreipkite dėmesį, kuris kontrolinis taškas pagamino kurį mišrį.
- •Skaičius, kuris sako, ar raundas buvo vertos, yra intervencijos dalis, o ne treniravimo nuostolis.
Kodėl antras raundas nėra tik daugiau duomenų
Elgesio klonacija treniruojasi su valstybėmis, kuriomis žmogus aplankė. Testo metu strategija aplankys valstybės, kurias ji sukelia, ir maži veiksmų klaidos sudėtingai į valstybės, kurias demonstracija neapdengia. Rossas, Gordonas ir Bagnelis formalizavo tą nesėkmę AISTATS 2011 ir atsakė į ją iteraciniu algoritmu, kuris treniruoja stacionarią deterministinę strategiją ir pagal jų sumažinimą turi gerai veikti valstybės paskirstymo, kurią ji sukelia: paleisti dabartinę strategiją, turėti eksperto žymę valstybės, kuriomis jis iš tiesų pasiektas, pridėti prie duomenų rinkinio, perrengti, kartoti. Kelly ir kt. padarė klausimu praktišką su HG-DAgger, kur žmogus nusprendžia, kada perimti kontrolę, o ne žymės valstybės nulaikyti valdiklius; jie praneša apie gerėjusį veikimą, palyginti su DAgger ir elgesio klonavimu ant simuliuoto ir tikro autonominio vairavimo užduoties. Žmogaus prižiūrėjimas yra tai, kas daro ciklą tolerancija staigoje rankoje - jūs judinate rankas tik tada, kai kas nors klaidinga.
Dvi pasekmės daugiau reikalingos praktikoje nei teorija. Pataisos nėra įprastos demonstracijos: jos sukoncentruoja Mandlekaro ir kt. apibūdintuose kritinių taškų regionuose, kur mažas nuokrypis nustumia strategiją į valstybės, kurias demonstracija niekada neapdengia. Ir duomenų rinkinys, padarytas tik iš tų sunkių dalių, yra blogai suformuotas duomenų rinkinys - Belkhale, Cui ir Sadigh argumentuoja iš duomenų pusės, kad valstybės įvairovė nėra visada naudinga, ir kad veiksmų nukrypimas ir perėjimo įvairovė kartu nusprendžia duomenų rinkinio kokybę. Mišraus duomenų rinkinio nėra kompromisas, tai yra taškas.
Užšaldyti juos prieš pirmą raundą
DAgger raundas lyginant strategiją su savimi laike. Bet kas keičiasi tarp raundų, kuris nėra duomenų rinkinys, daro tą palyginimą beprasme.
- Kamerų pozicijos ir tvirtintukai, riešo kamera įtraukta. Atlaisvinti vieną svirtį ir pakeitėte stebėjimo pasiskirstymą, o ne strategiją.
- Ekspozicija ir baltos balanso, jei jūsų pagavimo stigas leidžia juos dėlinti. Automatinis ekspozicijos pokytis tarp raundų yra lėtas, nematomas domenės pokytis.
- Rankos kalibracija ir servo nulio pozicijos. Jei turite iš naujo kalibruoti, traktavoti visa, kas įrašyta prieš ją kaip atskiras duomenų rinkinys.
- Užduoties tekstas. Kiekvienas VLA čia sąlyguoja tai; pergrupavimas jį vidurinio ciklo yra kita užduotis.
- Apšvietimas, stalo paviršius, objekto rinkinys. Naujas objektas yra naujas eksperimentas, o ne kitas raundas.
- Įrašymo kadro greitis. Palyginant intervencijos dalys keliems atrankos rastrams duoda skirtumus, kurie atsiranda iš rastro.
Hsu ir kt. palyginę rankiniu orientuotą rodinį ir įprastą trečiojo asmens rodinį ir nustatę, kad akio rankoje perspektyva nuosekliai pagerino treniravimo efektyvumą ir pasklidimo apibendralizavimą, nepaisant to, kad matė mažiau scenos. Penkiajame sandari, griperių laikus paprastai yra tai, ką jūsų pataisos taisytos, ir griperių laikas yra tai, ką riešo rodinys duoda.
Raundas, nuo galo iki galo
- 1Paleisti išvadą ir įrašyti ją
Pradėti bėgimą prieš kontrolinį tašką, kurį norite pagerinti, tada pradėkite įrašymą į išvados šaknį. Įrašyta tuo būdu, jis paveldi paties raundo užduoties tekstą, kuris yra tai, ką strategija buvo treniruota, o ne numatytas teleopevimo žymę. Be įrašymo galite stebėti nesėkmę, bet joje negalima treniruoti.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Perimti, kai klaidinga
Paspauskite Perimti ir pasirinkite įvesties režimą: vadovaujanti ranka, klaviatūra ar slankikliai. Bėgimo pauzės, jūs ištaisote, jūs grąžinate. Kadrų, įrašytų, kai jūs varote, pažymėtos kaip intervencijos automatiškai.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Kategorijuoti epizodus
Nusprendžia pagal epizodą: failui kaip pataisą, laikyti kaip įvertinimą arba atmesti. Bėgimas, kurį strategija užbaigė be pagalbos, yra įvertinimo duomenys.
- 4Sinchronizuoti pataisų duomenų rinkinį
Pataisos rinkimo vietinį duomenų rinkinį per politiką ir eina į debesų saugyklą per automatinį sinchronizavimą. Nieko nemaišemate, ką jūs neįdėjote.
- 5Suvienybinti mišrų duomenų rinkinį
Sujungkite originalinį duomenų rinkinį su pataisų rinkiniu, pasirinkite epizodus aiškiai pagal šaltinį. Rezultatas yra įprastas duomenų rinkinys iš tos vietos.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Tęsti mokymąsi iš kontrolinio taško
Treniruoti mišrį iš ankstesnio kontrolinio taško, o ne pagrindinis modelis. Atkreipkite dėmesį, kuris kontrolinis taškas ir kuris mišrį; be to, poros raundas nėra atkuriamas.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Žingsnis 2 išsamiai: du perėmimo būdai
Su vadovaujanče ranke
In vadovaujančios sekėjos režimu perėmimas yra perdavimas tarp dviejų rankų, kurios nėra toje pačioje poze. Perėmimo paspauskite pristabdo bėgimą ir veda vadovą į sekėjo dabartinę pozą, todėl nieko neperšoka, kai suknelės perkelia. Jei tas išlyginimo bėgimas baigsis, jūs išlyginsite vadovą rankiniu ir paleiskite tik kartą, kai du bus penkios laipsnius. Iš tos vietos, kaip normaliai teleopevote ir veiksmų stulpelis įrašo, ką jūs vadovavote.
Būkite sąžiningas apie šį kelią: išlyginimo bėgimas ir suknelės perdavimas yra mažiausiai testuota ciklo dalis realios aparatūros. Testuokite perdavimą lėtai, nekenksmingoje poze, prieš atsiverdami į bėgimą, kuriame jums rūpi. Vadovaujanti ranka gamina sklandiausias pataisas iš trijų režimų ir taip pat turi daugiausia, kas gali nuklydti mechaniškai.
Be vadovaujančios rankos: klaviatūra ir slankikliai
Dauguma žmonių, skaitydami tai, savininkai viena ranka. To pakanka. Pasirinkite klaviatūrą arba slankiklį įvestį tą akimirką, kai paspauskite Perimti, ir perėmimas yra nedelsdamas ir rankinis - nėra antros rankos, kad išlygintas, todėl nėra išlyginimo žingsnio. Sekėjas laiko savo pozą ir laukia įvesties.
| Įvesties režimas | Kaip ranka juda | Per skambutį apribojimas, kurį nustato serveris | Užrakinta, kai |
|---|---|---|---|
| Vadovaujanti ranka | Veidrodis veda sekėją iš vadovo bendro kampo | Nėra stumtelėjimo ar nustatymo skambutin šiame režime; veidrodis nuolat rašo sekėjo tikslus | Niekada neužrakinta ir numatytasis, jei jokia įvesties režimas nėra - tačiau jums reikalinga antra ranka; be vadovo identifikatoriaus perėmimas yra atmestas |
| Klaviatūra | Santykinis stumtelėjimas pagal klavišo spaudimą, nusiųstas į perėmimo nudgimo galinį tašką | Sunkus spaustas 2 laipsnius per sandį, 4 laipsnius griperiui | Atmestas su 409, jei perėmimas buvo pradėtas vadovo režime |
| Slankikliai | Absoliutus tikslas, nusiųstas į perėmimo nustatymą galutinį tašką | Daugiausia 6 laipsnius kelionės link tikslo per skambutį; sąsaja nuolat siunčia maždaug dešimt kartų per sekundę | Atmestas su 409, jei perėmimas buvo pradėtas vadovo režime |
Spaustukai yra nustačius serverio pusėje, o ne sąsajoje, nes sumaišytas delta autobuso servo rankoje yra susidūrimas. Klaviatūros pataisos atsiranda žingsnio po žingsnio ir šiek tiek grubios; slankiklių pataisos yra sklandesnės, nes serveris eina link tikslo, kol sąsaja nuolat teka. Bet kokiu atveju veiksmų stulpelis gauna pilną vadovavimo pose vektorių ir intervencijos žymėjimas yra identiškas vadovo keliui, todėl klaviatūros pataisos nusileidžia tame pačiame duomenų rinkinyje be formato skirtumo.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Kada paspauskite mygtuką
Anksčiau nei vėliau. Pataisymas, kuris prasideda po to, kai gripreris uždarė nieką, moko atsigauti iš nesėkmės, kurią strategija neturėjo įvesti, ir atsigavimo duomenys yra verti daug mažiau nei išvengimo duomenų. Nutraukti tą akimirką, kai esate tikri, kad trajektorija klaidinga, ištaisyti per sunkią dalį, grąžinti, kai tik valstybė yra ta, kurią strategija tvariau. ThriftyDAgger automatizuoja šią sprendimą gatvėmis intervencijomis novelės ir numatytoje rizikoje pagal fiksuotą žmogų biudžetą, tačiau vienoje rankoje su žmogumi jau žiūrėti, žmogaus vartai yra pigesni ir geriau kalibruoti nei bet kas, ką jūs regudiransite.
Įmanomas su atviro kodo stogu ir keliomis scenarijais. Ką tai kainuoja, yra buhalterija, ir buhalterija yra kur DAgger raundai miršta.
- Sukraukite kadrus iš savo pačių išvados scenarijaus į LeRobot duomenų rinkinį, naudodami užduoties eilutę, kurią strategija buvo treniruota.
- Pauzuoti strategijos ciklą, pakeisti komandos šaltinį ir pažymėti kiekvieną kadrą, kurį varote kaip intervenciją. Be žymės, pataisos atrodo kaip įprastos demonstracijos.
- Tiesiog nusprendžite, kas atsitinka perėjimo kadrams tarp strategijos atleidimo valdiklio ir jūsų pirmojo įvesties.
- Laikyti pataisas savo duomenų rinkinyje per politiką ir sekite epizodo indeksus rankiniu, kad mišrį būtų galima atkurti.
- Nukreipkite smultaus reguliavimo įvesties tašką prie ankstesnio kontrolinio taško ir patikrinkite žurnale, kad jis įkėlė šiuos svorius.
Tie patys šeši žingsniai egzistuoja kaip mygtukai. Kas yra automatizuota, yra tai, ką lengva gauti nepaliaujamai rankiniu: per kadro intervencijos žymė, skaidymas tarp pataisų ir įvertinimų ir kurio kontrolinio taško įrašas pagamino kuris mišrį. Nieko nėra suddėtas duomenų rinkinys, kurio jūs nepasirinkote.
Tai nusprendžia jums. Kuris bėgimas yra pataisymas, kurie epizodai patenka į mišrį ir kai nustoti lieka sprendimai. Laukai yra dokumentuoti treniravimas, įvesties režimai teleoperacija.
Žingsnis 3 išsamiai: kategorija nusprendžia kokybę
Po bėgimo turite įrašymą, kurio kadrų pažymėti kaip intervencijos. Egzistuoja trys paskirties vietos ir neteisinga vieta tyliai nutraukia kitą raundą.
- Failui kaip pataisą, kai intervencija buvo tikra išraiška: strategija ėjo kažkur ne taip ir jūsų įvestis parodė teisingą dalyką iš valstybės, kurią strategija pati pagamino.
- Laikyti kaip įvertinimą už švarias autonominių bėgimų ir bėgimams, kuriuos jūs perimote iš atsargumo. Įvertinimo epizodai yra tai, kaip jūs matuojate kitą kontrolinį tašką, ir jie niekada turi būti treniruoti.
- Atmesti bėgimams sugadinti kažkuo nesusijusiu - iškritusi kamera kadras, sustingęs servo, objektas, kurį jūs susviedėte. Netvarkinga pataisymas yra blogiau nei jokia pataisymas.
Tarp strategijos atleidimo valdiklio ir jūsų pirmojo įvesties, ranka laiko ramybę, o grafdvirtintojas toliau rašo - palei tą patį dydį su šiek tiek skirtingomis nuotraukomis. Čia tas perdavimo kadrų lieka žaliame įrašyme ir iš pataisų duomenų rinkinio. Jei sudėlysite ciklą patys, supjaustykite juos tiesiog: strategija, kuri buvo treniruota juose, mokosi pauzuoti kur turėtų veikti.
Žingsnis 5 išsamiai: mišraus suvienybinimas
Suvienybinimas dalyvauja pirminiai duomenų rinkinys ir pataisų rinkinys ir pagamina naują, įprastą LeRobot duomenų rinkinys kurie treniruojami kaip bet kurie. Svarbi savybė yra, kad epizodo pasirinkimas yra aiškus pagal šaltinį - nieko nemaišemate automatiniu būdu. Tai skamba maža, kol pirmą kartą strategija elgiasi keistai ir jūs turite atkurti, ką ji buvo treniruota.
Atvirasis klausimas yra santykis, ir niekas neturi skaičiaus, kuris perduodamas. Ką literatūra sutinka yra, kad pataisos turėtų skaityti daugiau nei jų kadro dalina. Mandlekar ir kt. persigrupinas iteratyviai duomenimis, kurie jų intervencijos sistema renkasi, todėl strategija sužino, kaip pereiti kritinių taškų, ir praneša, kad agentai, mokomi tokiu būdu, pergalėti agentus, mokytus su lygiaverte kiekio pavyzdžių iš neintervencionalinių demonstrantų. Sirius eina toliau ir persvarsto treniravimo pavyzdžius pagal maždaugą žmogaus pasitikėjimą, praneša apie 8 procentų padidėjimą modeliavime ir 27 procentus realaus hardware politikos sėkmės dažniui prieš palygintas metodus, du kartus didesnį konvergencijos greitį. Nė vienas iš čia esančios treniravimo įvesties taškų neeksponavusi mėgintuvos svėrimo mėgdžio, todėl šiurkštas vietos yra laikyti kiekvieno pataisų epizodo, o iš dalies išduodan originalinius demonstrantus - ir parašo, ką jūs padarėte.

Žingsnis 6 išsamiai: ką tęsti iš kontrolinio taško iš tiesų reiškia
Treniruoti mišrį iš pagrindinio modelio veikia, bet nustoja ankstesnio raundo ir kainuoja pilnu bėgimu. Tęsimas iš ankstesnio kontrolinio taško yra greičiau ir paprastai geriau. Tai taip pat ribotin nei sakinio pasiūlo.
Tik svorio kontrolinis taškas sudaro parametrus ir nieką daugiau. Tada jį atidarant duoda kitam bėgimui geresnį pradžios tašką nei pagrindinis modelis, bet optimizatoriaus momentus, greičio sąmata vieta ir duomenų eilė visi prasideda nuo nulio. Numatykite nuostolį šuolį pradžioje tęstas bėgimo, neskaitykite kaip nesėkmės ir nesigausite raundo atnaujinimas. Tai yra šiltas pradžios.
| Politika | Dydis | GPU sluoksnį | Išvada pagal veiksmų žingsnį | Duomenų rinkinių formatas | Epizodai prieš jį verta mėginti |
|---|---|---|---|---|---|
| GR00T N1.7 | maždaug 3 B, maždaug 40 M treniruoti smultaus reguliavimo metu | A100 80 GB arba H100 80 GB | apie 152 ms | LeRobot v2.0 arba v2.1 | 50 |
| GR00T N1.5 | apie 3 B | A100 80 GB arba H100 80 GB | apie 165 ms | LeRobot v2.0 arba v2.1 | 50 |
| Pi0.5 | apie 3 B ant PaliGemma nugaros | A100 80 GB arba H100 80 GB | maždaug 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | apie 450 M | RTX 4090 arba bet kuris 24 GB kortelė | apie 245 ms | LeRobot v3.0 | 30 |
| ACT | apie 80 M, treniruoti iš nulio | RTX 4090 arba bet kuris 24 GB kortelė | apie 20 ms | LeRobot v3.0 | 50 |
Latencija sudėtinga DAgger ciklo viduje taip, kaip ji nėra per demo: apie 485 ms per veiksmų žingsnį jūs perimate, nes ranka abejingai, o ne todėl, kad ji klaidinga, ir abejingai pataisos nėra naudingi treniravimo duomenys. Jei kartojate duomenis, o ne vejus galinį sėkmės dažnį, kartojate greitą modelį. Shukor ir kt. aprašo SmolVLA kaip skirtas treniruoti vienoje GPU ir išduoti vartotojo GPU arba CPU, su asinchroniais išvados stogo, kuris atpalaiduoja veiksmų prognozę iš vykdymo, kad leistų aukštesnius valdiklius - savybė, kuri saugo perėmimo ciklą atsakingą.
Duomenų rinkinių formatai nėra keičiami. GR00T dalyvauja LeRobot v2.0 arba v2.1, ir Isaac-GR00T saugykla aprašo savo įvestį kaip LeRobot v2 formato skonį su pridėto modalumo aprašymo failu; naujesni mokytojai tikisi v3.0. Mišrį suvienybinti klaidingoje versijoje nepavyksta jį vadinti, o ne geros strategijos pagaminti - geresnė nesėkmės režimas, vis dar susirgę eilės vietos. duomenų rinkinių dokumentacija sąrašai, kurias formatyti treniruoja priimauti.
Ciklas, kai buhalterija jau padaryta
Perėmimas su vadovaujanče ranke, klaviatūra ar slankikliais; per kadro intervencijos žymė; eilutės bėgimų kaip pataisos ar įvertinimai; suvienybinti mišrų duomenų rinkinį su aiškiu epizodo pasirinkimu pagal šaltinį; ir tęsti mokymąsi iš kontrolinio taško, o ne pagrindinis modelis. Ką lieka jūsų sprendimas yra kuris bėgimas skaityti kaip pataisymas, kas patenka į mišrį ir kai stoti intervencijos dalis.
Pamatyti, kaip DAgger ciklas yra nuomojamasKeturi būdai, kurie švaistė raundą
1. Treniravimas tik pataisose
Labiausiai bendras nesėkmė ir labiausiai pagundimas nuotrauka. Pataisymo tik duomenų rinkinys beveik visiškai sunkios užduoties vidurys, su artėjimo ir pasitraukimų; strategija gauna geriau sunkioje dalies ir pamiršti, kaip ten atvykti. Agregacija nėra naudojimo detalė metodę, tai yra mechanizmas: senieji duomenys yra tai, kas laiko likutį elgesio vietoje, kol pataisos perkelti vieno dalies.
2. Kamera tarp raundų
Kamera, kuri persigrupi du centimetrai tarp raundų, pagamina strategiją blogiau nei ta, kuri jūs pradėjote, ir diagnozę, kuri kainuoja dieną. Kiekvienas VLA čia sąlyguoja nuotraukas; bendro valstybė vienas neperaiškina kur objektas yra. Fotografavote nuostatą prieš pirmą raundą ir patikrinkite tą nuotrauka prieš kiekviena vėlesnę.
3. Leisti perdavimo artefaktams į treniravimą
Aprašytas virš ir sąraše, nes jis nematomas. Simptomu yra strategija, kuri sustingta maži antri tiksliai kur ankstesnio raundo operatorius perimtas. Tai atrodo kaip abejingai; tai yra imitacija.
4. Skambina šilumos pradžia resumu
Jei tikėtės, kad optimizatoriaus valstybė persikelti, pradinis nuostolį šuolį skaito kaip klaidą ir jūs medžiosite sugadintą duomenis. Jei žinote, kad optimizatorius pradėjo šviežią, šuolų yra numatytas ir jūs žiūrite, ką jis atkeliavo. Tie patys skaičiai, priešingi išvados.
Matuojantis raundą
Metrika žmogaus vartai ciklo yra intervencijos dalis: kadrų, įrašytų, kol jūs buvote valdiklio, padalytas pagal visą bėgimo kadrus. Tai yra perėmimo statusis ir tik numeris, kuris atsakyti klausimą raundas paklausė. Treniravimo nuostolis krenta, ar politika pagerėjo; sėkmės dažnis yra dvejetainis ir triukšmingas ties pavyzdžių dydžius staigoje rankoje. Intervencijos dalis yra nuolatinis, matuojama ant valstybių, kurias strategija sukėlė, ir jis krenta nuo strategijos reikia jūs mažiau.
Palyginti jį tik tarp bėgimų, įrašytų pagal vienodas sąlygas. Pilnų argumentas ir kaip sudaryti įvertinimų rinkinį, kuris traukia daugiau nei du raundus yra straipsnis dėl DAgger ciklo matavimo. Pirmas raundas yra realingas testas realybė: jūs tikrinate, kad perėmimas veikia jūsų aparatūros, kad pataisos nusileidžia nuo savo vėliavų, ir tęstas bėgimas nukreiptas kontrolinis taškas, kurį pavadinote. Antra ir trečia raundai yra kur lygis turėtų prasidėti judantis. Jei jis judėjo keturais raundai, problema yra aukštesnė nuo DAgger.
| Parašo pagal raundą | Kodėl tai svarbu vėliau |
|---|---|
| Kontrolinis taškas, kuris buvo varomas | Be jo jūs negalite atributi patobulinimą į mišrį |
| Įvesties režimas, naudojamas perėmimui | Klaviatūros pataisos yra grubesnės nei vadovo pataisos ir jis rodo duomenyse |
| Bėgimų skaičius ir kaip kiekvienas buvo kategorija | Ar raundas turėjo pakankamai pataisų reikalingo |
| Intervencijos dalis pagal bėgimą ir vidutinę | Ciklo progreso metrika |
| Tikslus epizodo pasirinkimas pagal šaltinį | Vienintelis būdas atkurti ar atšaukti raundą |
| Šiltas pradžia arba šviežias mokymas | Paaiškina nuostolį kreivę, kurią jūs žiūrėsite savaitę |
Jei jūs dar neturite kontrolinio taško
Ciklas turi nėra galinio taško be vieno. Įrašykite pirmą duomenų rinkinį, treniruokite pirmą politiką, paleiskite ją - įrašymas, treniravimas ir veikiantis politika padaryti tą kelią. Įrašymo kliento yra parsisiuntimo puslapis, GPU sluoksniais ir valandos sudarymo kainų puslapis, ir ką panaudojama epizodą atrodo SO-100 duomenų rinkinio vadovas. Paprašoti demonstracijas tiesaus, kol pataisos: DAgger yra jų remontas mechanizmas ir jis veikia daug geriau ant kažko, kurie buvo beveik tiesiog jau.
Galiu paleisti DAgger ciklą be vadovaujančios rankos?▾
Taip. Pasirinkite klaviatūrą ar slankiklį įvestį, kai paspauskite Perimti: perėmimas yra nedelsdamas ir rankinis, be antros rankos, kad išlygintas. Klaviatūra siunčia santykinius stumtelėjimus, kuriuos serveris sunkiai užkemša 2 laipsnius per sandį ir 4 griperiui; slankikliai siunčia absoliutų tikslą ir serveris juda daugiausiai 6 laipsniu prie jo skambučio, kol sąsaja nuolat teka. Veiksmų stulpelis ir intervencijos žymėjimas yra tie patys, kaip ir vadovo režime, todėl pataisos nėra atskirtos duomenų rinkinyje.
Kiek pataisų vienas raundas turi?▾
Nėra gintinas universalus skaičius, ir kadro skaičius svarbesnis nei epizodo skaičius. Darbinio taisyklė yra, kad pataisos turi būti nepralaimėtos mišryje: su 200 originalių epizodų ir trijų pataisų epizodų, nieko neperkeltinas. Tikslas pataisas, kurios dengia sutrikimą elgesį iš kelių pradžios nuteisimų, o ne trijų to paties gelbėjimo pakartojimų.
Kodėl treniravimas tik pataisų yra tokia bloga idėja?▾
Nes pataisos beveik visiškai sunkios užduoties vidurys. Artėjimo, išlyginimas ir pasitraukimas yra nesami, todėl strategija praranda tai, ką jau gerai padarė, o pagerėjo tą dalį jūs ištaisėte. Saugomas senusi duomenys ir pridėjus į juos yra mechanizmas pats, ne neprivaloma papildas.
Ar tęsimas iš kontrolinio taško atnaujina ankstesnio mokymo bėgimą?▾
Ne. Tik svorio kontrolinis taškas atkuria parametrus ir nieką daugiau: optimizatoriaus momentus, greičio grafikas vieta ir duomenų eilė pradedami šviežia. Tai yra šiltas pradžia, ir pradinis nuostolį šuolį numatytas, o ne simptomu. Parašo, kuris iš dviejų jūs iš tiesų padarėte, todėl jūs skaitote kreivę teisingai savaitę vėliau.
Kas jei intervencijos dalis nenukrenta?▾
Sustabdyti pridėti raundus. Plokščios normos reiškia, kad pataisos nėra mokyti ką jūs manyti. Įprasti priežastys yra aukštesnės: kamera judėjo, pataisos prasideda per vėlai, kad būtų išvengimo duomenys, perdavimo kadrai yra treniravimo rinkinyje arba užduotis nėra nustatyta iš stebėjimų strategija iš tiesų gauna.
Nieko iš to nėra išspręstas klausimas ir nieka iš to nėra vienas klikimas. Interaktyvus imitacinis mokymasis yra aktyvi mokslinių tyrinėjimų sritis, nes jos klausimai - kada sudaryti, kaip svėrimas ką žmogus padarė, kiek senieji duomenys laikyti - nėra jokios nusistovėję atsakymai; apžvalga pagal Celemin ir kt. žemlapiai, kas vis dar atvira. Ką ciklas turi yra matuojamas konvergencija, kai jis yra vykdytas atsargiai, ant aparatūros, kuri kainuoja kelis šimtus eurų. Užšaldyti nustatymą, sudaryti anksti, kategorija sąžiningu, mišriu tiesiog ir įrašo intervencijos dalį kiekvieną kartą.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started