Policy mokymas
AY-Robots treniruoja manipuliacijos policy valdomose GPU, todėl galite pereiti nuo įrašytų epizodų iki policy, veikiančios jūsų rankoje, neturėdami savo mokymo aparatinės įrangos. Šis puslapis apima palaikomus policy tipus, mokymo darbo puslapį, checkpoint bei tai, kokių rezultatų realiai tikėtis pagal jūsų epizodų skaičių.
Paskutinį kartą atnaujinta 2026-08-09
Mokymas be savo GPU
Manipuliacijos policy treniravimas yra GPU darbo krūvis, o šiuolaikiniai vision-language-action modeliai reikalauja daugiau VRAM, nei turi tipinė darbo stotis. AY-Robots platformoje mokymas vyksta platformos valdomose debesies GPU: pasirenkate duomenų rinkinį ir policy tipą, paleidžiate procesą ir stebite jo eigą iš naršyklės. Nereikia CUDA sąrankos, tvarkyklių derinimo ar aplinkos priežiūros.
Įvestis visada yra debesies duomenų rinkinys iš Dashboard > Datasets. Tinka viskas, ką įrašėte per teleoperacijos sesijas ar įkėlėte LeRobot formatu, įskaitant sujungtus duomenų rinkinius. Sutvarkykite prieš treniruodami: Failure žymėti epizodai dažniausiai neturėtų patekti į mokymo rinkinį, o dešimt minučių peržiūros epizodų naršyklėje sutaupo valandas GPU laiko, praleisto mokantis iš blogų demonstracijų.
Palaikomos policy
Palaikomos keturios policy šeimos. Jos skiriasi dydžiu, mokymo kaštais ir tuo, kiek gali įsisavinti iš jūsų duomenų, todėl teisingas pasirinkimas priklauso nuo jūsų užduoties ir duomenų rinkinio labiau nei nuo bet kokio bendro reitingo.
| Policy | Tipas | Ypatybės |
|---|---|---|
| ACT | Transformer, veiksmų grupavimas | Numato trumpas būsimų veiksmų grupes, o ne pavienius žingsnius. Kompaktiška, treniruojasi palyginti greitai ir yra tvirtas pirmasis pasirinkimas vienai aiškiai apibrėžtai užduočiai. |
| Diffusion Policy | Difuzija per veiksmų sekas | Modeliuoja pilną demonstruotų veiksmų pasiskirstymą, kas padeda, kai jūsų demonstracijos sprendžia užduotį daugiau nei vienu galiojančiu būdu. Sunkesnė treniruoti ir lėtesnė išvadai nei ACT. |
| SmolVLA | Mažas vision-language-action modelis | Kalba grįstas: užduoties tekstas iš jūsų epizodų tampa įvesties dalimi. Geras vidurio kelias, kai norite kalbinio grindimo be didelio pamatinio modelio. |
| GR00T fine-tune | Pamatinio modelio fine-tune | Fine-tune didelio, iš anksto treniruoto robotikos pamatinio modelio ant jūsų epizodų. Aukščiausia iš keturių riba, už aukščiausią mokymo kainą, su griežtu duomenų rinkinio formato reikalavimu. |
GR00T fine-tune priima tik duomenų rinkinius LeRobot formato versijos 2.1. v3.0 duomenų rinkinys nepavyks duomenų įkėlimo metu, ne pateikimo metu, todėl patikrinkite formato versiją prieš pradėdami procesą. Platformoje įrašyti duomenų rinkiniai gali būti naudojami tokie, kokie yra; išoriniams įkėlimams pirmiausia patikrinkite versiją meta/info.json faile.
Proceso paleidimas
- 1Pasirinkite duomenų rinkinį
Atidarykite Dashboard > Training ir pasirinkite duomenų rinkinį, kuriuo treniruosite. Rodomas epizodų skaičius ir roboto tipas, todėl galite patvirtinti, kad pasirinkote tinkamą.
- 2Pasirinkite policy
Pasirinkite vieną iš palaikomų policy tipų. Jei nesate tikri, pradėkite nuo ACT: tai pigiausias būdas sužinoti, ar jūsų duomenų rinkinys pakankamai geras, kad iš viso ką nors ištreniruotų.
- 3Paleiskite
Pradėkite procesą. Jis gauna job id ir savo darbo puslapį, o naršyklę galite uždaryti: mokymas tęsiasi serverio pusėje, o puslapis rodo gyvą būseną, kai tik sugrįžtate.
Mokymo darbo puslapis
Kiekvienas procesas turi skirtą puslapį, atsakantį į du klausimus, kurie jums iš tikrųjų kyla mokymo metu: ar mokosi ir ar mašina sveika. Mokymosi eiga rodoma kaip loss, mokymosi greičio grafiko ir gradiento normos grafikai. Loss, kuris iškart pasiekia plokščiakalnį, arba gradiento norma, kuri sprogsta, anksti pasako, kad procesas nevertas laukimo.
Mašinos sveikata rodoma šalia: GPU apkrova ir atmintis, kartu su mokymo mašinos host metrikomis. Fazių laiko juosta rodo, kurioje stadijoje procesas šiuo metu yra, nuo aplinkos paruošimo per duomenų įkėlimą, patį mokymo ciklą ir iki checkpoint įkėlimo. Kai kas nors atrodo negerai, įmontuota žurnalo peržiūros priemonė suteikia žalius mokymo žurnalus be jokios SSH prieigos, dažniausiai to pakanka pamatyti, ar gedimas kyla iš jūsų duomenų rinkinio, ar iš paties proceso.
Checkpoint ir tęsimas
Checkpoint saugomi pagal procesą, ne bendrame fonde, todėl darbo puslapyje išvardyti checkpoint visada priklauso būtent tam procesui ir jo konfigūracijai. Tai svarbiau, nei skamba: checkpoint maišymas tarp procesų su skirtingais nustatymais yra klasikinis tyliai sugadintų policy šaltinis.
Jei procesas nutrūksta, galite tęsti nuo paskutinio jo checkpoint, o ne pradėti iš naujo. Tarpiniai checkpoint taip pat naudingi patys savaime: kai ilgas procesas artėjant pabaigai pradeda persitreniruoti, ankstesnis checkpoint dažnai veikia geriau tikroje rankoje nei paskutinis.
Ištreniruotos policy paleidimas jūsų rankoje
Baigtą policy galima grąžinti tiesiai atgal į jūsų robotą. Kabinoje pasirinkite ištreniruotą policy savo prijungtai rankai ir pradėkite išvadą: policy dabar generuoja sąnarių komandas, kurias anksčiau generuodavote teleoperuodami. Ranka turi būti to paties roboto tipo, ant kurio buvo įrašytas duomenų rinkinys, o scena turėtų priminti mokymo scenas, įskaitant kamerų išdėstymą.
Traktuokite pirmuosius išvados paleidimus kaip eksperimentus, ne kaip demonstracijas. Laikykite avarinį stabdymą po ranka, pradėkite nuo pradinės būsenos, artimos tai, ką demonstravote, ir tikėkitės, kad policy bus jautri dalykams, kurių nepastebėtumėte: pajudinta kamera, kitokia apšvieta ar objektas, kurio duomenų rinkinys niekada neturėjo.
Kiek epizodų reikia
Dažniausia mokymo klaida platformoje nėra neteisingas hiperparametras, tai treniravimas per mažai duomenų ir išvada, kad policy tipas neveikia. Kaip taisyklė vienai stalo užduočiai: apie 50 epizodų suteikia policy su siauru apibendrinimu, kuri pasiseka iš pradinių būsenų, artimų toms, kurias demonstravote. Apie 100 iki 200 epizodų suteikia naudingą patvarumą visoje darbo erdvėje tai vienai užduočiai, jei tarp epizodų keitėte objektų išdėstymą.
Galingesni policy tipai to nepanaikina. GR00T fine-tune su 20 epizodų vis tiek apibendrins prastai; didesni modeliai suteikia geresnę ribą, kai duomenys jau yra. Jei jūsų biudžetas ribotas, skirkite jį įvairesniems epizodams, o ne didesniam modeliui.
Dažnai užduodami klausimai
Kiek trunka mokymo procesas?▾
Tai priklauso nuo policy tipo ir duomenų rinkinio dydžio, todėl sąžiningo vieno skaičiaus nėra. ACT dažniausiai yra greičiausias iš keturių, GR00T fine-tune lėčiausias. Fazių laiko juosta ir loss grafikai darbo puslapyje anksti parodo, ar procesas juda į priekį.
Ar galiu treniruoti su sujungtu duomenų rinkiniu?▾
Taip. Sujungti duomenų rinkiniai yra paprasti duomenų rinkiniai; sujungimo patvirtinimas jau užtikrino nuoseklų fps, požymius ir roboto tipą. Tos pačios užduoties įrašų sujungimas yra vienas efektyviausių būdų pasiekti 100 iki 200 epizodų diapazoną.
Mano GR00T procesas nepavyksta duomenų įkėlimo metu. Ką pirmiausia tikrinti?▾
Duomenų rinkinio formato versiją. GR00T fine-tune reikalauja LeRobot v2.1, o v3.0 duomenų rinkinys nepavyksta būtent ten. Patikrinkite versiją savo duomenų rinkinio meta/info.json faile.
Ar prieš treniruodamas turėčiau pašalinti nepavykusius epizodus?▾
Paprastai taip. Failure žymėti epizodai moko policy nepavykusio elgesio. Recovery epizodai skiriasi: jie parodo, kaip ištaisyti klaidą, ir dažnai verta juos palikti.
Ar mokymo metu turiu laikyti naršyklę atidarytą?▾
Ne. Procesai vykdomi serverio pusėje. Darbo puslapis rodo dabartinę būseną, grafikus ir žurnalus, kai tik sugrįžtate, o checkpoint išsaugomi nepriklausomai nuo to, ar kas nors stebi.
Kaip AY-Robots saugo teleoperacijos įrašus LeRobot formatu: epizodų struktūra, valdymo skydelio naršyklė, įkėlimų sujungimas ir duomenų rinkinių prekyvietė.
Kiekviena AY-Robots platformoje palaikoma roboto ranka su specifikacijomis: SO-100, Koch v1.1, Franka FR3, FP3 ir Panda, WidowX-250 bei ALOHA ViperX-300.