Treniranje policy-ja

AY-Robots trenira policy za manipulaciju na upravljanim GPU-ima, tako da možete preći sa snimljenih epizoda na policy koja radi na vašoj ruci bez posjedovanja hardvera za treniranje. Ova stranica pokriva podržane tipove policy-ja, stranicu treninga, checkpoint-e i kakve rezultate realno očekivati od vašeg broja epizoda.

Zadnje ažurirano 2026-08-09

Treniranje bez vlastitog GPU-a

Treniranje policy-ja za manipulaciju je GPU opterećenje, a savremeni vision-language-action modeli zahtijevaju više VRAM-a nego što ima tipična radna stanica. Na AY-Robots treniranje se odvija na cloud GPU-ima kojima upravlja platforma: izaberete dataset i tip policy-ja, pokrenete trening i pratite napredak iz browsera. Nema podešavanja CUDA-e, nema usklađivanja drajvera i nema okruženja za održavanje.

Ulaz je uvijek cloud dataset sa Dashboard > Datasets. Prihvatljivo je sve što ste snimili kroz sesije teleoperacije ili otpremili u LeRobot formatu, uključujući spojene dataset-ove. Kurirajte prije nego što trenirate: epizode označene kao Failure obično ne pripadaju skupu za treniranje, a deset minuta pregleda u pregledaču epizoda štedi sate GPU vremena potrošenog na učenje iz loših demonstracija.

Podržane policy

Podržane su četiri porodice policy-ja. Razlikuju se po veličini, trošku treniranja i koliko mogu apsorbovati iz vaših podataka, pa pravi izbor zavisi više od vašeg zadatka i dataset-a nego od bilo kakvog opšteg rangiranja.

PolicyVrstaKarakteristike
ACTTransformer, grupisanje akcijaPredviđa kratke grupe budućih akcija umjesto pojedinačnih koraka. Kompaktna je, trenira se relativno brzo i solidan je prvi izbor za jedan dobro definisan zadatak.
Diffusion PolicyDifuzija nad sekvencama akcijaModeluje punu raspodjelu demonstriranih akcija, što pomaže kada vaše demonstracije rješavaju zadatak na više od jednog validnog načina. Teža za treniranje i sporija pri inferenci od ACT-a.
SmolVLAMali vision-language-action modelUslovljena jezikom: tekst zadatka iz vaših epizoda postaje dio ulaza. Dobar srednji izbor kada želite jezičko uslovljavanje bez velikog foundation modela.
GR00T fine-tuneFine-tune foundation modelaRadi fine-tune velikog, unaprijed treniranog foundation modela za robotiku na vašim epizodama. Najviši plafon od sva četiri, uz najviši trošak treniranja i sa strogim zahtjevom za formatom dataset-a.
GR00T zahtijeva LeRobot v2.1 dataset-ove

GR00T fine-tune prihvata samo dataset-ove u LeRobot formatu verzije 2.1. Dataset u v3.0 pašće tokom učitavanja podataka, a ne pri predaji, pa provjerite verziju formata prije nego što pokrenete trening. Dataset-ovi snimljeni na platformi mogu se koristiti onakvi kakvi jesu; za vanjske otpremljene fajlove, prvo provjerite verziju u meta/info.json.

Pokretanje treninga

  1. 1
    Izaberite dataset

    Otvorite Dashboard > Training i izaberite dataset na kojem ćete trenirati. Broj epizoda i tip robota su prikazani kako biste potvrdili da ste izabrali pravi.

  2. 2
    Izaberite policy

    Izaberite jedan od podržanih tipova policy-ja. Ako niste sigurni, počnite sa ACT-om: to je najjeftiniji način da saznate da li je vaš dataset uopšte dovoljno dobar za treniranje bilo čega.

  3. 3
    Pokrenite

    Pokrenite trening. Dobija job id i vlastitu stranicu, a browser možete zatvoriti: treniranje se nastavlja na serveru i stranica prikazuje trenutno stanje kad god se vratite.

Stranica treninga

Svaki trening ima posvećenu stranicu koja odgovara na dva pitanja koja zaista imate tokom treniranja: da li uči, i da li je mašina zdrava. Napredak učenja prikazan je kao grafikoni loss-a, raspored learning rate-a i norma gradijenta. Loss koji odmah stagnira ili norma gradijenta koja eksplodira rano vam kaže da trening nije vrijedan čekanja.

Zdravlje mašine prikazano je pored toga: iskorištenost i memorija GPU-a, plus metrike hosta mašine za treniranje. Vremenska linija faza pokazuje gdje se trening trenutno nalazi, od pripreme okruženja preko učitavanja podataka, samog ciklusa treniranja, do otpremanja checkpoint-a. Kada nešto izgleda čudno, ugrađeni pregledač zapisnika daje vam sirove zapisnike treninga bez ikakvog SSH pristupa, što je obično dovoljno da vidite da li je kvar u vašem dataset-u ili u samom treningu.

Checkpoint-i i nastavak

Checkpoint-i se čuvaju po treningu, a ne u zajedničkom pool-u, pa checkpoint-i navedeni na stranici treninga uvijek pripadaju upravo tom treningu i njegovoj konfiguraciji. Ovo je važnije nego što zvuči: miješanje checkpoint-a između treninga sa različitim postavkama klasičan je izvor tiho pokvarenih policy-ja.

Ako se trening prekine, možete nastaviti od njegovog posljednjeg checkpoint-a umjesto da počnete iznova. Međukontrolne tačke su korisne i same po sebi: kada dug trening pri kraju počne overfittovati, raniji checkpoint često radi bolje na pravoj ruci nego finalni.

Pokretanje istrenirane policy na vašoj ruci

Gotova policy može se direktno vratiti nazad na vašeg robota. U kokpitu izaberite istreniranu policy za svoju povezanu ruku i pokrenite inferencu: policy sada proizvodi komande za zglobove koje ste ranije proizvodili teleoperacijom. Ruka mora biti isti tip robota na kojem je dataset snimljen, a scena bi trebala ličiti na scene sa treninga, uključujući postavljanje kamera.

Tretirajte prve inferentne pokušaje kao eksperimente, a ne kao demonstracije. Držite hitno zaustavljanje nadohvat ruke, počnite od početnog stanja bliskog onome što ste demonstrirali, i očekujte da će policy biti osjetljiva na stvari koje ne biste primijetili: pomjerena kamera, drugačije osvjetljenje, ili predmet koji dataset nikada nije sadržavao.

Koliko epizoda vam treba

Najčešća greška u treniranju na platformi nije pogrešan hiperparametar, već treniranje na premalo podataka i zaključak da tip policy-ja ne funkcioniše. Kao okvirno pravilo za jedan zadatak na stolu: oko 50 epizoda daje vam policy sa uskom generalizacijom koja uspijeva iz početnih stanja bliskih onima koje ste demonstrirali. Oko 100 do 200 epizoda daje upotrebljivu robusnost kroz radni prostor za taj jedan zadatak, pod uslovom da ste varirali raspored predmeta između epizoda.

Sposobniji tipovi policy-ja ne ukidaju ovo pravilo. GR00T fine-tune na 20 epizoda i dalje će loše generalizovati; ono što veći modeli donose je viši plafon kada podaci već postoje. Ako vam je budžet ograničen, potrošite ga na više raznovrsnih epizoda prije nego na veći model.

Često postavljana pitanja

Koliko dugo traje trening?

Zavisi od tipa policy-ja i veličine dataset-a, pa ne postoji jedan pošten broj. ACT je obično najbrži od sva četiri, GR00T fine-tune-ovi najsporiji. Vremenska linija faza i grafikoni loss-a na stranici treninga rano pokazuju da li trening napreduje.

Mogu li trenirati na spojenom dataset-u?

Da. Spojeni dataset-ovi su obični dataset-ovi; validacija spajanja je već garantovala dosljedan fps, karakteristike i tip robota. Spajanje snimaka istog zadatka jedan je od najefikasnijih načina da se dostigne opseg od 100 do 200 epizoda.

Moj GR00T trening pada tokom učitavanja podataka. Šta prvo da provjerim?

Verziju formata dataset-a. GR00T fine-tune zahtijeva LeRobot v2.1, a dataset u v3.0 pada baš tu. Provjerite verziju u meta/info.json vašeg dataset-a.

Da li treba da uklonim neuspjele epizode prije treniranja?

Obično da. Epizode označene kao Failure uče policy neuspješnom ponašanju. Epizode Recovery su drugačije: pokazuju kako se ispravlja greška i često ih vrijedi zadržati.

Da li browser mora ostati otvoren tokom treniranja?

Ne. Treninzi se izvršavaju na serveru. Stranica treninga prikazuje trenutno stanje, grafikone i zapisnike kad god se vratite, a checkpoint-i se čuvaju bez obzira da li neko gleda.