Treniranje policy-ja

AY-Robots trenira policy-je za manipulaciju na upravljanim GPU-ovima, pa možete od snimljenih epizoda da dođete do policy-ja koji radi na vašoj ruci bez posedovanja hardvera za treniranje. Ova stranica pokriva podržane tipove policy-ja, stranicu treninga, checkpoint-ove i kakve rezultate realno da očekujete u odnosu na broj epizoda.

Poslednje ažurirano 2026-08-09

Treniranje bez sopstvenog GPU-a

Treniranje policy-ja za manipulaciju je GPU opterećenje, a savremenim vision-language-action modelima treba više VRAM-a nego što ga ima tipična radna stanica. Na AY-Robots treniranje se odvija na cloud GPU-ovima kojima upravlja platforma: izaberete dataset i tip policy-ja, pokrenete trening i pratite napredak iz pregledača. Nema CUDA podešavanja, nema usklađivanja drajvera i nema okruženja koje treba održavati.

Ulaz je uvek cloud dataset iz Dashboard > Datasets. Sve što ste snimili kroz sesije teleoperacije ili otpremili u LeRobot formatu je prihvatljivo, uključujući spojene dataset-ove. Kurirajte pre treniranja: epizode označene kao Failure obično ne pripadaju u trening skup, a deset minuta pregleda u pregledaču epizoda štedi sate GPU vremena potrošenog na učenje iz loših demonstracija.

Podržani policy-ji

Podržane su četiri porodice policy-ja. Razlikuju se po veličini, trošku treniranja i koliko mogu da upiju iz vaših podataka, pa pravi izbor zavisi više od vašeg zadatka i dataset-a nego od bilo kog opšteg rangiranja.

PolicyVrstaKarakteristike
ACTTransformer, action chunkingPredviđa kratke blokove budućih akcija umesto pojedinačnih koraka. Kompaktan je, trenira se relativno brzo i solidan je prvi izbor za jedan jasno definisan zadatak.
Diffusion PolicyDifuzija nad sekvencama akcijaModeluje punu distribuciju demonstriranih akcija, što pomaže kada vaše demonstracije rešavaju zadatak na više validnih načina. Teži za treniranje i sporiji pri inferenciji od ACT-a.
SmolVLAMali vision-language-action modelUslovljen jezikom: string zadatka iz vaših epizoda postaje deo ulaza. Dobar srednji put kada želite jezičko uslovljavanje bez velikog foundation modela.
GR00T fine-tuneFine-tune foundation modelaFine-tune-uje veliki unapred treniran foundation model za robotiku na vašim epizodama. Ima najviši plafon od sve četiri, uz najviši trošak treniranja i strog zahtev za format dataset-a.
GR00T zahteva LeRobot v2.1 dataset-ove

GR00T fine-tuning prihvata samo dataset-ove u LeRobot formatu verzije 2.1. Dataset verzije v3.0 neće uspeti tokom učitavanja podataka, ne prilikom predaje, pa proverite verziju formata pre nego što pokrenete trening. Dataset-ovi snimljeni na platformi mogu se koristiti onakvi kakvi jesu; za spoljne otpremljene fajlove prvo proverite verziju u meta/info.json.

Pokretanje treninga

  1. 1
    Izaberite dataset

    Otvorite Dashboard > Training i izaberite dataset na kom ćete trenirati. Broj epizoda i tip robota su prikazani kako biste potvrdili da ste izabrali pravi.

  2. 2
    Izaberite policy

    Izaberite jedan od podržanih tipova policy-ja. Ako niste sigurni, počnite sa ACT-om: to je najjeftiniji način da saznate da li je vaš dataset dovoljno dobar da se na njemu uopšte bilo šta istrenira.

  3. 3
    Pokrenite

    Pokrenite trening. Dobija job id i sopstvenu stranicu treninga, a pregledač možete da zatvorite: treniranje se nastavlja na strani servera, a stranica prikazuje stanje uživo kad god se vratite.

Stranica treninga

Svaki trening ima namensku stranicu koja odgovara na dva pitanja koja zaista imate tokom treniranja: da li uči i da li je mašina zdrava. Napredak učenja je prikazan kao grafikoni gubitka, rasporeda stope učenja i norme gradijenta. Gubitak koji odmah dostigne plato ili norma gradijenta koja eksplodira rano vam govori da trening nije vredan čekanja.

Zdravlje mašine je prikazano uz to: iskorišćenost i memorija GPU-a, plus host metrike mašine za treniranje. Vremenska linija faza pokazuje gde se trening trenutno nalazi, od pripreme okruženja preko učitavanja podataka, same petlje treniranja, do otpremanja checkpoint-a. Kada nešto deluje čudno, ugrađeni pregledač loga daje vam sirove logove treninga bez ikakvog SSH pristupa, što je obično dovoljno da vidite da li je problem u vašem dataset-u ili u samom treningu.

Checkpoint-ovi i nastavak

Checkpoint-ovi se čuvaju po treningu, ne u zajedničkom bazenu, pa checkpoint-ovi navedeni na stranici treninga uvek pripadaju tačno tom treningu i njegovoj konfiguraciji. Ovo je važnije nego što zvuči: mešanje checkpoint-ova iz treninga sa različitim podešavanjima klasičan je izvor nečujno pokvarenih policy-ja.

Ako se trening prekine, možete da nastavite od njegovog poslednjeg checkpoint-a umesto da počnete iznova. Međukoraci checkpoint-ovi su korisni i sami po sebi: kada dugačak trening pred kraj počne da overfituje, raniji checkpoint često bolje radi na pravoj ruci od finalnog.

Pokretanje istreniranog policy-ja na vašoj ruci

Završen policy može se direktno primeniti nazad na vašeg robota. U kokpitu izaberite istreniran policy za povezanu ruku i pokrenite inferenciju: policy sada proizvodi komande zglobovima koje ste ranije proizvodili teleoperacijom. Ruka mora biti isti tip robota na kom je dataset snimljen, a scena treba da liči na trening scene, uključujući postavljanje kamera.

Prve pokrete inferencije tretirajte kao eksperimente, a ne kao demonstracije. Držite hitno zaustavljanje nadohvat ruke, počnite iz početnog stanja bliskog onom koje ste demonstrirali i očekujte da će policy biti osetljiv na stvari koje sami ne biste primetili: pomerenu kameru, drugačije osvetljenje ili predmet koji dataset nikada nije sadržao.

Koliko epizoda vam je potrebno

Najčešća greška u treniranju na platformi nije pogrešan hiperparametar, već treniranje na premalo podataka i zaključak da tip policy-ja ne radi. Kao okvirno pravilo za jedan zadatak na stolu: oko 50 epizoda daje vam policy sa uskom generalizacijom koji uspeva iz početnih stanja bliskih onima koje ste demonstrirali. Otprilike 100 do 200 epizoda daje upotrebljivu robusnost u celom radnom prostoru za taj jedan zadatak, pod uslovom da ste varirali postavljanje predmeta između epizoda.

Sposobniji tipovi policy-ja ne poništavaju ovo pravilo. GR00T fine-tune na 20 epizoda i dalje će generalizovati loše; ono što veći modeli donose je viši plafon čim podaci postoje. Ako vam je budžet ograničen, potrošite ga na raznovrsnije epizode pre nego na veći model.

Često postavljana pitanja

Koliko dugo traje trening?

Zavisi od tipa policy-ja i veličine dataset-a, pa ne postoji pošten jedinstven broj. ACT je obično najbrži od sve četiri, GR00T fine-tune-ovi najsporiji. Vremenska linija faza i grafikoni gubitka na stranici treninga rano pokazuju da li trening napreduje.

Mogu li da treniram na spojenom dataset-u?

Da. Spojeni dataset-ovi su obični dataset-ovi; validacija spajanja je već zagarantovala dosledne fps, karakteristike i tip robota. Spajanje snimaka istog zadatka jedan je od najefikasnijih načina da dostignete raspon od 100 do 200 epizoda.

Moj GR00T trening ne uspeva tokom učitavanja podataka. Šta prvo da proverim?

Verziju formata dataset-a. GR00T fine-tuning zahteva LeRobot v2.1, a dataset verzije v3.0 upravo tu ne uspeva. Proverite verziju u meta/info.json svog dataset-a.

Da li treba da uklonim neuspele epizode pre treniranja?

Obično da. Epizode označene kao Failure uče policy neuspešnom ponašanju. Recovery epizode su drugačije: pokazuju kako da se ispravi greška i često ih vredi zadržati.

Da li moram da držim pregledač otvoren tokom treniranja?

Ne. Treninzi se izvršavaju na strani servera. Stranica treninga prikazuje trenutno stanje, grafikone i logove kad god se vratite, a checkpoint-ovi se čuvaju bez obzira na to da li iko gleda.