Treniranje policyja

AY-Robots trenira policyje za manipulaciju na upravljanim GPU-ovima, pa možete od snimljenih epizoda doći do policyja koji radi na vašoj ruci bez posjedovanja hardvera za treniranje. Ova stranica pokriva podržane tipove policyja, stranicu treninga, checkpointove i kakve rezultate realno očekivati s obzirom na broj epizoda.

Zadnje ažurirano 2026-08-09

Treniranje bez vlastitog GPU-a

Treniranje policyja za manipulaciju GPU je opterećenje, a suvremenim vision-language-action modelima treba više VRAM-a nego što ga ima tipična radna stanica. Na AY-Robots treniranje se odvija na cloud GPU-ovima kojima upravlja platforma: odaberete dataset i tip policyja, pokrenete trening i pratite napredak iz preglednika. Nema CUDA postavljanja, nema usklađivanja upravljačkih programa i nema okruženja koje treba održavati.

Ulaz je uvijek cloud dataset iz Dashboard > Datasets. Sve što ste snimili kroz sesije teleoperacije ili prenijeli u LeRobot formatu prihvatljivo je, uključujući spojene datasetove. Kurirajte prije treniranja: epizode označene kao Failure obično ne pripadaju u trening skup, a deset minuta pregleda u pregledniku epizoda štedi sate GPU vremena potrošenog na učenje iz loših demonstracija.

Podržani policyji

Podržane su četiri obitelji policyja. Razlikuju se po veličini, trošku treniranja i koliko mogu upiti iz vaših podataka, pa pravi izbor ovisi više o vašem zadatku i datasetu nego o bilo kojem općenitom rangiranju.

PolicyVrstaKarakteristike
ACTTransformer, action chunkingPredviđa kratke blokove budućih akcija umjesto pojedinačnih koraka. Kompaktan, trenira se razmjerno brzo i solidan je prvi izbor za jedan jasno definiran zadatak.
Diffusion PolicyDifuzija nad sekvencama akcijaModelira punu distribuciju demonstriranih akcija, što pomaže kad vaše demonstracije rješavaju zadatak na više valjanih načina. Teži za treniranje i sporiji pri inferenciji od ACT-a.
SmolVLAMali vision-language-action modelUvjetovan jezikom: string zadatka iz vaših epizoda postaje dio ulaza. Dobar srednji put kad želite jezično uvjetovanje bez velikog foundation modela.
GR00T fine-tuneFine-tune foundation modelaFine-tunea velik unaprijed treniran foundation model za robotiku na vašim epizodama. Najviši je strop od sve četiri, uz najviši trošak treniranja i strog zahtjev za format dataseta.
GR00T zahtijeva LeRobot v2.1 datasetove

GR00T fine-tuning prihvaća samo datasetove u LeRobot formatu verzije 2.1. Dataset verzije v3.0 neće uspjeti tijekom učitavanja podataka, ne pri predaji, pa provjerite verziju formata prije nego što pokrenete trening. Datasetovi snimljeni na platformi mogu se koristiti onakvi kakvi jesu; za vanjske prijenose prvo provjerite verziju u meta/info.json.

Pokretanje treninga

  1. 1
    Odaberite dataset

    Otvorite Dashboard > Training i odaberite dataset na kojem ćete trenirati. Broj epizoda i tip robota prikazani su kako biste potvrdili da ste odabrali pravi.

  2. 2
    Odaberite policy

    Odaberite jedan od podržanih tipova policyja. Ako niste sigurni, počnite s ACT-om: to je najjeftiniji način da saznate je li vaš dataset dovoljno dobar da se na njemu uopće nešto istrenira.

  3. 3
    Pokrenite

    Pokrenite trening. Dobiva job id i vlastitu stranicu treninga, a preglednik možete zatvoriti: treniranje se nastavlja na strani servera, a stranica prikazuje stanje uživo kad god se vratite.

Stranica treninga

Svaki trening ima namjensku stranicu koja odgovara na dva pitanja koja stvarno imate tijekom treniranja: uči li se i je li strojno zdravo. Napredak učenja prikazan je kao grafikoni gubitka, rasporeda stope učenja i norme gradijenta. Gubitak koji odmah dosegne plato ili norma gradijenta koja eksplodira rano vam govori da trening nije vrijedan čekanja.

Zdravlje stroja prikazano je uz to: iskorištenost i memorija GPU-a, plus host metrike stroja za treniranje. Vremenska crta faza pokazuje gdje se trening trenutno nalazi, od pripreme okruženja preko učitavanja podataka, same petlje treniranja, do prijenosa checkpointa. Kad nešto djeluje čudno, ugrađeni preglednik zapisnika daje vam sirove zapise treninga bez ikakvog SSH pristupa, što je obično dovoljno da vidite je li problem u vašem datasetu ili u samom treningu.

Checkpointovi i nastavak

Checkpointovi se pohranjuju po treningu, ne u zajedničkom bazenu, pa checkpointovi navedeni na stranici treninga uvijek pripadaju točno tom treningu i njegovoj konfiguraciji. Ovo je važnije nego što zvuči: miješanje checkpointova iz treninga s različitim postavkama klasičan je izvor tiho pokvarenih policyja.

Ako se trening prekine, možete nastaviti od njegovog posljednjeg checkpointa umjesto da počnete iznova. Međukoraci checkpointovi korisni su i sami po sebi: kad dugi trening pred kraj počne overfittati, raniji checkpoint često bolje radi na pravoj ruci od finalnog.

Pokretanje istreniranog policyja na vašoj ruci

Dovršen policy može se izravno primijeniti natrag na vašeg robota. U kokpitu odaberite istreniran policy za spojenu ruku i pokrenite inferenciju: policy sada proizvodi naredbe zglobovima koje ste prije proizvodili teleoperacijom. Ruka mora biti isti tip robota na kojem je dataset snimljen, a scena bi trebala nalikovati trening scenama, uključujući postavljanje kamera.

Prve pokrete inferencije tretirajte kao eksperimente, ne kao demonstracije. Držite hitno zaustavljanje nadohvat ruke, počnite iz početnog stanja bliskog onome što ste demonstrirali i očekujte da će policy biti osjetljiv na stvari koje sami ne biste primijetili: pomaknutu kameru, drugačije osvjetljenje ili predmet koji dataset nikad nije sadržavao.

Koliko epizoda vam treba

Najčešća greška u treniranju na platformi nije pogrešan hiperparametar, nego treniranje na premalo podataka i zaključak da tip policyja ne radi. Kao okvirno pravilo za jedan zadatak na stolu: oko 50 epizoda daje vam policy s uskom generalizacijom koji uspijeva iz početnih stanja bliskih onima koje ste demonstrirali. Otprilike 100 do 200 epizoda daje upotrebljivu robusnost u cijelom radnom prostoru za taj jedan zadatak, uz uvjet da ste varirali postavljanje predmeta među epizodama.

Sposobniji tipovi policyja ne poništavaju ovo pravilo. GR00T fine-tune na 20 epizoda i dalje će generalizirati loše; ono što veći modeli donose viši je strop čim podaci postoje. Ako vam je budžet ograničen, potrošite ga na raznovrsnije epizode prije nego na veći model.

Često postavljana pitanja

Koliko dugo traje trening?

Ovisi o tipu policyja i veličini dataseta, pa nema poštenog jedinstvenog broja. ACT je obično najbrži od sve četiri, GR00T fine-tuneovi najsporiji. Vremenska crta faza i grafikoni gubitka na stranici treninga rano pokazuju napreduje li trening.

Mogu li trenirati na spojenom datasetu?

Da. Spojeni datasetovi obični su datasetovi; validacija spajanja već je zajamčila dosljedne fps, značajke i tip robota. Spajanje snimaka istog zadatka jedan je od najučinkovitijih načina da dosegnete raspon od 100 do 200 epizoda.

Moj GR00T trening ne uspijeva tijekom učitavanja podataka. Što prvo provjeriti?

Verziju formata dataseta. GR00T fine-tuning zahtijeva LeRobot v2.1, a dataset verzije v3.0 upravo tu ne uspijeva. Provjerite verziju u meta/info.json svog dataseta.

Trebam li ukloniti neuspjele epizode prije treniranja?

Obično da. Epizode označene kao Failure uče policy neuspješnom ponašanju. Recovery epizode su drugačije: pokazuju kako ispraviti grešku i često ih se isplati zadržati.

Moram li tijekom treniranja držati preglednik otvoren?

Ne. Treninzi se izvode na strani servera. Stranica treninga prikazuje trenutno stanje, grafikone i zapise kad god se vratite, a checkpointovi se spremaju bez obzira gleda li itko.