Učenje policyjev

AY-Robots uči manipulacijske policyje na upravljanih GPE-jih, zato lahko od posnetih epizod pridete do policyja, ki teče na vaši roki, ne da bi imeli lastno strojno opremo za učenje. Ta stran pokriva podprte tipe policyjev, stran teka učenja, checkpointe in kakšne rezultate realno pričakovati glede na število epizod.

Nazadnje posodobljeno 2026-08-09

Učenje brez lastnega GPE-ja

Učenje manipulacijskega policyja je obremenitev za GPE, sodobni modeli vision-language-action pa potrebujejo več VRAM, kot ga ima tipična delovna postaja. Na AY-Robots učenje teče na GPE-jih v oblaku, ki jih upravlja platforma: izberete dataset in tip policyja, sprožite tek in njegov napredek spremljate iz brskalnika. Ni nastavljanja CUDA, ni usklajevanja gonilnikov in ni okolja, ki bi ga bilo treba vzdrževati.

Vhod je vedno dataset v oblaku iz Dashboard > Datasets. Vse, kar ste posneli prek sej teleoperacije ali naložili v obliki LeRobot, je primerno, vključno z združenimi dataseti. Pred učenjem uredite: epizode, označene kot Failure, običajno ne spadajo v učno množico, deset minut pregleda v pregledovalniku epizod pa prihrani ure časa GPE, porabljenega za učenje iz slabih demonstracij.

Podprti policyji

Podprte so štiri družine policyjev. Razlikujejo se po velikosti, stroških učenja in koliko lahko vpijejo iz vaših podatkov, zato je prava izbira odvisna bolj od vaše naloge in dataseta kot od kakršne koli splošne razvrstitve.

PolicyVrstaZnačilnosti
ACTTransformer, action chunkingNapove kratke sklope prihodnjih dejanj namesto posameznih korakov. Kompakten je, uči se razmeroma hitro in je trdna prva izbira za eno jasno opredeljeno nalogo.
Diffusion PolicyDifuzija nad zaporedji dejanjModelira celotno porazdelitev prikazanih dejanj, kar pomaga, kadar vaše demonstracije nalogo rešujejo na več veljavnih načinov. Težji za učenje in počasnejši pri sklepanju kot ACT.
SmolVLAMajhen model vision-language-actionJezikovno pogojen: niz naloge iz vaših epizod postane del vhoda. Dobra srednja pot, kadar želite jezikovno pogojevanje brez velikega temeljnega modela.
Fine-tune GR00TFine-tune temeljnega modelaNa vaših epizodah fine-tune-a velik vnaprej naučen temeljni model za robotiko. Ima najvišji strop med vsemi štirimi, ob najvišjih stroških učenja in strogi zahtevi po obliki dataseta.
GR00T zahteva datasete LeRobot v2.1

Fine-tuning GR00T sprejema le datasete v obliki LeRobot različice 2.1. Dataset različice v3.0 spodleti med nalaganjem podatkov, ne ob oddaji, zato pred zagonom teka preverite različico oblike. Datasete, posnete na platformi, lahko uporabite takšne, kot so; pri zunanjih nalaganjih najprej preverite različico v meta/info.json.

Zagon teka učenja

  1. 1
    Izberite dataset

    Odprite Dashboard > Training in izberite dataset, na katerem boste učili. Prikazana sta število epizod in tip robota, da lahko potrdite, ali ste izbrali pravega.

  2. 2
    Izberite policy

    Izberite enega od podprtih tipov policyjev. Če niste prepričani, začnite z ACT: to je najcenejši način, da ugotovite, ali je vaš dataset dovolj dober, da se na njem sploh kaj nauči.

  3. 3
    Zaženite

    Zaženite tek. Dobi id opravila in svojo stran teka, brskalnik pa lahko zaprete: učenje se nadaljuje na strani strežnika, stran pa ob vsaki vrnitvi prikaže trenutno stanje v živo.

Stran teka učenja

Vsak tek ima namensko stran, ki odgovori na vprašanji, ki ju med učenjem dejansko imate: ali se uči in ali je stroj zdrav. Napredek učenja je prikazan kot grafi izgube, urnika hitrosti učenja in norme gradienta. Izguba, ki takoj obstane na planoti, ali norma gradienta, ki eksplodira, zgodaj pove, da tek ni vreden čakanja.

Zraven je prikazano zdravje stroja: izkoriščenost in pomnilnik GPE-ja ter meritve gostiteljskega stroja za učenje. Časovnica faz pokaže, kje se tek trenutno nahaja, od priprave okolja prek nalaganja podatkov in same zanke učenja do nalaganja checkpointa. Kadar je nekaj videti narobe, vam vgrajen pregledovalnik dnevnikov ponudi surove dnevnike učenja brez kakršnega koli dostopa SSH, kar je običajno dovolj, da ugotovite, ali je težava v vašem datasetu ali v samem teku.

Checkpointi in nadaljevanje

Checkpointi so shranjeni po teku, ne v skupnem naboru, zato checkpointi, navedeni na strani teka, vedno pripadajo natanko temu teku in njegovi nastavitvi. To je pomembnejše, kot se sliši: mešanje checkpointov iz tekov z različnimi nastavitvami je klasičen vir tiho pokvarjenih policyjev.

Če se tek prekine, lahko nadaljujete od njegovega zadnjega checkpointa, namesto da bi začeli znova. Vmesni checkpointi so koristni tudi sami po sebi: kadar dolg tek proti koncu začne prekomerno prilegati, zgodnejši checkpoint na pravi roki pogosto deluje bolje od končnega.

Zagon naučenega policyja na vaši roki

Dokončan policy lahko namestite naravnost nazaj na svojega robota. V kokpitu za povezano roko izberite naučeni policy in zaženite sklepanje: policy zdaj ustvarja ukaze sklepom, ki ste jih prej ustvarjali s teleoperacijo. Roka mora biti istega tipa robota, na katerem je bil posnet dataset, prizor pa naj bo podoben učnim prizorom, vključno z namestitvijo kamer.

Prve teke sklepanja obravnavajte kot eksperimente, ne kot predstavitve. Zasilno zaustavitev imejte na dosegu roke, začnite iz začetnega stanja, podobnega tistemu, ki ste ga prikazali, in pričakujte, da bo policy občutljiv na stvari, ki jih sami ne bi opazili: premaknjeno kamero, drugačno osvetlitev ali predmet, ki ga dataset nikoli ni vseboval.

Koliko epizod potrebujete

Najpogostejša napaka pri učenju na platformi ni napačen hiperparameter, temveč učenje na premalo podatkih in sklep, da tip policyja ne deluje. Kot okvirno pravilo za eno nalogo na mizi: približno 50 epizod da policy z ozko posplošitvijo, ki uspeva iz začetnih stanj, podobnih prikazanim. Približno 100 do 200 epizod da uporabno robustnost po celotnem delovnem prostoru za to eno nalogo, če ste med epizodami spreminjali postavitev predmetov.

Zmogljivejši tipi policyjev tega pravila ne razveljavijo. Fine-tune GR00T na 20 epizodah bo še vedno posploševal slabo; kar večji modeli prinesejo, je višji strop, ko so podatki na voljo. Če je vaš proračun omejen, ga porabite za bolj raznolike epizode, preden ga porabite za večji model.

Pogosta vprašanja

Kako dolgo traja tek učenja?

Odvisno je od tipa policyja in velikosti dataseta, zato ni poštene enotne številke. ACT je običajno najhitrejši od vseh štirih, fine-tuni GR00T najpočasnejši. Časovnica faz in grafi izgube na strani teka zgodaj pokažejo, ali tek napreduje.

Ali lahko učim na združenem datasetu?

Da. Združeni dataseti so navadni dataseti; validacija ob združevanju je že zagotovila skladne fps, značilke in tip robota. Združevanje posnetkov iste naloge je eden najučinkovitejših načinov, da dosežete razpon 100 do 200 epizod.

Moj tek GR00T odpove med nalaganjem podatkov. Kaj naj preverim najprej?

Različico oblike dataseta. Fine-tuning GR00T zahteva LeRobot v2.1, dataset različice v3.0 pa prav tam odpove. Preverite različico v meta/info.json svojega dataseta.

Ali naj pred učenjem odstranim neuspele epizode?

Običajno da. Epizode, označene kot Failure, policy naučijo neuspešnega vedenja. Epizode Recovery so drugačne: pokažejo, kako popraviti napako, in jih je pogosto vredno obdržati.

Ali moram med učenjem imeti odprt brskalnik?

Ne. Teki se izvajajo na strani strežnika. Stran teka ob vsaki vrnitvi prikaže trenutno stanje, grafe in dnevnike, checkpointi pa se shranjujejo ne glede na to, ali jih kdo spremlja.