Policy treenimine

AY-Robots treenib manipulatsiooni policy-sid hallatud GPU-del, seega saate liikuda salvestatud episoodidelt policy juurde, mis töötab teie käsivarrel, ilma oma treeningriistvarata. See leht käsitleb toetatud policy tüüpe, treeningtöö lehte, checkpoint'e ja seda, milliseid tulemusi realistlikult oma episoodide arvult oodata.

Viimati uuendatud 2026-08-09

Treenimine ilma oma GPU-ta

Manipulatsiooni policy treenimine on GPU koormus ja kaasaegsed vision-language-action mudelid vajavad rohkem VRAM-i, kui tüüpilisel tööjaamal on. AY-Robots platvormil toimub treenimine platvormi hallatud pilve GPU-del: valite andmestiku ja policy tüübi, käivitate protsessi ja jälgite selle edenemist brauserist. CUDA seadistust, draiverite sobitamist ega keskkonna hooldamist pole vaja.

Sisend on alati pilveandmestik alt Dashboard > Datasets. Sobib kõik, mida olete salvestanud teleoperatsiooni seansside kaudu või üles laadinud LeRobot formaadis, sealhulgas liidetud andmestikud. Korrastage enne treenimist: märgisega Failure episoodid ei peaks tavaliselt treeningkomplekti kuuluma ja kümme minutit ülevaatamist episoodivaatajas säästab tunde GPU aega, mis kuluks halbadelt demonstratsioonidelt õppimisele.

Toetatud policy-d

Toetatud on neli policy peret. Need erinevad suuruse, treeningkulu ja selle poolest, kui palju need teie andmetest omastada suudavad, seega sõltub õige valik rohkem teie ülesandest ja andmestikust kui mistahes üldisest paremusjärjestusest.

PolicyLiikOmadused
ACTTransformer, tegevuste tükeldamineEnnustab lühikesi tulevaste tegevuste tükke üksikute sammude asemel. Kompaktne, treenib suhteliselt kiiresti ja on kindel esimene valik ühele hästi määratletud ülesandele.
Diffusion PolicyDifusioon tegevuste jadade üleModelleerib demonstreeritud tegevuste täielikku jaotust, mis aitab, kui teie demonstratsioonid lahendavad ülesande rohkem kui ühel kehtival viisil. Raskem treenida ja aeglasem järelduse tegemisel kui ACT.
SmolVLAVäike vision-language-action mudelKeelepõhine: ülesandestring teie episoodidest muutub sisendi osaks. Hea keskteel, kui soovite keeletingimuslikkust ilma suure baasmudelita.
GR00T fine-tuneBaasmudeli fine-tuneTeeb suure, eelnevalt treenitud robootika baasmudeli fine-tune'i teie episoodidel. Kõrgeim lagi neljast, kõrgeima treeningkuluga ja range andmestiku formaadinõudega.
GR00T vajab LeRobot v2.1 andmestikke

GR00T fine-tune aktsepteerib ainult andmestikke LeRobot formaadi versioonis 2.1. v3.0 andmestik ebaõnnestub andmete laadimise ajal, mitte esitamisel, seega kontrollige formaadi versiooni enne protsessi käivitamist. Platvormil salvestatud andmestikke saab kasutada sellisena, nagu need on; väliste üleslaadimiste puhul kontrollige kõigepealt versiooni failis meta/info.json.

Protsessi käivitamine

  1. 1
    Valige andmestik

    Avage Dashboard > Training ja valige andmestik, millel treenida. Kuvatakse episoodide arv ja robotitüüp, et saaksite kinnitada õige valiku.

  2. 2
    Valige policy

    Valige üks toetatud policy tüüpidest. Kui pole kindel, alustage ACT-ga: see on odavaim viis välja selgitada, kas teie andmestik on üldse piisavalt hea, et midagi treenida.

  3. 3
    Käivitage

    Käivitage protsess. See saab job id ja oma töölehe ning brauseri võite sulgeda: treenimine jätkub serveripoolel ja leht näitab reaalajas olekut, kui tagasi tulete.

Treeningtöö leht

Igal protsessil on pühendatud leht, mis vastab kahele küsimusele, mis teil treenimise ajal tegelikult tekivad: kas see õpib ja kas masin on korras. Õppimise edenemist näidatakse loss'i, õppimiskiiruse graafiku ja gradientide normi graafikutena. Loss, mis kohe platoole jõuab, või gradientide norm, mis plahvatab, ütleb varakult, et protsess pole ootamist väärt.

Masina tervis kuvatakse kõrval: GPU kasutus ja mälu, koos treeningmasina hosti meetrikatega. Faaside ajaskaala näitab, kus protsess praegu on, alates keskkonna ettevalmistamisest andmete laadimise, treeningtsükli enda ja checkpoint'i üleslaadimiseni. Kui midagi tundub valesti, annab sisseehitatud logivaataja toore treeningulogi ilma igasuguse SSH juurdepääsuta, mis tavaliselt piisab nägemaks, kas tõrge on teie andmestikus või protsessis endas.

Checkpoint'id ja jätkamine

Checkpoint'id salvestatakse protsessi kaupa, mitte ühisesse fondi, seega kuuluvad töölehel loetletud checkpoint'id alati täpselt sellele protsessile ja selle konfiguratsioonile. See on olulisem, kui kõlab: checkpoint'ide segamine erinevate seadistustega protsesside vahel on klassikaline vaikselt katkiste policy-de allikas.

Kui protsess katkeb, saate jätkata selle viimasest checkpoint'ist, selle asemel et otsast alustada. Vahepealsed checkpoint'id on kasulikud ka omaette: kui pikk protsess hakkab lõpu poole üle sobituma, töötab varasem checkpoint sageli päris käsivarrel paremini kui viimane.

Treenitud policy käivitamine oma käsivarrel

Valminud policy saab otse tagasi teie robotile paigutada. Kokpitis valige treenitud policy oma ühendatud käsivarrele ja käivitage järeldus: policy loob nüüd liigesekäske, mida te varem tootsite teleoperatsiooniga. Käsivars peab olema sama robotitüüp, millel andmestik salvestati, ja stseen peaks sarnanema treeningstseenidega, sealhulgas kaamera paigutusega.

Käsitlege esimesi järelduse käivitusi eksperimentidena, mitte demodena. Hoidke hädapeatus käeulatuses, alustage algolekust, mis on lähedal sellele, mida demonstreerisite, ja oodake, et policy on tundlik asjade suhtes, mida te ise ei märkaks: liigutatud kaamera, erinev valgustus või ese, mida andmestikus kunagi polnud.

Kui palju episoode on vaja

Kõige levinum treeningviga platvormil ei ole vale hüperparameeter, vaid treenimine liiga vähestel andmetel ja järeldus, et policy tüüp ei tööta. Rusikareeglina ühe lauaülesande jaoks: umbes 50 episoodi annab teile policy, mis üldistab kitsalt ja õnnestub algolekutest, mis on lähedal teie demonstreeritutele. Umbes 100 kuni 200 episoodi annab kasutatava vastupidavuse üle kogu tööala selle ühe ülesande jaoks, eeldusel et varieerisite objektide paigutust episoodide vahel.

Võimekamad policy tüübid ei tühista seda. GR00T fine-tune 20 episoodiga üldistab endiselt halvasti; suuremad mudelid annavad parema lae, kui andmed juba olemas on. Kui teie eelarve on piiratud, kulutage see mitmekesisematele episoodidele, mitte suuremale mudelile.

Korduma kippuvad küsimused

Kui kaua treeningprotsess kestab?

See sõltub policy tüübist ja andmestiku suurusest, seega ausat ühte arvu pole. ACT on tavaliselt neljast kiireim, GR00T fine-tune aeglaseim. Faaside ajaskaala ja loss graafikud töölehel näitavad varakult, kas protsess edeneb.

Kas saan treenida liidetud andmestikul?

Jah. Liidetud andmestikud on tavalised andmestikud; liitmisvalideerimine tagas juba järjekindla fps, tunnused ja robotitüübi. Sama ülesande salvestiste liitmine on üks tõhusamaid viise 100 kuni 200 episoodi vahemikuni jõudmiseks.

Minu GR00T protsess ebaõnnestub andmete laadimise ajal. Mida kõigepealt kontrollida?

Andmestiku formaadi versiooni. GR00T fine-tune nõuab LeRobot v2.1 ja v3.0 andmestik ebaõnnestub täpselt seal. Kontrollige versiooni oma andmestiku failis meta/info.json.

Kas peaksin ebaõnnestunud episoodid enne treenimist eemaldama?

Tavaliselt jah. Märgisega Failure episoodid õpetavad policy'le ebaõnnestunud käitumist. Recovery episoodid on erinevad: need näitavad, kuidas viga parandada, ja neid tasub sageli alles hoida.

Kas pean treenimise ajal brauseri lahti hoidma?

Ei. Protsessid täidetakse serveripoolel. Töölehe kuvab praeguse oleku, graafikud ja logid, kui iganes tagasi tulete, ning checkpoint'id salvestatakse sõltumata sellest, kas keegi jälgib.