Policyn koulutus

AY-Robots kouluttaa manipulaatiopolicyja hallinnoiduilla GPU:illa, joten voit siirtyä tallennetuista episodeista käsivarrellasi toimivaan policyyn omistamatta koulutuslaitteistoa. Tämä sivu käsittelee tuetut policytyypit, koulutusajon sivun, checkpointit ja millaisia tuloksia episodimääräsi realistisesti mahdollistaa.

Viimeksi päivitetty 2026-08-09

Koulutus ilman omaa GPU:ta

Manipulaatiopolicyn koulutus on GPU-työkuorma, ja modernit vision-language-action-mallit tarvitsevat enemmän VRAM-muistia kuin tyypillisessä työasemassa on. AY-Robotsissa koulutus ajetaan alustan hallinnoimilla pilvi-GPU:illa: valitset datasetin ja policytyypin, käynnistät ajon ja seuraat sen edistymistä selaimesta. Ei CUDA-asetuksia, ei ajurien täsmäytystä, eikä ympäristöä ylläpidettäväksi.

Syöte on aina pilvidataset kohdasta Dashboard > Datasets. Kaikki teleoperointi-istunnoilla tallentamasi tai LeRobot-muodossa lataamasi kelpaa, mukaan lukien yhdistetyt datasetit. Kuratoi ennen koulutusta: Failure-merkityt episodit eivät yleensä kuulu koulutusjoukkoon, ja kymmenen minuutin tarkastus episodiselaimessa säästää tunteja GPU-aikaa, joka muuten kuluisi huonoista demonstraatioista oppimiseen.

Tuetut policyt

Tuettuna on neljä policyperhettä. Ne eroavat koossa, koulutuskustannuksissa ja siinä, kuinka paljon ne pystyvät omaksumaan datastasi, joten oikea valinta riippuu enemmän tehtävästäsi ja datasetistäsi kuin mistään yleisestä paremmuusjärjestyksestä.

PolicyTyyppiOminaisuudet
ACTTransformer, action chunkingEnnustaa lyhyitä tulevien toimintojen lohkoja yksittäisten askelten sijaan. Kompakti, kouluttautuu suhteellisen nopeasti ja on vankka ensimmäinen valinta yhdelle hyvin määritellylle tehtävälle.
Diffusion PolicyDiffuusio toimintosekvensseilläMallintaa koko demonstroitujen toimintojen jakauman, mikä auttaa, kun demonstraatiosi ratkaisevat tehtävän useammalla kuin yhdellä kelvollisella tavalla. Raskaampi kouluttaa ja hitaampi päättelyssä kuin ACT.
SmolVLAPieni vision-language-action-malliKieliehdollinen: episodiesi tehtävämerkkijono muuttuu osaksi syötettä. Hyvä välimuoto, kun haluat kieliehdollisuutta ilman suurta perusmallia.
GR00T-hienosäätöPerusmallin hienosäätöHienosäätää suuren esikoulutetun robotiikan perusmallin episodeillasi. Neljästä korkein kattoraja, korkeimmalla koulutuskustannuksella, ja tiukalla datasetin muotovaatimuksella.
GR00T vaatii LeRobot v2.1 -datasetit

GR00T-hienosäätö hyväksyy vain datasetit LeRobot-muodon versiossa 2.1. v3.0-dataset epäonnistuu datan latauksen aikana, ei lähetyksessä, joten tarkista muotoversio ennen ajon käynnistämistä. Alustalla tallennettuja dataseteja voi käyttää sellaisenaan; ulkoisten latausten kohdalla varmista versio ensin tiedostosta meta/info.json.

Ajon käynnistäminen

  1. 1
    Valitse dataset

    Avaa Dashboard > Training ja valitse dataset, jolla haluat kouluttaa. Episodimäärä ja robottityyppi näytetään, jotta voit varmistaa valinneesi oikean.

  2. 2
    Valitse policy

    Valitse yksi tuetuista policytyypeistä. Jos olet epävarma, aloita ACT:sta: se on halvin tapa selvittää, onko datasetisi tarpeeksi hyvä kouluttamaan mitään ylipäätään.

  3. 3
    Käynnistä

    Käynnistä ajo. Se saa job-id:n ja oman ajosivunsa, ja voit sulkea selaimen: koulutus jatkuu palvelinpuolella, ja sivu näyttää nykyisen tilan aina kun palaat.

Koulutusajon sivu

Jokaisella ajolla on oma sivunsa, joka vastaa niihin kahteen kysymykseen, jotka sinulla oikeasti on koulutuksen aikana: oppiiko se, ja onko kone terve. Oppimisen edistyminen näytetään kaavioina lossista, oppimisnopeuden aikataulusta ja gradienttinormista. Loss, joka tasoittuu heti, tai gradienttinormi, joka räjähtää, kertoo varhain, ettei ajoa kannata odottaa loppuun.

Koneen terveys näytetään vieressä: GPU:n käyttöaste ja muisti, sekä koulutuskoneen isäntämittarit. Vaiheaikajana näyttää, missä ajo on tällä hetkellä, ympäristön valmistelusta datan lataukseen, itse koulutussilmukkaan ja checkpointin lataukseen. Kun jokin näyttää epäilyttävältä, sisäänrakennettu lokinäkymä antaa sinulle raa'at koulutuslokit ilman SSH-yhteyttä, mikä yleensä riittää selvittämään, johtuuko virhe datasetistäsi vai itse ajosta.

Checkpointit ja jatkaminen

Checkpointit tallennetaan ajokohtaisesti, ei jaettuun poolin, joten ajosivulla listatut checkpointit kuuluvat aina täsmälleen kyseiseen ajoon ja sen konfiguraatioon. Tämä merkitsee enemmän kuin miltä kuulostaa: checkpointien sekoittaminen eri asetuksilla ajettujen ajojen välillä on klassinen syy huomaamatta rikkoutuneisiin policyihin.

Jos ajo keskeytyy, voit jatkaa sen viimeisimmästä checkpointista sen sijaan, että aloittaisit alusta. Väliaikaiset checkpointit ovat myös hyödyllisiä sellaisenaan: kun pitkä ajo alkaa ylisovittua loppua kohti, aikaisempi checkpoint toimii usein paremmin oikealla käsivarrella kuin viimeinen.

Koulutetun policyn ajaminen käsivarrellasi

Valmiin policyn voi ottaa suoraan käyttöön takaisin robotillasi. Ohjaamossa valitset koulutetun policyn yhdistetylle käsivarrellesi ja käynnistät päättelyn: policy tuottaa nyt ne nivelkomennot, jotka aiemmin tuotit teleoperoinnilla. Käsivarren täytyy olla sama robottityyppi, jolla dataset tallennettiin, ja näkymän tulisi muistuttaa koulutusnäkymiä, mukaan lukien kameran sijoittelu.

Kohtele ensimmäisiä päättelyajoja kokeiluina, ei esittelyinä. Pidä hätäpysäytys ulottuvillasi, aloita demonstroimaasi lähellä olevasta alkutilasta, ja odota policyn olevan herkkä asioille, joita et itse huomaisi: siirretty kamera, erilainen valaistus tai esine, jota dataset ei koskaan sisältänyt.

Kuinka monta episodia tarvitset

Yleisin koulutusvirhe alustalla ei ole väärä hyperparametri, vaan liian vähäisellä datalla kouluttaminen ja johtopäätös, ettei policytyyppi toimi. Nyrkkisääntönä yhdelle pöytätehtävälle: noin 50 episodia antaa policyn, jolla on kapea yleistyminen ja joka onnistuu demonstroimiasi lähellä olevista alkutiloista. Noin 100-200 episodia antaa käyttökelpoisen vankkuuden koko työtilassa kyseiselle tehtävälle, kunhan vaihtelit esineiden sijoittelua episodien välillä.

Kyvykkäämmät policytyypit eivät kumoa tätä. GR00T-hienosäätö 20 episodilla yleistyy silti huonosti; suuremmat mallit ostavat sinulle paremman kattorajan vasta, kun dataa on riittävästi. Jos budjettisi on rajallinen, käytä se ensin useampiin vaihteleviin episodeihin ennen suurempaa mallia.

Usein kysytyt kysymykset

Kuinka kauan koulutusajo kestää?

Se riippuu policytyypistä ja datasetin koosta, joten yhtä rehellistä lukua ei ole. ACT on tyypillisesti nopein neljästä, GR00T-hienosäädöt hitaimpia. Vaiheaikajana ja lossikaaviot ajosivulla näyttävät varhain, etenevätkö ajo.

Voinko kouluttaa yhdistetyllä datasetillä?

Kyllä. Yhdistetyt datasetit ovat tavallisia dataseteja; yhdistämisen validointi on jo taannut yhtenäisen fps:n, ominaisuudet ja robottityypin. Saman tehtävän tallenteiden yhdistäminen on yksi tehokkaimmista tavoista päästä 100-200 episodin haarukkaan.

GR00T-ajoni epäonnistuu datan latauksen aikana. Mitä tarkistan ensin?

Datasetin muotoversion. GR00T-hienosäätö vaatii LeRobot v2.1:n, ja v3.0-dataset epäonnistuu juuri siinä kohtaa. Tarkista versio datasetisi tiedostosta meta/info.json.

Pitäisikö minun poistaa epäonnistuneet episodit ennen koulutusta?

Yleensä kyllä. Failure-merkityt episodit opettavat policylle epäonnistuvan käytöksen. Recovery-episodit ovat eri asia: ne näyttävät, miten virhe korjataan, ja ne kannattaa usein säilyttää.

Pitääkö selaimen olla auki koulutuksen ajan?

Ei. Ajot suoritetaan palvelinpuolella. Ajosivu näyttää nykyisen tilan, kaaviot ja lokit aina kun palaat, ja checkpointit tallennetaan riippumatta siitä, seuraako kukaan.