Policy apmācība

AY-Robots apmāca manipulācijas policy pārvaldītos GPU, tāpēc varat pāriet no ierakstītām epizodēm uz policy, kas darbojas uz jūsu rokas, bez savas apmācības aparatūras. Šī lapa aptver atbalstītos policy tipus, apmācības darba lapu, checkpoint un to, kādus rezultātus reālistiski gaidīt atkarībā no jūsu epizožu skaita.

Pēdējoreiz atjaunināts 2026-08-09

Apmācība bez sava GPU

Manipulācijas policy apmācība ir GPU slodze, un modernie vision-language-action modeļi pieprasa vairāk VRAM, nekā ir tipiskā darbstacijā. AY-Robots platformā apmācība notiek platformas pārvaldītos mākoņa GPU: jūs izvēlaties datu kopu un policy tipu, sākat procesu un vērojat tā progresu no pārlūkprogrammas. Nav vajadzīga CUDA uzstādīšana, draiveru saskaņošana vai vides uzturēšana.

Ievade vienmēr ir mākoņa datu kopa no Dashboard > Datasets. Der viss, ko esat ierakstījuši teleoperācijas sesijās vai augšupielādējuši LeRobot formātā, ieskaitot apvienotas datu kopas. Sakārtojiet pirms apmācības: ar Failure marķētas epizodes parasti nevajadzētu iekļaut apmācības kopā, un desmit minūtes pārskatīšanas epizožu pārlūkā ietaupa stundas GPU laika, kas iztērēts, mācoties no sliktām demonstrācijām.

Atbalstītie policy

Tiek atbalstītas četras policy saimes. Tās atšķiras pēc izmēra, apmācības izmaksām un tā, cik daudz tās var uzsūkt no jūsu datiem, tāpēc pareizā izvēle ir atkarīga vairāk no jūsu uzdevuma un datu kopas nekā no jebkāda vispārīga vērtējuma.

PolicyVeidsĪpašības
ACTTransformer, darbību grupēšanaPrognozē īsas nākotnes darbību grupas, nevis atsevišķus soļus. Kompakts, apmācās salīdzinoši ātri un ir stabila pirmā izvēle vienam skaidri definētam uzdevumam.
Diffusion PolicyDifūzija pār darbību sekvencēmModelē pilnu demonstrēto darbību sadalījumu, kas palīdz, ja jūsu demonstrācijas atrisina uzdevumu vairāk nekā vienā derīgā veidā. Smagāka apmācībā un lēnāka izsecinājumā nekā ACT.
SmolVLAMazs vision-language-action modelisValodā balstīts: uzdevuma teksts no jūsu epizodēm kļūst par ievades daļu. Labs vidusceļš, kad vēlaties valodas nosacītību bez liela pamatmodeļa.
GR00T fine-tunePamatmodeļa fine-tuneVeic fine-tune lielam, iepriekš apmācītam robotikas pamatmodelim uz jūsu epizodēm. Augstākais no četriem griestiem, par augstāko apmācības cenu, ar stingru datu kopas formāta prasību.
GR00T nepieciešamas LeRobot v2.1 datu kopas

GR00T fine-tune pieņem tikai datu kopas LeRobot formāta versijā 2.1. v3.0 datu kopa neizdosies datu ielādes laikā, nevis iesniegšanas brīdī, tāpēc pārbaudiet formāta versiju, pirms sākat procesu. Platformā ierakstītas datu kopas var izmantot tādas, kādas tās ir; ārējām augšupielādēm vispirms pārbaudiet versiju failā meta/info.json.

Procesa sākšana

  1. 1
    Izvēlieties datu kopu

    Atveriet Dashboard > Training un izvēlieties datu kopu, uz kuras apmācīties. Tiek rādīts epizožu skaits un robota tips, lai varētu apstiprināt, ka izvēlējāties pareizo.

  2. 2
    Izvēlieties policy

    Izvēlieties vienu no atbalstītajiem policy tipiem. Ja neesat pārliecināti, sāciet ar ACT: tas ir lētākais veids, kā uzzināt, vai jūsu datu kopa ir pietiekami laba, lai vispār kaut ko apmācītu.

  3. 3
    Palaidiet

    Sāciet procesu. Tas saņem job id un savu darba lapu, un pārlūkprogrammu varat aizvērt: apmācība turpinās servera pusē, un lapa rāda dzīvo statusu, kad vien atgriežaties.

Apmācības darba lapa

Katram procesam ir sava veltīta lapa, kas atbild uz diviem jautājumiem, kas jums faktiski rodas apmācības laikā: vai tas mācās un vai iekārta ir vesela. Mācīšanās progress tiek rādīts kā loss, mācīšanās ātruma grafika un gradienta normas grafiki. Loss, kas nekavējoties sasniedz plato, vai gradienta norma, kas eksplodē, agri pasaka, ka process nav gaidīšanas vērts.

Iekārtas veselība tiek rādīta blakus: GPU noslodze un atmiņa, kopā ar apmācības iekārtas resursdatora metriku. Fāžu laika skala rāda, kurā posmā process pašlaik atrodas, sākot no vides sagatavošanas, cauri datu ielādei, pašam apmācības ciklam un beidzot ar checkpoint augšupielādi. Kad kaut kas izskatās nepareizi, iebūvētais žurnāla skatītājs sniedz jēlos apmācības žurnālus bez jebkādas SSH piekļuves, kas parasti pietiek, lai redzētu, vai kļūme ir jūsu datu kopā vai pašā procesā.

Checkpoint un atsākšana

Checkpoint tiek glabāti pa procesu, nevis kopīgā fondā, tāpēc darba lapā uzskaitītie checkpoint vienmēr pieder tieši tam procesam un tā konfigurācijai. Tas ir svarīgāk, nekā izklausās: checkpoint sajaukšana starp procesiem ar dažādiem iestatījumiem ir klasisks klusi sabojātu policy avots.

Ja process tiek pārtraukts, varat atsākt no tā jaunākā checkpoint, nevis sākt no jauna. Starpposma checkpoint ir noderīgi arī paši par sevi: kad garš process tuvu beigām sāk pārmērīgi pieskaņoties, agrāks checkpoint bieži darbojas labāk uz reālas rokas nekā pēdējais.

Apmācītā policy palaišana uz jūsu rokas

Pabeigtu policy var izvietot tieši atpakaļ uz jūsu robotu. Kabīnē izvēlieties apmācīto policy savai pieslēgtajai rokai un sāciet izsecinājumu: policy tagad rada locītavu komandas, ko jūs iepriekš radījāt, teleoperējot. Rokai jābūt tam pašam robota tipam, uz kura tika ierakstīta datu kopa, un ainai vajadzētu līdzināties apmācības ainām, ieskaitot kameru izvietojumu.

Uztveriet pirmos izsecinājuma palaišanas gadījumus kā eksperimentus, nevis kā demonstrācijas. Turiet avārijas apturēšanu sasniedzamā attālumā, sāciet no sākuma stāvokļa, kas ir tuvs tam, ko demonstrējāt, un gaidiet, ka policy būs jutīga pret lietām, ko jūs nepamanītu: pārvietotu kameru, atšķirīgu apgaismojumu vai objektu, kāda datu kopā nekad nebija.

Cik epizožu nepieciešams

Biežākā apmācības kļūda platformā nav nepareizs hiperparametrs, tā ir apmācība ar pārāk maz datu un secinājums, ka policy tips nedarbojas. Kā aptuvenu likumu vienam galda uzdevumam: aptuveni 50 epizodes dod policy ar šauru vispārināšanu, kas gūst panākumus no sākuma stāvokļiem, kas tuvi tiem, ko demonstrējāt. Aptuveni 100 līdz 200 epizodes dod lietojamu izturību visā darba zonā tam vienam uzdevumam, ja starp epizodēm mainījāt objektu novietojumu.

Spējīgāki policy tipi to neatceļ. GR00T fine-tune ar 20 epizodēm joprojām vispārinās slikti; lielākie modeļi dod labākus griestus, kad dati jau ir pieejami. Ja jūsu budžets ir ierobežots, tērējiet to daudzveidīgākām epizodēm, nevis lielākam modelim.

Biežāk uzdotie jautājumi

Cik ilgi ilgst apmācības process?

Tas ir atkarīgs no policy tipa un datu kopas izmēra, tāpēc godīga viena skaitļa nav. ACT parasti ir ātrākais no četriem, GR00T fine-tune lēnākais. Fāžu laika skala un loss grafiki darba lapā agri parāda, vai process virzās uz priekšu.

Vai varu apmācīt uz apvienotas datu kopas?

Jā. Apvienotas datu kopas ir parastas datu kopas; apvienošanas validācija jau garantēja konsekventu fps, pazīmes un robota tipu. Vienas un tās pašas uzdevuma ierakstu apvienošana ir viens no efektīvākajiem veidiem, kā sasniegt 100 līdz 200 epizožu diapazonu.

Mans GR00T process neizdodas datu ielādes laikā. Ko pārbaudīt vispirms?

Datu kopas formāta versiju. GR00T fine-tune nepieciešama LeRobot v2.1, un v3.0 datu kopa neizdodas tieši tur. Pārbaudiet versiju datu kopas failā meta/info.json.

Vai pirms apmācības jāizņem neveiksmīgās epizodes?

Parasti jā. Ar Failure marķētas epizodes māca policy neveiksmīgo uzvedību. Recovery epizodes ir citādas: tās parāda, kā izlabot kļūdu, un bieži ir vērts tās paturēt.

Vai apmācības laikā man jātur pārlūkprogramma atvērta?

Nē. Procesi darbojas servera pusē. Darba lapa rāda pašreizējo statusu, grafikus un žurnālus, kad vien atgriežaties, un checkpoint tiek saglabāti neatkarīgi no tā, vai kāds vēro.