Policy apmācība
AY-Robots apmāca manipulācijas policy pārvaldītos GPU, tāpēc varat pāriet no ierakstītām epizodēm uz policy, kas darbojas uz jūsu rokas, bez savas apmācības aparatūras. Šī lapa aptver atbalstītos policy tipus, apmācības darba lapu, checkpoint un to, kādus rezultātus reālistiski gaidīt atkarībā no jūsu epizožu skaita.
Pēdējoreiz atjaunināts 2026-08-09
Apmācība bez sava GPU
Manipulācijas policy apmācība ir GPU slodze, un modernie vision-language-action modeļi pieprasa vairāk VRAM, nekā ir tipiskā darbstacijā. AY-Robots platformā apmācība notiek platformas pārvaldītos mākoņa GPU: jūs izvēlaties datu kopu un policy tipu, sākat procesu un vērojat tā progresu no pārlūkprogrammas. Nav vajadzīga CUDA uzstādīšana, draiveru saskaņošana vai vides uzturēšana.
Ievade vienmēr ir mākoņa datu kopa no Dashboard > Datasets. Der viss, ko esat ierakstījuši teleoperācijas sesijās vai augšupielādējuši LeRobot formātā, ieskaitot apvienotas datu kopas. Sakārtojiet pirms apmācības: ar Failure marķētas epizodes parasti nevajadzētu iekļaut apmācības kopā, un desmit minūtes pārskatīšanas epizožu pārlūkā ietaupa stundas GPU laika, kas iztērēts, mācoties no sliktām demonstrācijām.
Atbalstītie policy
Tiek atbalstītas četras policy saimes. Tās atšķiras pēc izmēra, apmācības izmaksām un tā, cik daudz tās var uzsūkt no jūsu datiem, tāpēc pareizā izvēle ir atkarīga vairāk no jūsu uzdevuma un datu kopas nekā no jebkāda vispārīga vērtējuma.
| Policy | Veids | Īpašības |
|---|---|---|
| ACT | Transformer, darbību grupēšana | Prognozē īsas nākotnes darbību grupas, nevis atsevišķus soļus. Kompakts, apmācās salīdzinoši ātri un ir stabila pirmā izvēle vienam skaidri definētam uzdevumam. |
| Diffusion Policy | Difūzija pār darbību sekvencēm | Modelē pilnu demonstrēto darbību sadalījumu, kas palīdz, ja jūsu demonstrācijas atrisina uzdevumu vairāk nekā vienā derīgā veidā. Smagāka apmācībā un lēnāka izsecinājumā nekā ACT. |
| SmolVLA | Mazs vision-language-action modelis | Valodā balstīts: uzdevuma teksts no jūsu epizodēm kļūst par ievades daļu. Labs vidusceļš, kad vēlaties valodas nosacītību bez liela pamatmodeļa. |
| GR00T fine-tune | Pamatmodeļa fine-tune | Veic fine-tune lielam, iepriekš apmācītam robotikas pamatmodelim uz jūsu epizodēm. Augstākais no četriem griestiem, par augstāko apmācības cenu, ar stingru datu kopas formāta prasību. |
GR00T fine-tune pieņem tikai datu kopas LeRobot formāta versijā 2.1. v3.0 datu kopa neizdosies datu ielādes laikā, nevis iesniegšanas brīdī, tāpēc pārbaudiet formāta versiju, pirms sākat procesu. Platformā ierakstītas datu kopas var izmantot tādas, kādas tās ir; ārējām augšupielādēm vispirms pārbaudiet versiju failā meta/info.json.
Procesa sākšana
- 1Izvēlieties datu kopu
Atveriet Dashboard > Training un izvēlieties datu kopu, uz kuras apmācīties. Tiek rādīts epizožu skaits un robota tips, lai varētu apstiprināt, ka izvēlējāties pareizo.
- 2Izvēlieties policy
Izvēlieties vienu no atbalstītajiem policy tipiem. Ja neesat pārliecināti, sāciet ar ACT: tas ir lētākais veids, kā uzzināt, vai jūsu datu kopa ir pietiekami laba, lai vispār kaut ko apmācītu.
- 3Palaidiet
Sāciet procesu. Tas saņem job id un savu darba lapu, un pārlūkprogrammu varat aizvērt: apmācība turpinās servera pusē, un lapa rāda dzīvo statusu, kad vien atgriežaties.
Apmācības darba lapa
Katram procesam ir sava veltīta lapa, kas atbild uz diviem jautājumiem, kas jums faktiski rodas apmācības laikā: vai tas mācās un vai iekārta ir vesela. Mācīšanās progress tiek rādīts kā loss, mācīšanās ātruma grafika un gradienta normas grafiki. Loss, kas nekavējoties sasniedz plato, vai gradienta norma, kas eksplodē, agri pasaka, ka process nav gaidīšanas vērts.
Iekārtas veselība tiek rādīta blakus: GPU noslodze un atmiņa, kopā ar apmācības iekārtas resursdatora metriku. Fāžu laika skala rāda, kurā posmā process pašlaik atrodas, sākot no vides sagatavošanas, cauri datu ielādei, pašam apmācības ciklam un beidzot ar checkpoint augšupielādi. Kad kaut kas izskatās nepareizi, iebūvētais žurnāla skatītājs sniedz jēlos apmācības žurnālus bez jebkādas SSH piekļuves, kas parasti pietiek, lai redzētu, vai kļūme ir jūsu datu kopā vai pašā procesā.
Checkpoint un atsākšana
Checkpoint tiek glabāti pa procesu, nevis kopīgā fondā, tāpēc darba lapā uzskaitītie checkpoint vienmēr pieder tieši tam procesam un tā konfigurācijai. Tas ir svarīgāk, nekā izklausās: checkpoint sajaukšana starp procesiem ar dažādiem iestatījumiem ir klasisks klusi sabojātu policy avots.
Ja process tiek pārtraukts, varat atsākt no tā jaunākā checkpoint, nevis sākt no jauna. Starpposma checkpoint ir noderīgi arī paši par sevi: kad garš process tuvu beigām sāk pārmērīgi pieskaņoties, agrāks checkpoint bieži darbojas labāk uz reālas rokas nekā pēdējais.
Apmācītā policy palaišana uz jūsu rokas
Pabeigtu policy var izvietot tieši atpakaļ uz jūsu robotu. Kabīnē izvēlieties apmācīto policy savai pieslēgtajai rokai un sāciet izsecinājumu: policy tagad rada locītavu komandas, ko jūs iepriekš radījāt, teleoperējot. Rokai jābūt tam pašam robota tipam, uz kura tika ierakstīta datu kopa, un ainai vajadzētu līdzināties apmācības ainām, ieskaitot kameru izvietojumu.
Uztveriet pirmos izsecinājuma palaišanas gadījumus kā eksperimentus, nevis kā demonstrācijas. Turiet avārijas apturēšanu sasniedzamā attālumā, sāciet no sākuma stāvokļa, kas ir tuvs tam, ko demonstrējāt, un gaidiet, ka policy būs jutīga pret lietām, ko jūs nepamanītu: pārvietotu kameru, atšķirīgu apgaismojumu vai objektu, kāda datu kopā nekad nebija.
Cik epizožu nepieciešams
Biežākā apmācības kļūda platformā nav nepareizs hiperparametrs, tā ir apmācība ar pārāk maz datu un secinājums, ka policy tips nedarbojas. Kā aptuvenu likumu vienam galda uzdevumam: aptuveni 50 epizodes dod policy ar šauru vispārināšanu, kas gūst panākumus no sākuma stāvokļiem, kas tuvi tiem, ko demonstrējāt. Aptuveni 100 līdz 200 epizodes dod lietojamu izturību visā darba zonā tam vienam uzdevumam, ja starp epizodēm mainījāt objektu novietojumu.
Spējīgāki policy tipi to neatceļ. GR00T fine-tune ar 20 epizodēm joprojām vispārinās slikti; lielākie modeļi dod labākus griestus, kad dati jau ir pieejami. Ja jūsu budžets ir ierobežots, tērējiet to daudzveidīgākām epizodēm, nevis lielākam modelim.
Biežāk uzdotie jautājumi
Cik ilgi ilgst apmācības process?▾
Tas ir atkarīgs no policy tipa un datu kopas izmēra, tāpēc godīga viena skaitļa nav. ACT parasti ir ātrākais no četriem, GR00T fine-tune lēnākais. Fāžu laika skala un loss grafiki darba lapā agri parāda, vai process virzās uz priekšu.
Vai varu apmācīt uz apvienotas datu kopas?▾
Jā. Apvienotas datu kopas ir parastas datu kopas; apvienošanas validācija jau garantēja konsekventu fps, pazīmes un robota tipu. Vienas un tās pašas uzdevuma ierakstu apvienošana ir viens no efektīvākajiem veidiem, kā sasniegt 100 līdz 200 epizožu diapazonu.
Mans GR00T process neizdodas datu ielādes laikā. Ko pārbaudīt vispirms?▾
Datu kopas formāta versiju. GR00T fine-tune nepieciešama LeRobot v2.1, un v3.0 datu kopa neizdodas tieši tur. Pārbaudiet versiju datu kopas failā meta/info.json.
Vai pirms apmācības jāizņem neveiksmīgās epizodes?▾
Parasti jā. Ar Failure marķētas epizodes māca policy neveiksmīgo uzvedību. Recovery epizodes ir citādas: tās parāda, kā izlabot kļūdu, un bieži ir vērts tās paturēt.
Vai apmācības laikā man jātur pārlūkprogramma atvērta?▾
Nē. Procesi darbojas servera pusē. Darba lapa rāda pašreizējo statusu, grafikus un žurnālus, kad vien atgriežaties, un checkpoint tiek saglabāti neatkarīgi no tā, vai kāds vēro.
Kā AY-Robots glabā teleoperācijas ierakstus LeRobot formātā: epizožu struktūra, vadības paneļa pārlūks, augšupielāžu apvienošana un datu kopu tirdziņš.
Katra AY-Robots platformā atbalstītā robota roka ar specifikācijām: SO-100, Koch v1.1, Franka FR3, FP3 un Panda, WidowX-250 un ALOHA ViperX-300.