Mafunzo ya policy
AY-Robots hufundisha policy za manipulation kwenye GPU zinazosimamiwa, hivyo unaweza kwenda kutoka episode zilizorekodiwa hadi policy inayoendeshwa kwenye mkono wako bila kumiliki vifaa vya mafunzo. Ukurasa huu unashughulikia aina za policy zinazosaidiwa, ukurasa wa training run, checkpoint, na matokeo ya kutarajia kihalisia kutoka hesabu yako ya episode.
Ilisasishwa mwisho 2026-08-09
Mafunzo bila GPU yako mwenyewe
Kufundisha policy ya manipulation ni mzigo wa GPU, na modeli za kisasa za vision-language-action zinahitaji VRAM zaidi kuliko workstation ya kawaida ina. Kwenye AY-Robots mafunzo yanaendeshwa kwenye GPU za wingu zinazosimamiwa na jukwaa: unachagua dataset na aina ya policy, unaanzisha run, na kuangalia maendeleo yake kutoka kwenye kivinjari. Hakuna usanidi wa CUDA, hakuna kulinganisha driver, na hakuna mazingira ya kudumisha.
Ingizo daima ni dataset ya wingu kutoka Dashboard > Datasets. Chochote ulichorekodi kupitia session za teleoperesheni au ulichopakia katika muundo wa LeRobot kinastahili, ikiwemo dataset zilizounganishwa. Panga kabla ya kufundisha: episode zilizowekwa lebo ya Failure kwa kawaida hazipaswi kuwa kwenye seti ya mafunzo, na dakika kumi za ukaguzi kwenye kivinjari cha episode huokoa masaa ya muda wa GPU unaotumika kujifunza kutoka maonyesho mabaya.
Policy zinazosaidiwa
Familia nne za policy zinasaidiwa. Zinatofautiana kwa ukubwa, gharama ya mafunzo, na kiasi zinachoweza kuchukua kutoka data yako, hivyo chaguo sahihi hutegemea kazi na dataset yako zaidi ya kiwango chochote cha jumla.
| Policy | Aina | Sifa |
|---|---|---|
| ACT | Transformer, action chunking | Hutabiri vipande vifupi vya vitendo vijavyo badala ya hatua moja moja. Ndogo, inafundisha kwa haraka kiasi, na ni chaguo la kwanza thabiti kwa kazi moja iliyofafanuliwa vizuri. |
| Diffusion Policy | Diffusion juu ya mfuatano wa vitendo | Hutengeneza modeli ya mgawanyo mzima wa vitendo vilivyoonyeshwa, jambo linalosaidia wakati maonyesho yako yanatatua kazi kwa zaidi ya njia moja sahihi. Nzito zaidi kufundisha na polepole zaidi wakati wa inference kuliko ACT. |
| SmolVLA | Modeli ndogo ya vision-language-action | Inategemea lugha: mfuatano wa maneno ya kazi kutoka episode zako huwa sehemu ya ingizo. Msingi mzuri wa kati ukitaka utegemezi wa lugha bila modeli kubwa ya msingi. |
| GR00T fine-tune | Fine-tune ya foundation model | Hufanya fine-tune ya foundation model kubwa iliyofundishwa awali ya robotiki kwa episode zako. Kiwango cha juu zaidi cha nne, kwa gharama ya juu zaidi ya mafunzo, na yenye hitaji kali la muundo wa dataset. |
Fine-tuning ya GR00T inakubali tu dataset katika toleo la muundo wa LeRobot 2.1. Dataset ya v3.0 itashindwa wakati wa data loading, si wakati wa kuwasilisha, hivyo angalia toleo la muundo kabla ya kuanza run. Dataset zilizorekodiwa kwenye jukwaa zinaweza kutumika kama zilivyo; kwa upakiaji wa nje, thibitisha toleo kwenye meta/info.json kwanza.
Kuanzisha run
- 1Chagua dataset
Fungua Dashboard > Training na chagua dataset ya kufundisha. Hesabu ya episode na aina ya roboti huonyeshwa ili uweze kuthibitisha umechagua sahihi.
- 2Chagua policy
Chagua moja ya aina za policy zinazosaidiwa. Ikiwa huna uhakika, anza na ACT: ndiyo njia ya bei nafuu zaidi ya kugundua kama dataset yako ni nzuri ya kutosha kufundisha chochote kabisa.
- 3Zindua
Anzisha run. Inapata job id na ukurasa wake wa run, na unaweza kufunga kivinjari: mafunzo yanaendelea upande wa server na ukurasa huonyesha hali ya sasa wakati wowote unaporudi.
Ukurasa wa training run
Kila run ina ukurasa wake maalum unaojibu maswali mawili unayoyakuwa nayo hasa wakati wa mafunzo: je, inajifunza, na je, mashine iko salama. Maendeleo ya kujifunza huonyeshwa kama chati za loss, ratiba ya learning rate, na gradient norm. Loss inayosimama mara moja au gradient norm inayolipuka hukwambia mapema kuwa run haifai kusubiriwa.
Afya ya mashine huonyeshwa pembeni: matumizi na kumbukumbu ya GPU, pamoja na metrics za host za mashine ya mafunzo. Timeline ya awamu huonyesha run iko wapi sasa, kuanzia maandalizi ya mazingira kupitia data loading, mzunguko wa mafunzo wenyewe, na upakiaji wa checkpoint. Kitu kikionekana si sawa, log viewer iliyojengwa ndani hukupa logs ghafi za mafunzo bila ufikiaji wowote wa SSH, jambo linalotosha kawaida kuona kama tatizo ni la dataset yako au la run lenyewe.
Checkpoint na kuendelea tena
Checkpoint huhifadhiwa kwa kila run, si kwenye pool moja iliyoshirikiwa, hivyo checkpoint zilizoorodheshwa kwenye ukurasa wa run daima ni za run hiyo hasa na usanidi wake. Hii ina umuhimu zaidi ya inavyosikika: kuchanganya checkpoint kati ya run zenye mipangilio tofauti ni chanzo cha kawaida cha policy zinazoharibika kimya kimya.
Run ikikatishwa, unaweza kuendelea tena kutoka checkpoint yake ya mwisho badala ya kuanza upya. Checkpoint za katikati pia zina thamani zenyewe: run ndefu inapoanza overfitting karibu na mwisho, checkpoint ya awali mara nyingi hufanya vizuri zaidi kwenye mkono halisi kuliko ile ya mwisho.
Kuendesha policy iliyofundishwa kwenye mkono wako
Policy iliyokamilika inaweza kupelekwa moja kwa moja kurudi kwenye roboti yako. Kwenye cockpit, chagua policy iliyofundishwa kwa mkono wako uliounganishwa na anzisha inference: policy sasa huzalisha amri za viungo ambazo hapo awali ulizizalisha kwa teleoperesheni. Mkono lazima uwe aina ile ile ya roboti ambayo dataset ilirekodiwa juu yake, na mandhari inapaswa kufanana na mandhari za mafunzo, ikiwemo mahali kamera zilipowekwa.
Tendea run za kwanza za inference kama majaribio, si maonyesho. Weka kizima cha dharura karibu, anza kutoka hali ya kuanzia iliyo karibu na ile uliyoonyesha, na tarajia policy iwe nyeti kwa vitu ambavyo huenda usivigundue: kamera iliyohamishwa, mwanga tofauti, au kitu ambacho dataset haikuwa nacho kamwe.
Episode ngapi unahitaji
Kosa la kawaida zaidi la mafunzo kwenye jukwaa si hyperparameter isiyo sahihi, ni kufundisha kwa data kidogo mno na kuhitimisha aina ya policy haifanyi kazi. Kama kanuni ya vidole kwa kazi moja ya tabletop: takribani episode 50 hukupa policy yenye generalization finyu inayofanikiwa kutoka hali za kuanzia zilizo karibu na ulizoonyesha. Takribani episode 100 hadi 200 hukupa uimara unaotumika kote kwenye workspace kwa kazi hiyo moja, ikiwa ulibadilisha mahali pa vitu kati ya episode.
Aina za policy zenye uwezo zaidi hazibatilishi hili. Fine-tune ya GR00T kwenye episode 20 bado itakuwa na generalization dhaifu; kile modeli kubwa zinakupa ni kiwango cha juu bora zaidi mara data ikiwepo. Ikiwa bajeti yako ni ndogo, itumie kwenye episode zenye tofauti zaidi kabla ya kuitumia kwenye modeli kubwa zaidi.
Maswali yanayoulizwa mara kwa mara
Training run inachukua muda gani?▾
Hutegemea aina ya policy na ukubwa wa dataset, hivyo hakuna namba moja ya uaminifu. ACT kwa kawaida ndiyo ya haraka zaidi kati ya nne, GR00T fine-tunes ndiyo za polepole zaidi. Timeline ya awamu na chati za loss kwenye ukurasa wa run huonyesha mapema kama run inaendelea vizuri.
Je, naweza kufundisha kwenye dataset iliyounganishwa?▾
Ndiyo. Dataset zilizounganishwa ni dataset za kawaida; uthibitishaji wa kuunganisha tayari ulihakikisha fps, feature, na aina ya roboti zinalingana. Kuunganisha rekodi za kazi ile ile ni mojawapo ya njia bora zaidi za kufikia wigo wa episode 100 hadi 200.
Run yangu ya GR00T inashindwa wakati wa data loading. Nikague nini kwanza?▾
Toleo la muundo wa dataset. Fine-tuning ya GR00T inahitaji LeRobot v2.1, na dataset ya v3.0 hushindwa hasa hapo. Angalia toleo katika meta/info.json ya dataset yako.
Je, niondoe episode zilizoshindwa kabla ya mafunzo?▾
Kwa kawaida ndiyo. Episode zenye lebo ya Failure hufundisha policy tabia inayoshindwa. Episode za Recovery ni tofauti: zinaonyesha jinsi ya kurekebisha kosa na mara nyingi zinafaa kuhifadhiwa.
Je, ninahitaji kuweka kivinjari wazi wakati wa mafunzo?▾
Hapana. Run huendeshwa upande wa server. Ukurasa wa run huonyesha hali ya sasa, chati, na logs wakati wowote unaporudi, na checkpoint huhifadhiwa bila kujali kama mtu anaangalia au la.
Jinsi AY-Robots inavyohifadhi rekodi za teleoperesheni katika muundo wa LeRobot: episode, kivinjari cha dashibodi, kuunganisha, na soko la dataset.
Kila mkono wa roboti unaosaidiwa kwenye AY-Robots na sifa zake: SO-100, Koch v1.1, Franka FR3, FP3 na Panda, WidowX-250, na ALOHA ViperX-300.