Policy training

Nagta-train ang AY-Robots ng manipulation policy sa managed GPU, kaya puwede kang lumipat mula sa na-record na episode papunta sa policy na tumatakbo sa arm mo nang hindi mo kailangang magmay-ari ng training hardware. Sinasaklaw ng pahinang ito ang suportadong uri ng policy, ang training run page, checkpoint, at kung anong resulta ang makatwirang aasahan mula sa bilang ng episode mo.

Huling na-update 2026-08-09

Pag-train nang walang sariling GPU

GPU workload ang pagta-train ng manipulation policy, at nangangailangan ng mas maraming VRAM ang modernong vision-language-action model kaysa sa tipikal na workstation. Sa AY-Robots, tumatakbo ang training sa cloud GPU na pinamamahalaan ng platform: pumili ka ng dataset at uri ng policy, simulan ang run, at panoorin ang progress nito mula sa browser. Walang CUDA setup, walang pagtutugma ng driver, at walang environment na pagpanatilihin.

Laging cloud dataset mula sa Dashboard > Datasets ang input. Kwalipikado ang anumang na-record mo sa pamamagitan ng teleoperation session o na-upload sa LeRobot format, kasama na ang mga merged dataset. Mag-curate bago mag-train: karaniwang labas ang mga episode na may Failure label sa training set, at nagliligtas ng oras ng GPU ang sampung minutong pagreview sa episode browser kaysa gumugol ng oras sa pagtuto mula sa masamang demonstration.

Mga suportadong policy

Apat na pamilya ng policy ang suportado. Naiiba sila sa laki, gastos ng training, at kung gaano karami ang maiaabsorb nila mula sa data mo, kaya ang tamang pagpili ay depende sa gawain at dataset mo higit pa sa anumang pangkalahatang ranking.

PolicyUriKatangian
ACTTransformer, action chunkingHinuhulaan ang maiikling chunk ng future action sa halip na iisang hakbang. Compact, mabilis na mag-train nang relatibo, at magandang unang pagpipilian para sa isang malinaw na tinukoy na gawain.
Diffusion PolicyDiffusion sa action sequenceNagmomodel ng buong distribution ng na-demonstrate na aksyon, na tumutulong kapag nireresolba ng mga demonstration mo ang gawain nang higit sa isang wastong paraan. Mas mabigat mag-train at mas mabagal mag-infer kaysa ACT.
SmolVLAMaliit na vision-language-action modelLanguage-conditioned: nagiging bahagi ng input ang task string mula sa episode mo. Magandang gitna kapag gusto mo ng language conditioning nang walang malaking foundation model.
GR00T fine-tuneFine-tune ng foundation modelFine-tune ang isang malaking pretrained na robotics foundation model gamit ang episode mo. Ang pinakamataas sa apat, sa pinakamataas na gastos ng training, at may mahigpit na kinakailangan sa dataset format.
Kailangan ng GR00T ang LeRobot v2.1 na dataset

Tinatanggap lang ng GR00T fine-tuning ang dataset sa LeRobot format version 2.1. Mabibigo ang v3.0 na dataset habang nagla-load ng data, hindi sa submission, kaya suriin ang format version bago mo simulan ang run. Puwedeng gamitin ang mga dataset na na-record sa platform gaya ng pagkakaroon nila; para sa external na upload, i-verify muna ang version sa meta/info.json.

Pagsisimula ng run

  1. 1
    Piliin ang dataset

    Buksan ang Dashboard > Training at piliin ang dataset na pagtatrainan. Ipinapakita ang bilang ng episode at robot type para makumpirma mong napili mo ang tama.

  2. 2
    Piliin ang policy

    Piliin ang isa sa mga suportadong uri ng policy. Kung hindi ka sigurado, simulan sa ACT: ito ang pinakamurang paraan para malaman kung sapat ang dataset mo para makapag-train ng kahit ano.

  3. 3
    Ilunsad

    Simulan ang run. Makakakuha ito ng job id at sarili nitong run page, at puwede mong isara ang browser: nagpapatuloy ang training sa server-side at ipinapakita ng page ang live na estado tuwing babalik ka.

Ang training run page

May sariling pahina ang bawat run na sumasagot sa dalawang tanong na talagang meron ka habang nagta-train: natututo ba ito, at malusog ba ang makina. Ipinapakita ang progress ng pagkatuto bilang chart ng loss, ang learning rate schedule, at gradient norm. Sinasabihan ka nang maaga ng loss na agad na plumateau o gradient norm na sumasabog na hindi na sulit hintayin ang run.

Ipinapakita rin ang health ng makina: GPU utilization at memory, kasama ang host metric ng training machine. Ipinapakita ng phase timeline kung nasaan ang run ngayon, mula sa environment preparation hanggang sa data loading, ang training loop mismo, at pag-upload ng checkpoint. Kapag may mukhang mali, binibigyan ka ng built-in na log viewer ng raw training log nang walang SSH access, na karaniwang sapat na para makita kung ang dataset mo ba o ang run mismo ang may problema.

Checkpoint at pagpapatuloy

Naka-store ang mga checkpoint kada run, hindi sa isang shared pool, kaya ang mga checkpoint na nakalista sa isang run page ay laging pag-aari ng eksaktong run na iyon at configuration nito. Mas mahalaga ito kaysa sa itsura nito: ang paghalo ng checkpoint sa magkaibang run na may magkaibang setting ay klasikong pinagmumulan ng tahimik na sirang policy.

Kung mabalam ang isang run, puwede kang magpatuloy mula sa pinakahuling checkpoint nito sa halip na magsimula ulit. Kapaki-pakinabang din nang mag-isa ang mga intermediate na checkpoint: kapag nagsisimulang mag-overfit ang matagal na run malapit sa dulo, mas maganda madalas na tumakbo sa totoong arm ang mas maagang checkpoint kaysa sa huli.

Pagpapatakbo ng na-train na policy sa arm mo

Ang natapos na policy ay puwedeng i-deploy pabalik sa robot mo. Sa cockpit, piliin ang na-train na policy para sa naka-connect na arm mo at simulan ang inference: gumagawa na ngayon ang policy ng mga joint command na dating ginagawa mo sa pamamagitan ng teleoperation. Dapat ang arm ay parehong robot type na kinarecord-an ng dataset, at dapat kahawig ang eksena sa mga training scene, kasama na ang paglalagay ng camera.

Ituring ang mga unang inference run bilang experiment, hindi demo. Panatilihing malapit ang emergency stop, magsimula mula sa starting state na malapit sa dinemonstreyt mo, at asahang sensitibo ang policy sa mga bagay na hindi mo mapapansin: nagalaw na camera, ibang liwanag, o bagay na hindi kailanman nakita ng dataset.

Ilang episode ang kailangan mo

Ang pinakakaraniwang pagkakamali sa training sa platform ay hindi ang maling hyperparameter, kundi ang pagta-train sa napakakaunting data tapos konklusyon na hindi gumagana ang uri ng policy. Bilang rule of thumb para sa iisang tabletop task: mga 50 episode ang magbibigay sa iyo ng policy na may makitid na generalization na nagtatagumpay mula sa mga starting state na malapit sa dinemonstreyt mo. Mga 100 hanggang 200 episode ang magbibigay ng magagamit na robustness sa buong workspace para sa iisang gawaing iyon, basta binago mo ang paglalagay ng bagay sa pagitan ng mga episode.

Hindi ito pinapawalang-bisa ng mas mahuhusay na uri ng policy. Mananatiling mahina ang generalization ng GR00T fine-tune sa 20 episode. Mas mataas na ceiling kapag naroon na ang data ang binibili ng mas malalaking model. Kung limitado ang budget mo, gastusin muna ito sa mas iba-ibang episode bago mo gastusin sa mas malaking model.

Mga madalas itanong

Gaano katagal ang isang training run?

Depende sa uri ng policy at laki ng dataset, kaya walang tapat na iisang numero. Karaniwang ACT ang pinakamabilis sa apat, ang GR00T fine-tune ang pinakamabagal. Ipinapakita nang maaga ng phase timeline at loss chart sa run page kung sumusulong ang isang run.

Puwede ba akong mag-train sa merged na dataset?

Oo. Ordinaryong dataset lang ang merged dataset; ginarantiyahan na ng merge validation ang pare-parehong fps, feature, at robot type. Isa sa pinakaepektibong paraan para maabot ang 100 hanggang 200 episode ang pagsasama ng mga recording ng parehong gawain.

Nabibigo ang GR00T run ko habang nagla-load ng data. Ano ang dapat kong tingnan muna?

Ang format version ng dataset. Kailangan ng GR00T fine-tuning ang LeRobot v2.1, at dun mismo mabibigo ang v3.0 dataset. Suriin ang version sa meta/info.json ng dataset mo.

Dapat ko bang alisin ang mga nabigong episode bago mag-train?

Karaniwan, oo. Itinuturo ng mga episode na may Failure label sa policy ang nabigong behavior. Iba naman ang Recovery episode: ipinapakita nila kung paano itama ang isang pagkakamali at kadalasan sulit panatilihin.

Kailangan ko bang buksan ang browser habang nagta-train?

Hindi. Tumatakbo ang mga run sa server-side. Ipinapakita ng run page ang kasalukuyang estado, chart, at log tuwing babalik ka, at naka-save ang mga checkpoint kahit walang nanonood.