Policy-opleiding
AY-Robots lei manipulasie-policys op bestuurde GPU's op, sodat jy van opgeneemde episodes na 'n policy wat op jou arm loop, kan gaan sonder om opleidingshardeware te besit. Hierdie bladsy dek die ondersteunde policytipes, die opleidingsloop-bladsy, kontrolepunte, en watter resultate jy realisties van jou episodetelling kan verwag.
Laas bygewerk 2026-08-09
Opleiding sonder jou eie GPU
Om 'n manipulasie-policy op te lei, is 'n GPU-werklading, en moderne vision-language-action-modelle benodig meer VRAM as wat 'n tipiese werkstasie het. Op AY-Robots loop die opleiding op wolk-GPU's wat deur die platform bestuur word: jy kies 'n datastel en 'n policytipe, begin die loop, en volg die vordering vanuit die blaaier. Daar is geen CUDA-opstelling, geen drywerpassing, en geen omgewing om te onderhou nie.
Die toevoer is altyd 'n wolkdatastel vanaf Dashboard > Datasets. Enigiets wat jy deur teleoperasie-sessies opgeneem of in LeRobot-formaat opgelaai het, kom in aanmerking, insluitend saamgevoegde datastelle. Kuratteer voordat jy oplei: episodes met die Failure-etiket hoort gewoonlik nie in die opleidingstel nie, en tien minute se hersiening in die episode-blaaier bespaar ure GPU-tyd wat andersins aan die aanleer van swak demonstrasies bestee word.
Ondersteunde policys
Vier policy-families word ondersteun. Hulle verskil in grootte, opleidingskoste, en hoeveel hulle uit jou data kan opneem, die regte keuse hang dus meer van jou taak en datastel af as van enige algemene rangorde.
| Policy | Tipe | Eienskappe |
|---|---|---|
| ACT | Transformer, action chunking | Voorspel kort brokke toekomstige aksies eerder as enkele stappe. Kompak, lei relatief vinnig op, en is 'n stewige eerste keuse vir een goed gedefinieerde taak. |
| Diffusion Policy | Diffusie oor aksiereekse | Modelleer die volle verspreiding van gedemonstreerde aksies, wat help wanneer jou demonstrasies die taak op meer as een geldige manier oplos. Swaarder om op te lei en stadiger by inferensie as ACT. |
| SmolVLA | Klein vision-language-action-model | Taalgekondisioneerd: die taakstring uit jou episodes word deel van die toevoer. 'n Goeie middeweg as jy taalkondisionering wil hê sonder 'n groot fondasiemodel. |
| GR00T fine-tune | Fondasiemodel-fine-tune | Fyn-stem 'n groot vooropgeleide robotika-fondasiemodel op jou episodes af. Die hoogste plafon van die vier, teen die hoogste opleidingskoste, en met 'n streng datastelformaat-vereiste. |
GR00T-fine-tuning aanvaar slegs datastelle in LeRobot-formaatweergawe 2.1. 'n v3.0-datastel sal tydens data loading faal, nie by indiening nie, kyk dus na die formaatweergawe voordat jy die loop begin. Datastelle wat op die platform opgeneem is, kan soos dit is gebruik word; vir eksterne oplaaie, verifieer eers die weergawe in meta/info.json.
'n Loop begin
- 1Kies die datastel
Maak Dashboard > Training oop en kies die datastel om op op te lei. Die episodetelling en robottipe word gewys sodat jy kan bevestig jy het die regte een gekies.
- 2Kies die policy
Kies een van die ondersteunde policytipes. As jy onseker is, begin met ACT: dit is die goedkoopste manier om uit te vind of jou datastel goed genoeg is om enigiets op te lei.
- 3Lanseer
Begin die loop. Dit kry 'n job id en sy eie loop-bladsy, en jy kan die blaaier toemaak: opleiding hou aan die serverkant aan en die bladsy wys die lewende toestand wanneer jy ook al terugkom.
Die opleidingsloop-bladsy
Elke loop het 'n toegewyde bladsy wat die twee vrae beantwoord wat jy werklik het tydens opleiding: leer dit, en is die masjien gesond. Leervordering word gewys as grafieke van die loss, die leertempo-skedule, en die gradiëntnorm. 'n Loss wat onmiddellik plateau bereik of 'n gradiëntnorm wat ontplof, vertel jou vroeg dat die loop nie die moeite werd is om op te wag nie.
Masjiengesondheid word langsaan gewys: GPU-benutting en geheue, plus die gasheerstatistieke van die opleidingsmasjien. 'n Fase-tydlyn wys waar die loop tans is, van omgewingvoorbereiding deur data loading, die opleidinglus self, en kontrolepunt-oplaai. Wanneer iets nie reg lyk nie, gee die ingeboude logbekyker jou die rou opleidinglogs sonder enige SSH-toegang, wat gewoonlik genoeg is om te sien of 'n mislukking jou datastel of die loop self is.
Kontrolepunte en hervatting
Kontrolepunte word per loop gestoor, nie in 'n gedeelde poel nie, sodat die kontrolepunte wat op 'n loop-bladsy gelys word, altyd aan presies daardie loop en sy konfigurasie behoort. Dit maak meer saak as wat dit klink: die vermenging van kontrolepunte oor loops met verskillende instellings is 'n klassieke bron van policys wat stilweg breek.
As 'n loop onderbreek word, kan jy vanaf sy jongste kontrolepunt hervat in plaas daarvan om van voor af te begin. Tussentydse kontrolepunte is ook op hul eie nuttig: wanneer 'n lang loop teen die einde begin oorpas, werk 'n vroeëre kontrolepunt dikwels beter op die regte arm as die finale een.
Die opgeleide policy op jou arm laat loop
'n Voltooide policy kan direk terug na jou robot ontplooi word. Kies in die cockpit die opgeleide policy vir jou gekoppelde arm en begin inferensie: die policy lewer nou die gewrigopdragte op wat jy voorheen deur teleoperasie self gelewer het. Die arm moet dieselfde robottipe wees waarop die datastel opgeneem is, en die toneel moet ooreenstem met die opleidingtonele, insluitend kameraplasing.
Behandel die eerste inferensieloop soos eksperimente, nie demonstrasies nie. Hou die noodstop binne bereik, begin vanaf 'n beginstoestand naby aan wat jy gedemonstreer het, en verwag dat die policy sensitief sal wees vir dinge wat jy nie sal opmerk nie: 'n verskuifde kamera, ander beligting, of 'n voorwerp wat nooit in die datastel was nie.
Hoeveel episodes jy nodig het
Die algemeenste opleidingsfout op die platform is nie 'n verkeerde hiperparameter nie, dit is om op te lei op te min data en te konkludeer dat die policytipe nie werk nie. As 'n vuistreël vir een tafeltaak: ongeveer 50 episodes gee jou 'n policy met nou veralgemening wat slaag vanaf beginstoestande naby aan dié wat jy gedemonstreer het. Ongeveer 100 tot 200 episodes gee bruikbare robuustheid oor die werkruimte vir daardie een taak, mits jy voorwerpplasing tussen episodes gevarieer het.
Meer bekwame policytipes hef dit nie op nie. 'n GR00T fine-tune op 20 episodes sal steeds swak veralgemeen; wat die groter modelle jou koop, is 'n beter plafon sodra die data daar is. As jou begroting beperk is, spandeer dit eers aan meer gevarieerde episodes voordat jy dit aan 'n groter model spandeer.
Gereelde vrae
Hoe lank neem 'n opleidingsloop?▾
Dit hang af van die policytipe en datastelgrootte, daar is dus geen eerlike enkele getal nie. ACT is tipies die vinnigste van die vier, GR00T-fine-tunes die stadigste. Die fase-tydlyn en loss-grafieke op die loop-bladsy wys vroeg of 'n loop vorder.
Kan ek op 'n saamgevoegde datastel oplei?▾
Ja. Saamgevoegde datastelle is gewone datastelle; die samevoeg-validasie het reeds konsekwente fps, kenmerke, en robottipe gewaarborg. Die samevoeging van opnames van dieselfde taak is een van die doeltreffendste maniere om die 100 tot 200 episode-reeks te bereik.
My GR00T-loop faal tydens data loading. Wat moet ek eerste nagaan?▾
Die datastelformaatweergawe. GR00T-fine-tuning vereis LeRobot v2.1, en 'n v3.0-datastel faal presies daar. Kyk na die weergawe in meta/info.json van jou datastel.
Moet ek mislukte episodes voor opleiding verwyder?▾
Gewoonlik ja. Episodes met die Failure-etiket leer die policy die mislukkende gedrag. Recovery-episodes is anders: hulle wys hoe om 'n fout reg te stel en is dikwels die moeite werd om te behou.
Moet ek die blaaier oop hou tydens opleiding?▾
Nee. Loops word aan die serverkant uitgevoer. Die loop-bladsy wys die huidige toestand, grafieke, en logs wanneer jy ook al terugkom, en kontrolepunte word gestoor ongeag of iemand kyk.
Hoe AY-Robots teleoperasie-opnames in die LeRobot-formaat stoor: episodestruktuur, die dashboard se episode-blaaier, samevoeging van oplaaie, en die mark.
Elke robotarm wat op AY-Robots ondersteun word, met sy spesifikasies: SO-100, Koch v1.1, Franka FR3, FP3 en Panda, WidowX-250, en die ALOHA ViperX-300.