Trajnimi i policy

AY-Robots trajnon policy manipulimi mbi GPU të menaxhuara, kështu që mund të kaloni nga episode të regjistruara te një policy që funksionon në krahun tuaj pa zotëruar hardware trajnimi. Kjo faqe mbulon tipet e mbështetura të policy, faqen e sesionit të trajnimit, checkpoint-et dhe çfarë rezultatesh të prisni realisht nga numri juaj i episodeve.

Përditësuar së fundmi 2026-08-09

Trajnim pa GPU tuajin

Trajnimi i një policy manipulimi është një ngarkesë pune GPU, dhe modelet moderne vision-language-action kërkojnë më shumë VRAM se sa ka një stacion pune tipik. Në AY-Robots trajnimi kryhet në GPU cloud të menaxhuara nga platforma: zgjidhni një dataset dhe një tip policy, nisni sesionin dhe ndiqni progresin nga shfletuesi. Nuk ka konfigurim CUDA, nuk ka përputhje drajverësh dhe nuk ka mjedis për të mirëmbajtur.

Hyrja është gjithmonë një dataset cloud nga Dashboard > Datasets. Gjithçka që keni regjistruar përmes sesioneve të teleoperimit ose ngarkuar në formatin LeRobot është e pranueshme, përfshirë dataset-et e bashkuara. Kuroni para se të trajnoni: episodet e etiketuara Failure zakonisht s'i përkasin bashkësisë së trajnimit, dhe dhjetë minuta shqyrtim në shfletuesin e episodeve kursejnë orë GPU të harxhuara duke mësuar nga demonstrime të këqija.

Policy-të e mbështetura

Mbështeten katër familje policy. Ato dallohen për nga madhësia, kostoja e trajnimit dhe sa mund të absorbojnë nga të dhënat tuaja, kështu që zgjedhja e duhur varet më shumë nga detyra dhe dataset-i juaj sesa nga ndonjë renditje e përgjithshme.

PolicyLlojiKarakteristikat
ACTTransformer, grumbullim veprimeshParashikon grupe të shkurtra veprimesh të ardhshme në vend të hapave të vetëm. Kompakte, trajnohet krahasimisht shpejt, dhe është zgjedhje e parë solide për një detyrë të vetme dhe të mirëpërcaktuar.
Diffusion PolicyDifuzion mbi sekuenca veprimeshModelon shpërndarjen e plotë të veprimeve të demonstruara, gjë që ndihmon kur demonstrimet tuaja e zgjidhin detyrën në më shumë se një mënyrë të vlefshme. Më e rëndë për t'u trajnuar dhe më e ngadaltë në inference se ACT.
SmolVLAModel i vogël vision-language-actionI kushtëzuar nga gjuha: vargu i detyrës nga episodet tuaja bëhet pjesë e hyrjes. Një zgjidhje e mirë e mesme kur doni kushtëzim gjuhësor pa një model themel të madh.
GR00T fine-tuneFine-tune i një modeli themelBën fine-tune të një modeli të madh, të para-trajnuar themel robotikë mbi episodet tuaja. Tavani më i lartë nga të katërta, me koston më të lartë trajnimi, dhe me kërkesë strikte për formatin e dataset-it.
GR00T kërkon dataset-e LeRobot v2.1

Fine-tune-i i GR00T pranon vetëm dataset-e në formatin LeRobot versioni 2.1. Një dataset v3.0 do të dështojë gjatë ngarkimit të të dhënave, jo gjatë dorëzimit, kështu që kontrolloni versionin e formatit para se të nisni sesionin. Dataset-et e regjistruara në platformë mund të përdoren siç janë; për ngarkime të jashtme, verifikoni fillimisht versionin te meta/info.json.

Nisja e një sesioni

  1. 1
    Zgjidhni dataset-in

    Hapni Dashboard > Training dhe zgjidhni dataset-in mbi të cilin do të trajnoni. Numri i episodeve dhe tipi i robotit shfaqen që të konfirmoni se keni zgjedhur atë të duhurin.

  2. 2
    Zgjidhni policy-n

    Zgjidhni një nga tipet e mbështetura të policy. Nëse nuk jeni i sigurt, filloni me ACT: është mënyra më e lirë për të zbuluar nëse dataset-i juaj është fare i mjaftueshëm për të trajnuar diçka.

  3. 3
    Nisni

    Nisni sesionin. Merr një job id dhe faqen e vet të sesionit, dhe mund ta mbyllni shfletuesin: trajnimi vazhdon në server dhe faqja shfaq gjendjen live sa herë që të ktheheni.

Faqja e sesionit të trajnimit

Çdo sesion ka një faqe të dedikuar që përgjigjet dy pyetjeve që keni në të vërtetë gjatë trajnimit: a po mëson, dhe a është makina në rregull. Progresi i të mësuarit shfaqet si grafikë të loss-it, orarit të learning rate dhe normës së gradientit. Një loss që rrafshohet menjëherë ose një normë gradienti që shpërthen ju thotë herët se sesioni nuk ia vlen të pritet.

Shëndeti i makinës shfaqet krahas: përdorimi dhe memoria e GPU, plus metrikat e host-it të makinës së trajnimit. Një kronologji fazash tregon ku ndodhet aktualisht sesioni, nga përgatitja e mjedisit deri te ngarkimi i të dhënave, vetë cikli i trajnimit dhe ngarkimi i checkpoint-eve. Kur diçka duket jo në rregull, shikuesi i integruar i regjistrave ju jep regjistrat e papërpunuar të trajnimit pa asnjë qasje SSH, gjë që zakonisht mjafton për të parë nëse dështimi është te dataset-i juaj apo te vetë sesioni.

Checkpoint-et dhe rifillimi

Checkpoint-et ruhen për çdo sesion, jo në një pool të përbashkët, kështu që checkpoint-et e listuara në një faqe sesioni i përkasin gjithmonë saktësisht atij sesioni dhe konfigurimit të tij. Kjo ka më shumë rëndësi nga sa duket: përzierja e checkpoint-eve mes sesionesh me cilësime të ndryshme është një burim klasik policy-sh të prishura në heshtje.

Nëse një sesion ndërpritet, mund të rifilloni nga checkpoint-i i tij më i fundit në vend që të filloni nga fillimi. Checkpoint-et e ndërmjetme janë të dobishme edhe vetë: kur një sesion i gjatë fillon të mbi-përshtatet (overfitting) drejt fundit, një checkpoint më i hershëm shpesh funksionon më mirë në krahun real sesa ai final.

Vënia në punë e policy-t të trajnuar në krahun tuaj

Një policy e përfunduar mund të vendoset drejtpërdrejt përsëri te roboti juaj. Në kokpit, zgjidhni policy-n e trajnuar për krahun tuaj të lidhur dhe nisni inference: policy tani prodhon komandat e nyjeve që më parë i prodhonit ju vetë përmes teleoperimit. Krahu duhet të jetë i të njëjtit tip roboti mbi të cilin u regjistrua dataset-i, dhe skena duhet t'i ngjajë skenave të trajnimit, duke përfshirë vendosjen e kamerave.

Trajtojini vrapimet e para të inference si eksperimente, jo si demonstrime. Mbajeni ndalimin e emergjencës në dorë, filloni nga një gjendje fillestare afër asaj që keni demonstruar, dhe prisni që policy-ja të jetë e ndjeshme ndaj gjërave që ju nuk do t'i vinit re: një kamerë e zhvendosur, dritë e ndryshme, ose një objekt që dataset-i nuk e ka përmbajtur kurrë.

Sa episode ju duhen

Gabimi më i zakonshëm i trajnimit në platformë nuk është një hiperparametër i gabuar, është trajnimi mbi shumë pak të dhëna dhe konkludimi se tipi i policy-t nuk funksionon. Si rregull praktik për një detyrë të vetme mbi tavolinë: rreth 50 episode ju japin një policy me përgjithësim të ngushtë që ia del nga gjendje fillestare afër atyre që keni demonstruar. Rreth 100 deri në 200 episode japin fortësi të përdorshme nëpër hapësirën e punës për atë detyrë të vetme, me kusht që të keni variuar vendosjen e objekteve mes episodeve.

Tipet më të fuqishme të policy nuk e shfuqizojnë këtë. Një fine-tune GR00T mbi 20 episode do të përgjithësojë ende dobët; ajo që ju blejnë modelet më të mëdha është një tavan më i lartë sapo të dhënat të ekzistojnë. Nëse buxheti juaj është i kufizuar, shpenzojeni në më shumë episode të larmishme para se ta shpenzoni në një model më të madh.

Pyetje të shpeshta

Sa zgjat një sesion trajnimi?

Varet nga tipi i policy dhe madhësia e dataset-it, kështu që nuk ka një numër të vetëm dhe të ndershëm. ACT është zakonisht më i shpejti nga të katërta, fine-tune-t e GR00T më të ngadaltit. Kronologjia e fazave dhe grafikët e loss-it në faqen e sesionit tregojnë herët nëse një sesion po përparon.

A mund të trajnoj mbi një dataset të bashkuar?

Po. Dataset-et e bashkuara janë dataset-e të zakonshme; validimi i bashkimit tashmë garantoi fps, karakteristika dhe tip roboti konsistente. Bashkimi i regjistrimeve të së njëjtës detyrë është një nga mënyrat më efektive për të arritur intervalin 100 deri në 200 episode.

Sesioni im GR00T dështon gjatë ngarkimit të të dhënave. Çfarë duhet të kontrolloj së pari?

Versionin e formatit të dataset-it. Fine-tune-i i GR00T kërkon LeRobot v2.1, dhe një dataset v3.0 dështon pikërisht aty. Kontrolloni versionin te meta/info.json e dataset-it tuaj.

A duhet të heq episodet e dështuara para trajnimit?

Zakonisht po. Episodet e etiketuara Failure i mësojnë policy-t sjelljen dështuese. Episodet Recovery janë të ndryshme: ato tregojnë si të korrigjohet një gabim dhe shpesh ia vlen të mbahen.

A duhet ta mbaj shfletuesin hapur gjatë trajnimit?

Jo. Sesionet ekzekutohen në server. Faqja e sesionit tregon gjendjen aktuale, grafikët dhe regjistrat sa herë që ktheheni, dhe checkpoint-et ruhen pavarësisht nëse dikush po vëzhgon.