Trénovanie policy

AY-Robots trénuje manipulačné policy na spravovaných GPU, takže sa dostanete od nahratých epizód k policy bežiacej na vašom ramene bez toho, aby ste vlastnili tréningový hardvér. Táto stránka pokrýva podporované typy policy, stránku tréningového behu, checkpointy a to, aké výsledky môžete reálne očakávať pri vašom počte epizód.

Naposledy aktualizované 2026-08-09

Trénovanie bez vlastnej GPU

Trénovanie manipulačnej policy je záťaž pre GPU a moderné vision-language-action modely potrebujú viac VRAM, než má typická pracovná stanica. Na AY-Robots beží trénovanie na cloudových GPU, ktoré spravuje platforma: vyberiete dataset a typ policy, spustíte beh a sledujete jeho priebeh z prehliadača. Žiadne nastavovanie CUDA, žiadne zosúlaďovanie ovládačov a žiadne prostredie na údržbu.

Vstupom je vždy cloudový dataset z Dashboard > Datasets. Vhodné je čokoľvek, čo ste nahrali cez relácie teleoperácie alebo nahrali vo formáte LeRobot, vrátane zlúčených datasetov. Pred trénovaním kurátorujte: epizódy označené Failure zvyčajne do tréningovej množiny nepatria a desať minút kontroly v prehliadači epizód ušetrí hodiny času GPU, ktorý by inak padol na učenie sa z chybných demonštrácií.

Podporované policy

Podporujú sa štyri rodiny policy. Líšia sa veľkosťou, nákladmi na trénovanie a tým, koľko dokážu z vašich dát absorbovať, takže správna voľba závisí viac od vašej úlohy a datasetu než od akéhokoľvek všeobecného rebríčka.

PolicyTypVlastnosti
ACTTransformer, action chunkingPredpovedá krátke bloky budúcich akcií namiesto jednotlivých krokov. Kompaktná, trénuje sa pomerne rýchlo a je solídnou prvou voľbou pre jednu jasne definovanú úlohu.
Diffusion PolicyDifúzia nad sekvenciami akciíModeluje celé rozdelenie predvedených akcií, čo pomáha, keď vaše demonštrácie riešia úlohu viac než jedným platným spôsobom. Náročnejšia na trénovanie a pomalšia pri inferencii než ACT.
SmolVLAMalý vision-language-action modelJazykovo podmienená: reťazec úlohy z vašich epizód sa stáva súčasťou vstupu. Dobrý kompromis, ak chcete jazykové podmienenie bez veľkého foundation modelu.
Doladenie GR00TDoladenie foundation modeluDolaďuje veľký, vopred natrénovaný robotický foundation model na vašich epizódach. Najvyšší strop zo všetkých štyroch, pri najvyšších nákladoch na trénovanie a s prísnou požiadavkou na formát datasetu.
GR00T vyžaduje datasety LeRobot v2.1

Doladenie GR00T akceptuje výlučne datasety vo formátovej verzii LeRobot 2.1. Dataset v3.0 zlyhá počas načítavania dát, nie pri odoslaní, takže si pred spustením behu overte verziu formátu. Datasety nahraté na platforme možno použiť tak, ako sú; pri externých nahrávkach si najprv overte verziu v meta/info.json.

Spustenie behu

  1. 1
    Vyberte dataset

    Otvorte Dashboard > Training a vyberte dataset, na ktorom sa má trénovať. Zobrazí sa počet epizód a typ robota, aby ste si mohli overiť, že ste vybrali ten správny.

  2. 2
    Vyberte policy

    Vyberte jeden z podporovaných typov policy. Ak si nie ste istí, začnite s ACT: je to najlacnejší spôsob, ako zistiť, či je váš dataset vôbec dosť dobrý na to, aby sa na ňom dalo niečo natrénovať.

  3. 3
    Spustite

    Spustite beh. Dostane id úlohy a vlastnú stránku behu a prehliadač môžete zavrieť: trénovanie pokračuje na strane servera a stránka po vašom návrate zobrazí aktuálny stav.

Stránka tréningového behu

Každý beh má vlastnú stránku, ktorá odpovedá na dve otázky, ktoré počas trénovania naozaj máte: učí sa a je stroj v poriadku. Pokrok učenia sa zobrazuje ako grafy loss, harmonogramu learning rate a normy gradientu. Loss, ktorý sa okamžite vyrovná, alebo norma gradientu, ktorá vybuchne, vám skoro naznačí, že na tento beh nemá zmysel čakať.

Vedľa toho sa zobrazuje zdravie stroja: vyťaženie a pamäť GPU, plus metriky hostiteľského stroja tréningového servera. Časová os fáz ukazuje, kde sa beh práve nachádza, od prípravy prostredia cez načítavanie dát a samotnú tréningovú slučku až po nahratie checkpointov. Ak niečo vyzerá podozrivo, vstavaný prehliadač logov vám poskytne surové tréningové logy bez prístupu cez SSH, čo väčšinou stačí na to, aby ste zistili, či problém leží vo vašom datasete, alebo v samotnom behu.

Checkpointy a pokračovanie

Checkpointy sa ukladajú podľa behu, nie do zdieľaného poolu, takže checkpointy uvedené na stránke behu vždy patria presne tomuto behu a jeho konfigurácii. To váži viac, než sa zdá: miešanie checkpointov naprieč behmi s rôznymi nastaveniami je klasický zdroj potichu pokazených policy.

Ak sa beh preruší, môžete pokračovať od jeho posledného checkpointu namiesto toho, aby ste začínali odznova. Priebežné checkpointy sú užitočné aj samy osebe: keď dlhý beh smerom ku koncu začne pretrénovávať, skorší checkpoint často funguje na skutočnom ramene lepšie ako finálny.

Spustenie natrénovanej policy na vašom ramene

Hotovú policy možno nasadiť priamo späť na vášho robota. V kokpite vyberte natrénovanú policy pre pripojené rameno a spustite inferenciu: policy teraz produkuje príkazy pre kĺby, ktoré ste predtým vytvárali teleoperáciou. Rameno musí byť rovnaký typ robota, na akom bol dataset nahratý, a scéna by mala pripomínať tréningové scény vrátane umiestnenia kamier.

Prvé behy inferencie berte ako experimenty, nie ako predvádzačky. Držte núdzové zastavenie na dosah, začnite z počiatočného stavu blízkeho tomu, čo ste predviedli, a počítajte s tým, že policy je citlivá na veci, ktoré by ste si ani nevšimli: posunutá kamera, iné svetlo alebo objekt, ktorý dataset nikdy neobsahoval.

Koľko epizód potrebujete

Najčastejšou chybou pri trénovaní na platforme nie je zlý hyperparameter, ale trénovanie na príliš málo dátach a následný záver, že daný typ policy nefunguje. Ako orientačné pravidlo pre jednu úlohu na stole: okolo 50 epizód vám dá policy s úzkou generalizáciou, ktorá uspeje z počiatočných stavov blízkych tým, ktoré ste predviedli. Okolo 100 až 200 epizód dáva použiteľnú robustnosť naprieč pracovným priestorom pre danú jednu úlohu, za predpokladu, že ste medzi epizódami menili umiestnenie objektov.

Schopnejšie typy policy toto pravidlo nerušia. Doladenie GR00T na 20 epizódach bude stále generalizovať zle; to, čo vám väčšie modely kúpia, je vyšší strop, keď už dáta existujú. Ak máte obmedzený rozpočet, minte ho najprv na viac a rôznorodejšie epizódy, potom na väčší model.

Časté otázky

Ako dlho trvá tréningový beh?

Závisí od typu policy a veľkosti datasetu, takže neexistuje jedno úprimné číslo. ACT je zvyčajne najrýchlejšia zo štyroch, doladenia GR00T najpomalšie. Časová os fáz a grafy loss na stránke behu vám skoro ukážu, či beh napreduje.

Môžem trénovať na zlúčenom datasete?

Áno. Zlúčené datasety sú bežné datasety; validácia pri zlučovaní už zaručila konzistentné fps, funkcie aj typ robota. Zlučovanie záznamov tej istej úlohy je jeden z najúčinnejších spôsobov, ako sa dostať do rozsahu 100 až 200 epizód.

Môj beh GR00T zlyháva pri načítavaní dát. Čo skontrolovať ako prvé?

Verziu formátu datasetu. Doladenie GR00T vyžaduje LeRobot v2.1 a dataset v3.0 zlyhá presne v tomto bode. Skontrolujte verziu v meta/info.json vášho datasetu.

Mal by som pred trénovaním odstrániť neúspešné epizódy?

Väčšinou áno. Epizódy označené Failure učia policy zlyhávajúce správanie. Epizódy Recovery sú niečo iné: ukazujú, ako napraviť chybu, a často sa oplatí ich ponechať.

Musím mať počas trénovania otvorený prehliadač?

Nie. Behy sa vykonávajú na strane servera. Stránka behu zobrazí aktuálny stav, grafy a logy vždy, keď sa vrátite, a checkpointy sa ukladajú bez ohľadu na to, či ich niekto sleduje.