Policy-tréningezés

Az AY-Robots kezelt GPU-kon tréningezi a manipulációs policy-kat, így a rögzített epizódoktól a karján futó policy-ig juthat saját tréninghardver nélkül. Ez az oldal a támogatott policy-típusokat, a tréningfuttatás oldalát, a checkpointokat, és azt tárgyalja, mit érdemes reálisan várni az epizódszámtól.

Utolsó frissítés 2026-08-09

Tréningezés saját GPU nélkül

Egy manipulációs policy tréningezése GPU-terhelés, és a modern vision-language-action modellek több VRAM-ot igényelnek, mint amennyi egy tipikus munkaállomáson van. Az AY-Robotson a tréningezés a platform által kezelt felhő-GPU-kon fut: kiválaszt egy adatkészletet és egy policy-típust, elindítja a futtatást, és a böngészőből követi a folyamatot. Nincs szükség CUDA-beállításra, illesztőprogram-egyeztetésre, sem karbantartandó környezetre.

A bemenet mindig egy felhő-adatkészlet a Dashboard > Datasets alól. Bármi, amit teleoperációs munkameneteken keresztül rögzített vagy LeRobot formátumban feltöltött, felhasználható, beleértve az egyesített adatkészleteket is. Tréningezés előtt kurátorozzon: a Failure címkével ellátott epizódok általában nem valók a tréninghalmazba, és tíz perc áttekintés az epizód-böngészőben GPU-órákat spórol meg, amelyeket különben rossz demonstrációkból való tanulásra fordítana.

Támogatott policy-k

Négy policy-család támogatott. Méretben, tréningköltségben és abban különböznek, mennyit tudnak felszívni az adataiból, ezért a helyes választás inkább a feladatától és az adatkészletétől függ, mint bármilyen általános rangsortól.

PolicyTípusJellemzők
ACTTransformer, action chunkingRövid jövőbeli akcióblokkokat jósol egyetlen lépések helyett. Kompakt, viszonylag gyorsan tréningezhető, és szilárd első választás egyetlen, jól körülhatárolt feladathoz.
Diffusion PolicyDiffusion akciósorozatokonA demonstrált akciók teljes eloszlását modellezi, ami segít, ha a demonstrációi több érvényes módon is megoldják a feladatot. Nehezebb tréningezni, és következtetéskor lassabb, mint az ACT.
SmolVLAKis vision-language-action modellNyelvi feltételes: az epizódjai feladatszövege a bemenet részévé válik. Jó középút, ha nyelvi feltételességet szeretne nagy alapmodell nélkül.
GR00T finomhangolásAlapmodell finomhangolásaEgy nagy, előre betanított robotikai alapmodellt finomhangol az epizódjain. A négy közül a legmagasabb plafon, a legmagasabb tréningköltség mellett, szigorú adatkészlet-formátumkövetelménnyel.
A GR00T LeRobot v2.1 adatkészleteket igényel

A GR00T finomhangolás kizárólag LeRobot 2.1 formátumverziójú adatkészleteket fogad el. Egy v3.0 adatkészlet az adatbetöltésnél hibázik meg, nem a beküldésnél, ezért ellenőrizze a formátumverziót, mielőtt elindítaná a futtatást. A platformon rögzített adatkészletek változtatás nélkül használhatók; külső feltöltéseknél előbb ellenőrizze a verziót a meta/info.json fájlban.

Futtatás indítása

  1. 1
    Válassza ki az adatkészletet

    Nyissa meg a Dashboard > Training menüpontot, és válassza ki azt az adatkészletet, amelyen tréningezni szeretne. Megjelenik az epizódszám és a robottípus, hogy megerősíthesse, a megfelelőt választotta.

  2. 2
    Válassza ki a policy-t

    Válasszon egyet a támogatott policy-típusok közül. Ha bizonytalan, kezdje az ACT-tel: ez a legolcsóbb módja annak, hogy megtudja, az adatkészlete elég jó-e egyáltalán bármi tréningezéséhez.

  3. 3
    Indítás

    Indítsa el a futtatást. Kap egy job id-t és egy saját futtatás-oldalt, és bezárhatja a böngészőt: a tréningezés a szerveren folytatódik, és az oldal élő állapotot mutat, bármikor is tér vissza.

A tréningfuttatás oldala

Minden futtatásnak saját oldala van, amely megválaszolja azt a két kérdést, amely tréningezés közben valóban felmerül: tanul-e, és egészséges-e a gép. A tréning előrehaladása a loss, a learning rate ütemterve és a gradiensnorma grafikonjaiként jelenik meg. Egy azonnal platóra érő loss vagy egy felrobbanó gradiensnorma korán jelzi, hogy nem érdemes megvárni ezt a futtatást.

Mellette látható a gép egészségi állapota: a GPU-kihasználtság és -memória, valamint a tréninggép hoszt-metrikái. Egy fázis-idővonal mutatja, hol tart a futtatás, a környezet előkészítésétől az adatbetöltésen és magán a tréningciklusán át a checkpoint feltöltéséig. Ha valami gyanúsnak tűnik, a beépített lognéző SSH-hozzáférés nélkül adja meg a nyers tréninglogokat, ami általában elég annak megállapításához, hogy a hiba az adatkészletében vagy magában a futtatásban van-e.

Checkpointok és folytatás

A checkpointok futtatásonként tárolódnak, nem egy közös poolban, így a futtatás-oldalon felsorolt checkpointok mindig pontosan ahhoz a futtatáshoz és annak konfigurációjához tartoznak. Ez fontosabb, mint amilyennek hangzik: a checkpointok különböző beállítású futtatások közötti keverése a csendben elromlott policy-k klasszikus forrása.

Ha egy futtatás megszakad, folytathatja a legutóbbi checkpointjától, ahelyett hogy elölről kezdené. A köztes checkpointok önmagukban is hasznosak: amikor egy hosszú futtatás a vége felé túltanulni kezd, egy korábbi checkpoint gyakran jobban teljesít a valódi karon, mint a végleges.

A betanított policy futtatása a karján

Egy kész policy közvetlenül visszatelepíthető a robotjára. A cockpitben válassza ki a betanított policy-t a csatlakoztatott karjához, és indítsa el a következtetést: a policy most azokat az ízületi parancsokat állítja elő, amelyeket korábban a teleoperáció adott. A karnak ugyanaz a robottípusnak kell lennie, amelyen az adatkészletet rögzítették, és a jelenetnek hasonlítania kell a tréningjelenetekre, beleértve a kamerák elhelyezését is.

Kezelje az első következtetési futtatásokat kísérletként, ne bemutatóként. Tartsa kéznél a vészleállítást, kezdjen a demonstrációihoz hasonló kiinduló állapotból, és számítson rá, hogy a policy érzékeny lehet olyasmire, amit ön nem is venne észre: egy elmozdult kamerára, más megvilágításra vagy egy olyan tárgyra, amely soha nem szerepelt az adatkészletben.

Hány epizódra van szüksége

A platformon a leggyakoribb tréningezési hiba nem egy rossz hiperparaméter, hanem a túl kevés adaton való tréningezés, amit az a következtetés kísér, hogy a policy-típus nem működik. Egy asztali feladat ökölszabályaként: körülbelül 50 epizód olyan policy-t ad, amely szűk általánosítással a demonstrációihoz közeli kiinduló állapotokból sikeres. Körülbelül 100-200 epizód használható robusztusságot ad a munkatérben ehhez az egy feladathoz, feltéve, hogy változtatta a tárgyak elhelyezését az epizódok között.

A képzettebb policy-típusok nem érvénytelenítik ezt a szabályt. Egy 20 epizódon végzett GR00T finomhangolás továbbra is rosszul fog általánosítani; amit a nagyobb modellek adnak, az egy magasabb plafon, ha egyszer az adat rendelkezésre áll. Ha korlátozott a kerete, előbb fektesse több és változatosabb epizódba, csak azután egy nagyobb modellbe.

Gyakori kérdések

Mennyi ideig tart egy tréningfuttatás?

Ez a policy-típustól és az adatkészlet méretétől függ, ezért nincs egyetlen becsületes szám. Az ACT jellemzően a leggyorsabb a négy közül, a GR00T finomhangolások a leglassabbak. A fázis-idővonal és a loss-grafikonok a futtatás-oldalon korán megmutatják, halad-e a futtatás.

Tréningezhetek egyesített adatkészleten?

Igen. Az egyesített adatkészletek közönséges adatkészletek; az egyesítési validáció már garantálta a konzisztens fps-t, feature-öket és robottípust. Ugyanannak a feladatnak a felvételeit egyesíteni az egyik leghatékonyabb módja annak, hogy elérje a 100-200 epizódos tartományt.

A GR00T futtatásom hibázik az adatbetöltésnél. Mit ellenőrizzek először?

Az adatkészlet formátumverzióját. A GR00T finomhangolás LeRobot v2.1-et igényel, és egy v3.0 adatkészlet pontosan ott hibázik. Ellenőrizze a verziót az adatkészlete meta/info.json fájljában.

El kell távolítanom a sikertelen epizódokat tréningezés előtt?

Legtöbbször igen. A Failure címkével ellátott epizódok a sikertelen viselkedést tanítják meg a policy-nak. A Recovery epizódok mások: azt mutatják meg, hogyan lehet egy hibát kijavítani, és gyakran érdemes megtartani őket.

Nyitva kell tartanom a böngészőt tréningezés közben?

Nem. A futtatások a szerveren futnak. A futtatás-oldal az aktuális állapotot, grafikonokat és logokat mutatja, bármikor is tér vissza, és a checkpointok mentésre kerülnek attól függetlenül, hogy valaki figyel-e éppen.