Policy-tréningezés
Az AY-Robots kezelt GPU-kon tréningezi a manipulációs policy-kat, így a rögzített epizódoktól a karján futó policy-ig juthat saját tréninghardver nélkül. Ez az oldal a támogatott policy-típusokat, a tréningfuttatás oldalát, a checkpointokat, és azt tárgyalja, mit érdemes reálisan várni az epizódszámtól.
Utolsó frissítés 2026-08-09
Tréningezés saját GPU nélkül
Egy manipulációs policy tréningezése GPU-terhelés, és a modern vision-language-action modellek több VRAM-ot igényelnek, mint amennyi egy tipikus munkaállomáson van. Az AY-Robotson a tréningezés a platform által kezelt felhő-GPU-kon fut: kiválaszt egy adatkészletet és egy policy-típust, elindítja a futtatást, és a böngészőből követi a folyamatot. Nincs szükség CUDA-beállításra, illesztőprogram-egyeztetésre, sem karbantartandó környezetre.
A bemenet mindig egy felhő-adatkészlet a Dashboard > Datasets alól. Bármi, amit teleoperációs munkameneteken keresztül rögzített vagy LeRobot formátumban feltöltött, felhasználható, beleértve az egyesített adatkészleteket is. Tréningezés előtt kurátorozzon: a Failure címkével ellátott epizódok általában nem valók a tréninghalmazba, és tíz perc áttekintés az epizód-böngészőben GPU-órákat spórol meg, amelyeket különben rossz demonstrációkból való tanulásra fordítana.
Támogatott policy-k
Négy policy-család támogatott. Méretben, tréningköltségben és abban különböznek, mennyit tudnak felszívni az adataiból, ezért a helyes választás inkább a feladatától és az adatkészletétől függ, mint bármilyen általános rangsortól.
| Policy | Típus | Jellemzők |
|---|---|---|
| ACT | Transformer, action chunking | Rövid jövőbeli akcióblokkokat jósol egyetlen lépések helyett. Kompakt, viszonylag gyorsan tréningezhető, és szilárd első választás egyetlen, jól körülhatárolt feladathoz. |
| Diffusion Policy | Diffusion akciósorozatokon | A demonstrált akciók teljes eloszlását modellezi, ami segít, ha a demonstrációi több érvényes módon is megoldják a feladatot. Nehezebb tréningezni, és következtetéskor lassabb, mint az ACT. |
| SmolVLA | Kis vision-language-action modell | Nyelvi feltételes: az epizódjai feladatszövege a bemenet részévé válik. Jó középút, ha nyelvi feltételességet szeretne nagy alapmodell nélkül. |
| GR00T finomhangolás | Alapmodell finomhangolása | Egy nagy, előre betanított robotikai alapmodellt finomhangol az epizódjain. A négy közül a legmagasabb plafon, a legmagasabb tréningköltség mellett, szigorú adatkészlet-formátumkövetelménnyel. |
A GR00T finomhangolás kizárólag LeRobot 2.1 formátumverziójú adatkészleteket fogad el. Egy v3.0 adatkészlet az adatbetöltésnél hibázik meg, nem a beküldésnél, ezért ellenőrizze a formátumverziót, mielőtt elindítaná a futtatást. A platformon rögzített adatkészletek változtatás nélkül használhatók; külső feltöltéseknél előbb ellenőrizze a verziót a meta/info.json fájlban.
Futtatás indítása
- 1Válassza ki az adatkészletet
Nyissa meg a Dashboard > Training menüpontot, és válassza ki azt az adatkészletet, amelyen tréningezni szeretne. Megjelenik az epizódszám és a robottípus, hogy megerősíthesse, a megfelelőt választotta.
- 2Válassza ki a policy-t
Válasszon egyet a támogatott policy-típusok közül. Ha bizonytalan, kezdje az ACT-tel: ez a legolcsóbb módja annak, hogy megtudja, az adatkészlete elég jó-e egyáltalán bármi tréningezéséhez.
- 3Indítás
Indítsa el a futtatást. Kap egy job id-t és egy saját futtatás-oldalt, és bezárhatja a böngészőt: a tréningezés a szerveren folytatódik, és az oldal élő állapotot mutat, bármikor is tér vissza.
A tréningfuttatás oldala
Minden futtatásnak saját oldala van, amely megválaszolja azt a két kérdést, amely tréningezés közben valóban felmerül: tanul-e, és egészséges-e a gép. A tréning előrehaladása a loss, a learning rate ütemterve és a gradiensnorma grafikonjaiként jelenik meg. Egy azonnal platóra érő loss vagy egy felrobbanó gradiensnorma korán jelzi, hogy nem érdemes megvárni ezt a futtatást.
Mellette látható a gép egészségi állapota: a GPU-kihasználtság és -memória, valamint a tréninggép hoszt-metrikái. Egy fázis-idővonal mutatja, hol tart a futtatás, a környezet előkészítésétől az adatbetöltésen és magán a tréningciklusán át a checkpoint feltöltéséig. Ha valami gyanúsnak tűnik, a beépített lognéző SSH-hozzáférés nélkül adja meg a nyers tréninglogokat, ami általában elég annak megállapításához, hogy a hiba az adatkészletében vagy magában a futtatásban van-e.
Checkpointok és folytatás
A checkpointok futtatásonként tárolódnak, nem egy közös poolban, így a futtatás-oldalon felsorolt checkpointok mindig pontosan ahhoz a futtatáshoz és annak konfigurációjához tartoznak. Ez fontosabb, mint amilyennek hangzik: a checkpointok különböző beállítású futtatások közötti keverése a csendben elromlott policy-k klasszikus forrása.
Ha egy futtatás megszakad, folytathatja a legutóbbi checkpointjától, ahelyett hogy elölről kezdené. A köztes checkpointok önmagukban is hasznosak: amikor egy hosszú futtatás a vége felé túltanulni kezd, egy korábbi checkpoint gyakran jobban teljesít a valódi karon, mint a végleges.
A betanított policy futtatása a karján
Egy kész policy közvetlenül visszatelepíthető a robotjára. A cockpitben válassza ki a betanított policy-t a csatlakoztatott karjához, és indítsa el a következtetést: a policy most azokat az ízületi parancsokat állítja elő, amelyeket korábban a teleoperáció adott. A karnak ugyanaz a robottípusnak kell lennie, amelyen az adatkészletet rögzítették, és a jelenetnek hasonlítania kell a tréningjelenetekre, beleértve a kamerák elhelyezését is.
Kezelje az első következtetési futtatásokat kísérletként, ne bemutatóként. Tartsa kéznél a vészleállítást, kezdjen a demonstrációihoz hasonló kiinduló állapotból, és számítson rá, hogy a policy érzékeny lehet olyasmire, amit ön nem is venne észre: egy elmozdult kamerára, más megvilágításra vagy egy olyan tárgyra, amely soha nem szerepelt az adatkészletben.
Hány epizódra van szüksége
A platformon a leggyakoribb tréningezési hiba nem egy rossz hiperparaméter, hanem a túl kevés adaton való tréningezés, amit az a következtetés kísér, hogy a policy-típus nem működik. Egy asztali feladat ökölszabályaként: körülbelül 50 epizód olyan policy-t ad, amely szűk általánosítással a demonstrációihoz közeli kiinduló állapotokból sikeres. Körülbelül 100-200 epizód használható robusztusságot ad a munkatérben ehhez az egy feladathoz, feltéve, hogy változtatta a tárgyak elhelyezését az epizódok között.
A képzettebb policy-típusok nem érvénytelenítik ezt a szabályt. Egy 20 epizódon végzett GR00T finomhangolás továbbra is rosszul fog általánosítani; amit a nagyobb modellek adnak, az egy magasabb plafon, ha egyszer az adat rendelkezésre áll. Ha korlátozott a kerete, előbb fektesse több és változatosabb epizódba, csak azután egy nagyobb modellbe.
Gyakori kérdések
Mennyi ideig tart egy tréningfuttatás?▾
Ez a policy-típustól és az adatkészlet méretétől függ, ezért nincs egyetlen becsületes szám. Az ACT jellemzően a leggyorsabb a négy közül, a GR00T finomhangolások a leglassabbak. A fázis-idővonal és a loss-grafikonok a futtatás-oldalon korán megmutatják, halad-e a futtatás.
Tréningezhetek egyesített adatkészleten?▾
Igen. Az egyesített adatkészletek közönséges adatkészletek; az egyesítési validáció már garantálta a konzisztens fps-t, feature-öket és robottípust. Ugyanannak a feladatnak a felvételeit egyesíteni az egyik leghatékonyabb módja annak, hogy elérje a 100-200 epizódos tartományt.
A GR00T futtatásom hibázik az adatbetöltésnél. Mit ellenőrizzek először?▾
Az adatkészlet formátumverzióját. A GR00T finomhangolás LeRobot v2.1-et igényel, és egy v3.0 adatkészlet pontosan ott hibázik. Ellenőrizze a verziót az adatkészlete meta/info.json fájljában.
El kell távolítanom a sikertelen epizódokat tréningezés előtt?▾
Legtöbbször igen. A Failure címkével ellátott epizódok a sikertelen viselkedést tanítják meg a policy-nak. A Recovery epizódok mások: azt mutatják meg, hogyan lehet egy hibát kijavítani, és gyakran érdemes megtartani őket.
Nyitva kell tartanom a böngészőt tréningezés közben?▾
Nem. A futtatások a szerveren futnak. A futtatás-oldal az aktuális állapotot, grafikonokat és logokat mutatja, bármikor is tér vissza, és a checkpointok mentésre kerülnek attól függetlenül, hogy valaki figyel-e éppen.
Hogyan tárolja az AY-Robots a teleoperációs felvételeket LeRobot formátumban: epizódszerkezet, epizód-böngésző, egyesítés és az adatpiactér.
Minden robotkar, amelyet az AY-Robots támogat, a specifikációikkal: SO-100, Koch v1.1, Franka FR3, FP3, Panda, WidowX-250, ALOHA ViperX-300.