Trénování policy
AY-Robots trénuje manipulační policy na spravovaných GPU, takže se od nahraných epizod dostanete k policy běžící na vašem rameni bez vlastního trénovacího hardwaru. Tato stránka pokrývá podporované typy policy, stránku trénovacího běhu, checkpointy a co reálně očekávat od výsledků při daném počtu epizod.
Naposledy aktualizováno 2026-08-09
Trénování bez vlastní GPU
Trénování manipulační policy je GPU zátěž a moderní vision-language-action modely potřebují víc VRAM, než má typická pracovní stanice. Na AY-Robots běží trénování na cloudových GPU spravovaných platformou: vyberete dataset a typ policy, spustíte běh a sledujete jeho průběh z prohlížeče. Není potřeba nastavovat CUDA, párovat ovladače ani udržovat žádné prostředí.
Vstupem je vždy cloudový dataset z Dashboard > Datasets. Použitelné je vše, co jste zaznamenali přes teleoperační session nebo nahráli ve formátu LeRobot, včetně sloučených datasetů. Před trénováním kurátorujte: epizody se štítkem Failure obvykle do trénovací sady nepatří a deset minut prohlížení v prohlížeči epizod ušetří hodiny času GPU stráveného učením ze špatných demonstrací.
Podporované policy
Podporují se čtyři rodiny policy. Liší se velikostí, náklady na trénování a tím, kolik toho dokážou z vašich dat vstřebat, takže správná volba závisí spíš na vašem úkolu a datasetu než na jakémkoli obecném žebříčku.
| Policy | Druh | Vlastnosti |
|---|---|---|
| ACT | Transformer, action chunking | Předpovídá krátké bloky budoucích akcí místo jednotlivých kroků. Kompaktní, trénuje se poměrně rychle a je solidní první volbou pro jeden jasně vymezený úkol. |
| Diffusion Policy | Diffusion nad sekvencemi akcí | Modeluje celé rozdělení demonstrovaných akcí, což pomáhá, když vaše demonstrace řeší úkol víc než jedním platným způsobem. Náročnější na trénování a při inferenci pomalejší než ACT. |
| SmolVLA | Malý vision-language-action model | Jazykově podmíněný: text úkolu z vašich epizod se stává součástí vstupu. Dobrý střed mezi tím chtít jazykovou podmíněnost bez velkého foundation modelu. |
| Fine-tune GR00T | Fine-tune foundation modelu | Fine-tunuje velký předtrénovaný foundation model pro robotiku na vašich epizodách. Nejvyšší strop ze čtyř, za nejvyšší cenu trénování a s přísným požadavkem na formát datasetu. |
Fine-tuning GR00T přijímá výhradně datasety ve formátové verzi LeRobot 2.1. Dataset ve verzi v3.0 selže až při načítání dat, ne při odeslání, takže verzi formátu zkontrolujte ještě před spuštěním běhu. Datasety zaznamenané na platformě lze použít tak, jak jsou; u externích nahrávek nejdřív ověřte verzi v meta/info.json.
Spuštění běhu
- 1Vyberte dataset
Otevřete Dashboard > Training a vyberte dataset, na kterém se má trénovat. Zobrazí se počet epizod a typ robota, abyste si potvrdili, že jste vybrali ten správný.
- 2Zvolte policy
Vyberte jeden z podporovaných typů policy. Pokud si nejste jistí, začněte s ACT: je to nejlevnější způsob, jak zjistit, zda je váš dataset vůbec dost dobrý na to, aby na něm šlo cokoli natrénovat.
- 3Spusťte
Spusťte běh. Dostane job id a vlastní stránku běhu a prohlížeč můžete zavřít: trénování pokračuje na serveru a stránka ukáže živý stav, kdykoli se vrátíte.
Stránka trénovacího běhu
Každý běh má vlastní stránku, která odpovídá na dvě otázky, které vás během trénování skutečně zajímají: učí se to, a je stroj v pořádku. Postup učení se zobrazuje jako grafy loss, plánu learning rate a normy gradientu. Loss, která hned stagnuje, nebo norma gradientu, která exploduje, vám brzy napoví, že na tento běh nemá cenu čekat.
Vedle toho je vidět stav stroje: vytížení a paměť GPU plus metriky hostitelského stroje trénování. Časová osa fází ukazuje, kde se běh zrovna nachází, od přípravy prostředí přes načítání dat, samotnou trénovací smyčku až po nahrání checkpointu. Když něco vypadá podezřele, vestavěný prohlížeč logů dá surové trénovací logy bez jakéhokoli přístupu přes SSH, což obvykle stačí k tomu, aby bylo jasné, zda je problém ve vašem datasetu, nebo v samotném běhu.
Checkpointy a pokračování
Checkpointy se ukládají za jednotlivé běhy, ne do sdíleného poolu, takže checkpointy uvedené na stránce běhu vždy patří přesně k tomuto běhu a jeho konfiguraci. To je důležitější, než to zní: míchání checkpointů mezi běhy s různým nastavením je klasický zdroj potichu rozbitých policy.
Je-li běh přerušen, můžete pokračovat od jeho posledního checkpointu, místo abyste začínali znovu od začátku. Mezilehlé checkpointy jsou užitečné i samy o sobě: když se dlouhý běh ke konci začne přeučovat, dřívější checkpoint na skutečném rameni často funguje lépe než finální.
Spuštění natrénované policy na vašem rameni
Hotovou policy lze nasadit rovnou zpátky na vašeho robota. V kokpitu vyberte natrénovanou policy pro vaše připojené rameno a spusťte inferenci: policy teď vytváří příkazy pro klouby, které dřív vznikaly vaší teleoperací. Rameno musí být stejný typ robota, na kterém byl dataset zaznamenaný, a scéna by se měla podobat trénovacím scénám, včetně umístění kamer.
První běhy inference berte jako experimenty, ne jako předvádění. Mějte nouzové zastavení na dosah, začínejte z výchozího stavu blízkého tomu, co jste demonstrovali, a počítejte s tím, že policy může být citlivá na věci, kterých byste si sami nevšimli: posunutá kamera, jiné osvětlení nebo předmět, který se v datasetu nikdy nevyskytoval.
Kolik epizod potřebujete
Nejčastější chybou v trénování na platformě není špatný hyperparametr, ale trénování na příliš málo datech a následný závěr, že daný typ policy nefunguje. Jako orientační pravidlo pro jeden úkol na stole: kolem 50 epizod dá policy s úzkou generalizací, která uspěje z výchozích stavů blízkých vašim demonstracím. Kolem 100 až 200 epizod dá použitelnou robustnost v celém pracovním prostoru pro tento jeden úkol, za předpokladu, že jste mezi epizodami měnili umístění předmětů.
Schopnější typy policy toto pravidlo neruší. Fine-tune GR00T na 20 epizodách bude pořád generalizovat špatně; co vám větší modely koupí, je vyšší strop, jakmile jsou data k dispozici. Pokud máte omezený rozpočet, dejte ho nejdřív do víc a rozmanitějších epizod, teprve pak do většího modelu.
Časté dotazy
Jak dlouho trvá trénovací běh?▾
Záleží na typu policy a velikosti datasetu, takže poctivé jedno číslo neexistuje. ACT je typicky nejrychlejší ze čtyř, fine-tuny GR00T nejpomalejší. Časová osa fází a grafy loss na stránce běhu brzy ukážou, jestli běh postupuje.
Můžu trénovat na sloučeném datasetu?▾
Ano. Sloučené datasety jsou obyčejné datasety; validace při slučování už zaručila konzistentní fps, funkce i typ robota. Sloučení záznamů stejného úkolu je jeden z nejúčinnějších způsobů, jak se dostat do rozsahu 100 až 200 epizod.
Můj běh GR00T selhává při načítání dat. Co zkontrolovat nejdřív?▾
Verzi formátu datasetu. Fine-tuning GR00T vyžaduje LeRobot v2.1 a dataset ve verzi v3.0 selže přesně na tomto místě. Zkontrolujte verzi v meta/info.json svého datasetu.
Mám před trénováním odstranit neúspěšné epizody?▾
Většinou ano. Epizody se štítkem Failure učí policy neúspěšné chování. Epizody Recovery jsou jiná věc: ukazují, jak chybu napravit, a často se vyplatí je ponechat.
Musím mít během trénování otevřený prohlížeč?▾
Ne. Běhy se vykonávají na serveru. Stránka běhu ukáže aktuální stav, grafy a logy, kdykoli se vrátíte, a checkpointy se ukládají bez ohledu na to, zda se někdo dívá.
Jak AY-Robots ukládá teleoperační záznamy ve formátu LeRobot: struktura epizod, prohlížeč epizod v dashboardu, slučování nahrávek a tržiště.
Všechna robotická ramena podporovaná na AY-Robots s jejich specifikacemi: SO-100, Koch v1.1, Franka FR3, FP3 a Panda, WidowX-250 a ALOHA ViperX-300.