Práce s datasety
Každá teleoperační session na AY-Robots vytváří strukturovaná demonstrační data ve formátu LeRobot, de facto výměnném formátu pro manipulační data. Tato stránka vysvětluje, co je uvnitř datasetu, jak epizody v dashboardu prohlížet a kurátorovat, jak funguje slučování a jakou roli hraje tržiště.
Naposledy aktualizováno 2026-08-09
Formát datasetu LeRobot
AY-Robots ukládá všechna demonstrační data ve formátu datasetu LeRobot, který spravuje Hugging Face. Praktickou výhodou je přenositelnost: dataset zaznamenaný zde se rovnou nahraje do trénovacího kódu založeného na LeRobot a datasety zaznamenané jinde ve stejném formátu lze bez konverze nahrát a použít na platformě.
Dataset je sbírka epizod. Jedna epizoda je jeden úplný pokus o úkol, od definovaného výchozího stavu až po bod, kde jste nahrávání zastavili. Na disku se epizoda rozděluje do tří druhů souborů: soubor Parquet s číselnými streamy, jeden video soubor na kameru a metadata, která vše propojují.
| Cesta | Obsah |
|---|---|
| data/.../episode_XXXXXX.parquet | Jeden soubor Parquet na epizodu: časové značky, stav pozorování a akce snímek po snímku |
| videos/... | Jedno MP4 na kameru a epizodu, zarovnané snímek po snímku s daty Parquet |
| meta/info.json | Metadata na úrovni datasetu: typ robota, fps, schéma funkcí a počty epizod a snímků |
| meta/episodes.jsonl | Jeden řádek na epizodu s jejím indexem, délkou a úkolem, ke kterému patří |
| meta/tasks.jsonl | Texty úkolů v přirozeném jazyce, na které se epizody odkazují podle indexu |
Schéma funkcí v info.json je to, co trénovací kód čte, aby pochopil vaše data: jaké klíče pozorování existují, jejich tvary a rychlost nahrávání. Dva datasety jsou kompatibilní jen tehdy, pokud se jejich schémata shodují, a přesně to kontroluje validace při slučování.
Hodnoty kloubů jsou procenta, ne stupně
Všechny hodnoty kloubů v datasetech AY-Robots jsou normalizované podle LeRobot: každá hodnota se pohybuje od -100 do 100 a představuje procento kalibrovaného rozsahu daného kloubu, ne úhel ve stupních. Hodnota 0 je střed kalibrovaného rozsahu, -100 a 100 jsou jeho hranice.
Nulové body serv se mezi fyzickými rameny liší, takže syrové úhly ze dvou jednotek SO-100 popisují jiné pózy. Normalizace na kalibrovaný rozsah dělá záznamy srovnatelné napříč rameny a je to přesně to, co očekávají trénovací pipeline LeRobot. Pokud potřebujete úhly pro vlastní nástroje, přepočtěte je pomocí vlastních kalibračních dat; stupně platforma neukládá.
Cloudové datasety v dashboardu
Dashboard > Datasets uvádí vaše cloudové datasety s počtem epizod, velikostmi souborů a stavem sběru. Datasety vznikají automaticky, když teleoperační session zaznamená data, a můžete vytvořit i jeden explicitně a naplnit ho nahráváním záznamů z desktopového klienta.
- Vytvoření: nové datasety vznikají ze session automaticky, nebo vytvořte prázdný a nahrajte do něj.
- Přejmenování: zobrazovaný název lze kdykoli změnit; samotná data se tím nedotknou.
- Smazání: odstraní dataset a všechny jeho epizody a soubory. Smazání je nevratné, takže si nejdřív stáhněte archiv, kdyby se vám data mohla ještě hodit.
Prohlížeč epizod
Otevření datasetu vás zavede do prohlížeče epizod. Každá epizoda má video přehrávač pro své kamerové streamy a synchronizované grafy kloubů, které vykreslují normalizované hodnoty kloubů v průběhu epizody. Posouváním ve videu se s ním pohybuje i kurzor v grafu, díky čemuž rychle odhalíte problémy: trhaný přístup se v grafech projeví jako výkyvy, nepovedený úchop je vidět v kanálu chapadla ještě dřív, než se podíváte na video.
Štítky epizod: Success, Recovery, Failure
Každá epizoda může nést jeden ze tří štítků. Success označuje čistou demonstraci úkolu. Recovery označuje epizodu, ve které se uprostřed pokusu něco pokazilo a vy jste to opravili; takové epizody jsou cenné, protože policy učí, jak se vrátit zpátky na správnou cestu. Failure označuje epizody, které cíle nedosáhly a obvykle by měly zůstat mimo trénování. Označit štítek při prohlížení je mnohem levnější než ladit policy, která se potichu naučila ze špatných demonstrací.
Slučování datasetů
Slučování spojí několik záznamů do jednoho většího datasetu, například týden session na stejném úkolu nebo záznamy ze dvou kalibrovaných ramen. Sloučení přijme více archivů tar.gz, každý s jedním datasetem LeRobot, a vytvoří jeden dataset s nově indexovanými epizodami.
- 1Připravte archivy
Každý vstup musí být úplný dataset LeRobot zabalený jako archiv tar.gz, včetně adresáře meta. Neúplné archivy bez info.json nelze validovat a jsou odmítnuty.
- 2Nahrajte více archivů
V Dashboard > Datasets spusťte sloučení a v jednom kroku vyberte všechny archivy tar.gz, které chcete zkombinovat.
- 3Validace
Platforma zkontroluje, zda se fps, schéma funkcí a robot_type shodují napříč všemi vstupy. Pokud se některý ze tří liší, je sloučení odmítnuto s uvedením neshody, protože kombinovaný dataset s nekonzistentními streamy by trénování potichu poškodil.
- 4Zkontrolujte výsledek
Sloučený dataset se objeví ve vašem seznamu s kombinovaným počtem epizod. Otevřete prohlížeč epizod a namátkově zkontrolujte pár epizod z každého zdroje, než na něm začnete trénovat.
Tato tři pravidla kompatibility jsou přísná záměrně. Neshoda snímkové frekvence mění význam každého časového kroku, neshoda schématu rovnou rozbíjí loadery a míchání typů robotů vytváří dataset, se kterým žádná jednotlivá policy neumí pracovat. Kombinovat data z různých ramen stejného modelu je naopak v pořádku: robot_type odkazuje na model, ne na fyzický kus.
Tržiště datasetů
Na tržišti si můžete koupit datasety zaznamenané ostatními a prodat vlastní. Zakoupené datasety se ve vašem dashboardu objeví ve stejném uspořádání LeRobot jako vaše vlastní záznamy, takže fungují s prohlížečem epizod, slučováním i trénováním bez dalších kroků.
Pokud prodáváte, před nabídnutím dataset kurátorujte. Projděte epizody, štítkujte poctivě a ujistěte se, že texty úkolů popisují, co se v záznamech skutečně děje. Kupující, který váš dataset hodnotí, vidí stejný prohlížeč epizod jako vy, a datasety s čistými štítky a konzistentními demonstracemi mají větší hodnotu než surové haldy všeho, co jste kdy zaznamenali.
Časté dotazy
Jak velká je typická epizoda?▾
Zhruba 5 až 15 MB pro epizodu dlouhou 10 až 20 sekund se dvěma kamerami při 30 fps, podle složitosti scény. Solidní dataset s několika stovkami epizod se pohybuje v jednotkách gigabajtů.
Můžu si stáhnout své datasety?▾
Ano. Datasety lze stáhnout jako archivy z dashboardu. Protože uspořádání je standardní LeRobot, stažení funguje přímo s nástroji LeRobot i vaším vlastním trénovacím kódem.
Můžu sloučit datasety z různých typů robotů?▾
Ne. Sloučení vyžaduje, aby se fps, schéma funkcí a robot_type shodovaly napříč všemi vstupy. Data ze dvou různých fyzických ramen stejného modelu sloučit lze, pokud byla obě ramena kalibrovaná.
Ukazují grafy kloubů stupně?▾
Ne. Všechny hodnoty kloubů jsou normalizované podle LeRobot na rozsah -100 až 100, vyjádřené jako procento kalibrovaného rozsahu každého kloubu. Přesně to je uložené i v souborech Parquet.
Co se stane, když dataset smažu?▾
Dataset a všechny jeho epizody, videa a metadata jsou trvale odstraněny. Neexistuje žádné vrácení zpět, takže si nejdřív stáhněte archiv, pokud si nejste jistí.
Trénujte ACT, Diffusion Policy, SmolVLA a fine-tuny GR00T na svých teleoperačních datasetech v cloudu a poté natrénovanou policy spusťte na vlastním rameni.
Nainstalujte desktopovou aplikaci AY-Robots pro macOS, Windows nebo Linux, nahrávejte epizody SO-100 vedeným postupem a exportujte data do LeRobot.