Delo z dataseti

Vsaka seja teleoperacije na AY-Robots ustvari strukturirane demonstracijske podatke v obliki LeRobot, de facto izmenjevalni obliki za podatke o manipulaciji. Ta stran razloži, kaj je znotraj dataseta, kako v nadzorni plošči pregledovati in urejati epizode, kako deluje združevanje in kako se vanj umešča tržnica.

Nazadnje posodobljeno 2026-08-09

Oblika dataseta LeRobot

AY-Robots vse demonstracijske podatke shranjuje v obliki dataseta LeRobot, ki jo vzdržuje Hugging Face. Praktična prednost je prenosljivost: dataset, posnet tukaj, se naloži neposredno v učno kodo, ki temelji na LeRobot, dataseti, posneti drugje v isti obliki, pa se lahko naložijo in uporabijo na platformi brez pretvorbe.

Dataset je zbirka epizod. Ena epizoda je en poln poskus naloge, od določenega začetnega stanja do trenutka, ko ste ustavili snemanje. Na disku je epizoda razdeljena na tri vrste datotek: datoteko Parquet s številskimi tokovi, po eno video datoteko na kamero in metapodatke, ki vse povežejo.

PotVsebina
data/.../episode_XXXXXX.parquetEna datoteka Parquet na epizodo: časovni žigi po sličicah, stanje opazovanja in dejanja
videos/...En MP4 na kamero na epizodo, usklajen s sličicami podatkov Parquet
meta/info.jsonMetapodatki na ravni dataseta: tip robota, fps, shema značilk ter število epizod in sličic
meta/episodes.jsonlEna vrstica na epizodo z njenim indeksom, dolžino in nalogo, ki ji pripada
meta/tasks.jsonlNizi opisov nalog v naravnem jeziku, na katere se epizode sklicujejo po indeksu

Shema značilk v info.json je tisto, kar učna koda prebere, da razume vaše podatke: kateri ključi opazovanja obstajajo, njihove oblike in hitrost snemanja. Dva dataseta sta združljiva le, če se njuni shemi ujemata, kar je natanko to, kar preveri validacija ob združevanju.

Vrednosti sklepov so odstotki, ne stopinje

Vse vrednosti sklepov v datasetih AY-Robots so normalizirane po standardu LeRobot: vsaka vrednost sega od -100 do 100 in predstavlja odstotek umerjenega obsega tega sklepa, ne kota v stopinjah. Odčitek 0 je sredina umerjenega obsega, -100 in 100 pa sta njegovi meji.

Zakaj so normalizirane vrednosti pravilna privzeta izbira

Ničelne točke servomotorjev se med fizičnimi rokami razlikujejo, zato surovi koti dveh enot SO-100 opisujejo različne poze. Normalizacija na umerjeni obseg naredi posnetke primerljive med rokami in je natanko to, kar pričakujejo učni cevovodi LeRobot. Če za lastna orodja potrebujete kote, jih pretvorite s pomočjo lastnih umeritvenih podatkov; platforma stopinj ne shranjuje.

Dataseti v oblaku na nadzorni plošči

Dashboard > Datasets navaja vaše datasete v oblaku s številom epizod, velikostjo datotek in stanjem zbiranja. Dataseti nastanejo samodejno, ko seja teleoperacije posname podatke, lahko pa jih tudi izrecno ustvarite in napolnite z nalaganjem posnetkov iz namiznega odjemalca.

  • Ustvarjanje: novi dataseti se iz sej prikažejo samodejno, ali pa ustvarite praznega in vanj naložite podatke.
  • Preimenovanje: prikazano ime lahko spremenite kadarkoli; sprememba se ne dotakne samih podatkov.
  • Brisanje: odstrani dataset ter vse njegove epizode in datoteke. Brisanje je dokončno, zato najprej prenesite arhiv, če bi podatke morda še potrebovali.

Pregledovalnik epizod

Odpiranje dataseta vas popelje v pregledovalnik epizod. Vsaka epizoda ima predvajalnik videa za svoje tokove kamer in sinhronizirane grafe sklepov, ki skozi epizodo izrišejo normalizirane vrednosti sklepov. Premikanje po videu premakne tudi kazalec na grafu, kar hitro razkrije težave: trzajoč pristop se na grafih pokaže kot konice, spodletel prijem pa je v kanalu prijemala viden še pred ogledom videa.

Oznake epizod: Success, Recovery, Failure

Vsaka epizoda lahko nosi eno od treh oznak. Success označuje čisto demonstracijo naloge. Recovery označuje epizodo, pri kateri je sredi poskusa nekaj šlo narobe, vi pa ste to popravili; te so dragocene, ker policy naučijo, kako se vrniti na pravo pot. Failure označuje epizode, ki niso dosegle cilja, in jih je običajno treba izločiti iz učenja. Označevanje med pregledovanjem je veliko cenejše od odpravljanja napak policyja, ki se je tiho naučil iz slabih demonstracij.

Združevanje datasetov

Združevanje več posnetkov spoji v en večji dataset, na primer teden sej na isti nalogi ali posnetke z dveh umerjenih rok. Združevanje vzame več arhivov tar.gz, od katerih vsak vsebuje dataset LeRobot, in ustvari en sam dataset s ponovno indeksiranimi epizodami.

  1. 1
    Pripravite arhive

    Vsak vhod mora biti popoln dataset LeRobot, zapakiran kot arhiv tar.gz, vključno z mapo meta. Delnih arhivov brez info.json ni mogoče validirati in so zavrnjeni.

  2. 2
    Naložite več arhivov

    V Dashboard > Datasets sprožite združevanje in v enem koraku izberite vse arhive tar.gz, ki jih želite združiti.

  3. 3
    Validacija

    Platforma preveri, ali se fps, shema značilk in robot_type ujemajo pri vseh vhodih. Če se katerakoli od teh treh razlikuje, je združevanje zavrnjeno z navedenim neskladjem, saj bi združen dataset z neskladnimi tokovi tiho pokvaril učenje.

  4. 4
    Preglejte rezultat

    Združen dataset se na vašem seznamu prikaže s skupnim številom epizod. Odprite pregledovalnik epizod in naključno preverite nekaj epizod iz vsakega vira, preden se na njem učite.

Ta tri pravila združljivosti so namerno stroga. Neskladje hitrosti sličic spremeni pomen vsakega časovnega koraka, neskladje sheme povsem podre nalagalnike, mešanje tipov robotov pa ustvari dataset, na katerem noben policy ne more delovati. Če morate združiti podatke z različnih rok istega modela, je to v redu: robot_type se nanaša na model, ne na fizično enoto.

Tržnica datasetov

Tržnica omogoča nakup datasetov, ki so jih posneli drugi, in prodajo lastnih. Kupljeni dataseti pridejo na vašo nadzorno ploščo v isti razporeditvi LeRobot kot vaši lastni posnetki, zato delujejo s pregledovalnikom epizod, združevanjem in učenjem brez dodatnih korakov.

Če prodajate, pred objavo uredite. Preglejte epizode, jih pošteno označite in poskrbite, da nizi nalog opisujejo, kar se v posnetkih dejansko dogaja. Kupec, ki ocenjuje vaš dataset, vidi isti pregledovalnik epizod kot vi, dataseti s čistimi oznakami in doslednimi demonstracijami pa so vredni več kot surovi izpisi vsega, kar ste kdaj posneli.

Pogosta vprašanja

Kako velika je tipična epizoda?

Približno 5 do 15 MB za epizodo dolžine 10 do 20 sekund z dvema kamerama pri 30 fps, odvisno od zapletenosti prizora. Resen dataset z nekaj sto epizodami pristane pri nizkih gigabajtih.

Ali lahko prenesem svoje datasete?

Da. Datasete lahko z nadzorne plošče prenesete kot arhive. Ker je razporeditev standardni LeRobot, prenos deluje neposredno z orodji LeRobot in z vašo lastno učno kodo.

Ali lahko združim datasete različnih tipov robotov?

Ne. Združevanje zahteva, da se fps, shema značilk in robot_type ujemajo pri vseh vhodih. Podatke z dveh različnih fizičnih rok istega modela je mogoče združiti, če sta obe roki umerjeni.

Ali grafi sklepov prikazujejo stopinje?

Ne. Vse vrednosti sklepov so normalizirane po standardu LeRobot na obseg -100 do 100, izražene kot odstotek umerjenega obsega vsakega sklepa. To je tudi natanko to, kar je shranjeno v datotekah Parquet.

Kaj se zgodi, ko izbrišem dataset?

Dataset ter vse njegove epizode, video posnetki in metapodatki so trajno odstranjeni. Razveljavitve ni, zato najprej prenesite arhiv, če niste prepričani.