Praca z datasetami

Każda sesja teleoperacji na AY-Robots produkuje ustrukturyzowane dane demonstracyjne w formacie LeRobot, faktycznym standardowym formacie wymiany dla danych manipulacyjnych. Ta strona wyjaśnia, co znajduje się w datasecie, jak przeglądać i porządkować epizody w panelu, jak działa łączenie i jak wpisuje się w to marketplace.

Ostatnia aktualizacja 2026-08-09

Format datasetu LeRobot

AY-Robots przechowuje wszystkie dane demonstracyjne w formacie datasetu LeRobot, utrzymywanym przez Hugging Face. Praktyczną korzyścią jest przenośność: dataset nagrany tutaj wczytuje się bezpośrednio do kodu treningowego opartego na LeRobot, a datasety nagrane gdzie indziej w tym samym formacie można przesłać i wykorzystać na platformie bez konwersji.

Dataset to zbiór epizodów. Jeden epizod to jedna kompletna próba wykonania zadania, od zdefiniowanego stanu początkowego do momentu, w którym zatrzymano nagrywanie. Na dysku epizod jest podzielony na trzy rodzaje plików: plik Parquet ze strumieniami liczbowymi, jeden plik wideo na kamerę oraz metadane, które łączą to wszystko w całość.

ŚcieżkaZawartość
data/.../episode_XXXXXX.parquetJeden plik Parquet na epizod: znaczniki czasu klatka po klatce, stan obserwacji i akcje
videos/...Jeden MP4 na kamerę na epizod, wyrównany klatka po klatce z danymi Parquet
meta/info.jsonMetadane na poziomie datasetu: typ robota, fps, schemat cech oraz liczby epizodów i klatek
meta/episodes.jsonlJedna linia na epizod z jego indeksem, długością i zadaniem, do którego należy
meta/tasks.jsonlOpisy zadań w języku naturalnym, do których epizody odnoszą się przez indeks

Schemat cech w info.json to to, co kod treningowy odczytuje, by zrozumieć Twoje dane: jakie klucze obserwacji istnieją, ich kształty i częstotliwość nagrywania. Dwa datasety są kompatybilne tylko wtedy, gdy ich schematy się zgadzają, i dokładnie to sprawdza walidacja łączenia.

Wartości przegubów to procenty, nie stopnie

Wszystkie wartości przegubów w datasetach AY-Robots są znormalizowane według LeRobot: każda wartość mieści się w zakresie od -100 do 100 i reprezentuje procent skalibrowanego zakresu danego przegubu, a nie kąt w stopniach. Odczyt 0 to środek skalibrowanego zakresu, -100 i 100 to jego granice.

Dlaczego znormalizowane wartości są właściwym domyślnym wyborem

Punkty zerowe serw różnią się między fizycznymi ramionami, więc surowe kąty z dwóch egzemplarzy SO-100 opisują różne pozy. Normalizacja do skalibrowanego zakresu sprawia, że nagrania są porównywalne między ramionami, i jest tym, czego oczekują pipeline'y treningowe LeRobot. Jeśli potrzebujesz kątów do własnych narzędzi, przelicz je, korzystając z danych kalibracji; platforma nie przechowuje stopni.

Datasety w chmurze w panelu

Dashboard > Datasets wyświetla Twoje datasety w chmurze z liczbą epizodów, rozmiarami plików i statusem zbierania. Datasety powstają automatycznie, gdy sesja teleoperacji nagrywa dane, a możesz też utworzyć jeden jawnie i wypełnić go, przesyłając nagrania z desktop clienta.

  • Tworzenie: nowe datasety pojawiają się automatycznie z sesji, albo utwórz pusty i prześlij do niego dane.
  • Zmiana nazwy: zmień nazwę wyświetlaną w dowolnym momencie; zmiana nie dotyka samych danych.
  • Usuwanie: usuwa dataset oraz wszystkie jego epizody i pliki. Usunięcie jest trwałe, więc jeśli dane mogą się jeszcze przydać, najpierw pobierz archiwum.

Przeglądarka epizodów

Otwarcie datasetu przenosi Cię do przeglądarki epizodów. Każdy epizod ma odtwarzacz wideo dla swoich strumieni kamer oraz zsynchronizowane wykresy przegubów, które nanoszą znormalizowane wartości przegubów na oś czasu epizodu. Przewijanie wideo przesuwa kursor na wykresie razem z nim, co pozwala szybko wychwytywać problemy: szarpane podejście widać jako skoki na wykresach, nieudany chwyt jest widoczny w kanale chwytaka, jeszcze zanim obejrzysz wideo.

Etykiety epizodów: Success, Recovery, Failure

Każdy epizod może nosić jedną z trzech etykiet. Success oznacza czystą demonstrację zadania. Recovery oznacza epizod, w którym coś poszło nie tak w trakcie próby i zostało skorygowane; są cenne, ponieważ uczą policy, jak wrócić na właściwy kurs. Failure oznacza epizody, które nie osiągnęły celu i zwykle powinny zostać poza treningiem. Etykietowanie w trakcie przeglądu jest dużo tańsze niż debugowanie policy, która po cichu nauczyła się ze złych demonstracji.

Łączenie datasetów

Łączenie scala kilka nagrań w jeden większy dataset, na przykład tydzień sesji na tym samym zadaniu albo nagrania z dwóch skalibrowanych ramion. Łączenie przyjmuje wiele archiwów tar.gz, każde zawierające dataset LeRobot, i produkuje jeden dataset z epizodami ponownie zindeksowanymi.

  1. 1
    Przygotuj archiwa

    Każde wejście musi być kompletnym datasetem LeRobot spakowanym jako archiwum tar.gz, wraz z katalogiem meta. Częściowe archiwa bez info.json nie mogą zostać zwalidowane i są odrzucane.

  2. 2
    Prześlij wiele archiwów

    W Dashboard > Datasets rozpocznij łączenie i wybierz wszystkie archiwa tar.gz, które chcesz połączyć w jednym kroku.

  3. 3
    Walidacja

    Platforma sprawdza, czy fps, schemat cech i robot_type zgadzają się we wszystkich wejściach. Jeśli którekolwiek z trzech się różni, łączenie jest odrzucane z podaną niezgodnością, ponieważ połączony dataset z niespójnymi strumieniami po cichu zepsułby trening.

  4. 4
    Przejrzyj wynik

    Połączony dataset pojawia się na Twojej liście z łączną liczbą epizodów. Otwórz przeglądarkę epizodów i wyrywkowo sprawdź kilka epizodów z każdego źródła, zanim zaczniesz na nim trenować.

Trzy zasady kompatybilności są celowo restrykcyjne. Niezgodności częstotliwości klatek zmieniają znaczenie każdego kroku czasowego, niezgodności schematów całkowicie psują loadery, a mieszanie typów robotów tworzy dataset, na którym żadna policy nie może działać. Jeśli musisz połączyć dane z różnych ramion tego samego modelu, to w porządku: robot_type odnosi się do modelu, nie do fizycznego egzemplarza.

Marketplace datasetów

Marketplace pozwala kupować datasety nagrane przez innych i sprzedawać własne. Kupione datasety trafiają do Twojego panelu w tym samym układzie LeRobot co Twoje własne nagrania, więc działają z przeglądarką epizodów, łączeniem i treningiem bez dodatkowych kroków.

Jeśli sprzedajesz, uporządkuj dane przed wystawieniem. Przejrzyj epizody, oznacz je uczciwie i upewnij się, że opisy zadań opisują to, co faktycznie dzieje się w nagraniach. Kupujący oceniający Twój dataset widzi tę samą przeglądarkę epizodów co Ty, a datasety z czystymi etykietami i spójnymi demonstracjami są warte więcej niż surowe zrzuty wszystkiego, co kiedykolwiek nagrałeś.

Najczęściej zadawane pytania

Jak duży jest typowy epizod?

Mniej więcej 5 do 15 MB dla epizodu trwającego 10 do 20 sekund z dwiema kamerami przy 30 fps, w zależności od złożoności sceny. Poważny dataset z kilkoma setkami epizodów mieści się w niewielkich gigabajtach.

Czy mogę pobrać swoje datasety?

Tak. Datasety można pobrać jako archiwa z panelu. Ponieważ układ jest standardowym LeRobot, pobrane dane działają bezpośrednio z narzędziami LeRobot i Twoim własnym kodem treningowym.

Czy mogę łączyć datasety różnych typów robotów?

Nie. Łączenie wymaga, aby fps, schemat cech i robot_type zgadzały się we wszystkich wejściach. Dane z dwóch różnych fizycznych ramion tego samego modelu można łączyć, pod warunkiem że oba ramiona były skalibrowane.

Czy wykresy przegubów pokazują stopnie?

Nie. Wszystkie wartości przegubów są znormalizowane według LeRobot do zakresu -100 do 100, wyrażone jako procent skalibrowanego zakresu każdego przegubu. To także dokładnie to, co jest przechowywane w plikach Parquet.

Co się dzieje, gdy usuwam dataset?

Dataset oraz wszystkie jego epizody, filmy i metadane zostają trwale usunięte. Nie ma cofnięcia, więc jeśli nie masz pewności, najpierw pobierz archiwum.