Arbeta med dataset
Varje teleopereringssession på AY-Robots ger strukturerad demonstrationsdata i LeRobot-formatet, det facto-utbytesformatet för manipulationsdata. Den här sidan förklarar vad som finns i ett dataset, hur du inspekterar och kuraterar episoder i instrumentpanelen, hur sammanslagning fungerar och hur marknadsplatsen passar in.
Senast uppdaterad 2026-08-09
LeRobot-datasetformatet
AY-Robots lagrar all demonstrationsdata i LeRobot-datasetformatet som underhålls av Hugging Face. Den praktiska fördelen är portabilitet: ett dataset som spelats in här laddas direkt in i LeRobot-baserad träningskod, och dataset inspelade på annat håll i samma format kan laddas upp och användas på plattformen utan konvertering.
Ett dataset är en samling episoder. En episod är ett komplett försök på en uppgift, från ett definierat starttillstånd till den punkt där du stoppade inspelningen. På disk delas en episod upp i tre typer av filer: en Parquet-fil med de numeriska strömmarna, en videofil per kamera, och metadata som binder allt samman.
| Sökväg | Innehåll |
|---|---|
| data/.../episode_XXXXXX.parquet | En Parquet-fil per episod: bildruta-för-bildruta-tidsstämplar, observationstillstånd och åtgärder |
| videos/... | En MP4 per kamera per episod, bildruteanpassad med Parquet-datat |
| meta/info.json | Metadata på datasetnivå: robottyp, fps, funktionsschemat och antal episoder och bildrutor |
| meta/episodes.jsonl | En rad per episod med dess index, längd och vilken uppgift den tillhör |
| meta/tasks.jsonl | De naturliga språksträngar för uppgifter som episoder refererar till via index |
Funktionsschemat i info.json är det träningskod läser för att förstå ditt data: vilka observationsnycklar som finns, deras former och inspelningshastigheten. Två dataset är bara kompatibla om deras scheman stämmer överens, vilket är exakt vad sammanslagningsvalideringen kontrollerar.
Ledvärden är procent, inte grader
Alla ledvärden i AY-Robots dataset är LeRobot-normaliserade: varje värde sträcker sig från -100 till 100 och representerar en procentandel av den ledens kalibrerade omfång, inte en vinkel i grader. Ett värde på 0 är mitten av det kalibrerade omfånget, -100 och 100 är dess gränser.
Servons nollpunkter skiljer sig mellan fysiska armar, så råa vinklar från två SO-100-enheter beskriver olika positioner. Att normalisera till det kalibrerade omfånget gör inspelningar jämförbara mellan armar och är vad LeRobot-träningspipeliner förväntar sig. Behöver du vinklar för din egen tooling, konvertera med hjälp av din kalibreringsdata; plattformen lagrar inte grader.
Molndataset i instrumentpanelen
Dashboard > Datasets listar dina molndataset med episodantal, filstorlekar och insamlingsstatus. Dataset skapas automatiskt när en teleopereringssession spelar in data, och du kan också skapa ett uttryckligen och fylla det genom att ladda upp inspelningar från desktopklienten.
- Skapa: nya dataset dyker upp från sessioner automatiskt, eller skapa ett tomt och ladda upp till det.
- Byt namn: ändra visningsnamnet när som helst; ändringen rör inte själva datat.
- Radera: tar bort datasetet och alla dess episoder och filer. Radering är permanent, så ladda ner ett arkiv först om du kan tänkas behöva datat igen.
Episodbläddraren
Att öppna ett dataset tar dig till episodbläddraren. Varje episod har en videospelare för sina kameraströmmar och synkroniserade ledgrafer som plottar de normaliserade ledvärdena över episoden. Att skrubba videon flyttar grafmarkören med den, vilket gör det snabbt att upptäcka problem: en ryckig inflygning visar sig som toppar i graferna, ett misslyckat grepp syns i gripdonskanalen innan du ens tittar på videon.
Episodetiketter: Success, Recovery, Failure
Varje episod kan bära en av tre etiketter. Success markerar en ren demonstration av uppgiften. Recovery markerar en episod där något gick fel mitt i försöket och du korrigerade det; de här är värdefulla eftersom de lär en policy hur man kommer på rätt spår igen. Failure markerar episoder som inte nådde målet och bör vanligtvis hållas utanför träningen. Att märka medan du granskar är mycket billigare än att felsöka en policy som tyst lärt sig av dåliga demonstrationer.
Sammanslagning av dataset
Sammanslagning kombinerar flera inspelningar till ett större dataset, till exempel en vecka av sessioner på samma uppgift eller inspelningar från två kalibrerade armar. Sammanslagningen tar flera tar.gz-arkiv, vart och ett innehållande ett LeRobot-dataset, och producerar ett enda dataset med omindexerade episoder.
- 1Förbered arkiven
Varje indata måste vara ett komplett LeRobot-dataset packat som ett tar.gz-arkiv, inklusive dess meta-katalog. Partiella arkiv utan info.json kan inte valideras och avvisas.
- 2Ladda upp flera arkiv
I Dashboard > Datasets startar du en sammanslagning och väljer alla tar.gz-arkiv du vill kombinera i ett steg.
- 3Validering
Plattformen kontrollerar att fps, funktionsschemat och robot_type stämmer överens mellan alla indata. Om något av de tre skiljer sig avvisas sammanslagningen med avvikelsen namngiven, eftersom ett kombinerat dataset med inkonsekventa strömmar tyst skulle korrumpera träningen.
- 4Granska resultatet
Det sammanslagna datasetet dyker upp i din lista med det kombinerade episodantalet. Öppna episodbläddraren och stickprovsgranska några episoder från varje källa innan du tränar på det.
De tre kompatibilitetsreglerna är strikta med flit. Skillnader i bildfrekvens ändrar innebörden av varje tidssteg, schemaavvikelser bryter laddare rakt av, och att blanda robottyper ger ett dataset som ingen enskild policy kan agera på. Behöver du kombinera data från olika armar av samma modell är det inga problem: robot_type syftar på modellen, inte den fysiska enheten.
Marknadsplatsen för dataset
Marknadsplatsen låter dig köpa dataset inspelade av andra och sälja dina egna. Köpta dataset anländer till din instrumentpanel i samma LeRobot-layout som dina egna inspelningar, så de fungerar med episodbläddraren, sammanslagning och träning utan några extra steg.
Säljer du, kuratera innan du listar. Granska episoderna, märk dem ärligt, och se till att uppgiftssträngarna beskriver vad som faktiskt händer i inspelningarna. En köpare som utvärderar ditt dataset ser samma episodbläddrare som du, och dataset med rena etiketter och konsekventa demonstrationer är värda mer än råa dumpar av allt du någonsin spelat in.
Vanliga frågor
Hur stor är en typisk episod?▾
Ungefär 5 till 15 MB för en 10 till 20 sekunder lång episod med två kameror vid 30 fps, beroende på scenens komplexitet. Ett seriöst dataset med några hundra episoder landar i låga ensiffriga gigabyte.
Kan jag ladda ner mina dataset?▾
Ja. Dataset kan laddas ner som arkiv från instrumentpanelen. Eftersom layouten är standard-LeRobot fungerar nedladdningen direkt med LeRobot-tooling och din egen träningskod.
Kan jag slå ihop dataset från olika robottyper?▾
Nej. Sammanslagningen kräver att fps, funktionsschemat och robot_type stämmer överens mellan alla indata. Data från två olika fysiska armar av samma modell kan slås ihop, förutsatt att båda armarna var kalibrerade.
Visar ledgraferna grader?▾
Nej. Alla ledvärden är LeRobot-normaliserade till intervallet -100 till 100, uttryckta som en procentandel av varje leds kalibrerade omfång. Det är också exakt vad som lagras i Parquet-filerna.
Vad händer när jag raderar ett dataset?▾
Datasetet och alla dess episoder, videor och metadata tas bort permanent. Det finns ingen ångra-funktion, så ladda ner ett arkiv först om du inte är säker.
Träna ACT, Diffusion Policy, SmolVLA och GR00T-finjusteringar på dina teleopereringsdataset i molnet, och kör sedan den tränade policyn på din egen arm.
Installera AY-Robots desktopapp på macOS, Windows eller Linux, spela in SO-100-episoder med det guidade flödet, exportera LeRobot-data och använd CLI:t och MCP.