ከ Dataset ዎች ጋር መስራት
በ AY-Robots ላይ ያለ እያንዳንዱ የቴሌኦፕሬሽን ክፍለ ጊዜ ለ manipulation ዳታ de facto exchange ቅርጸት በሆነው LeRobot ቅርጸት የተዋቀረ የማሳያ ዳታ ያመርታል። ይህ ገጽ በ dataset ውስጥ ያለውን ነገር፣ episode ዎችን በ dashboard ውስጥ እንዴት እንደሚመረምሩና እንደሚያደራጁ፣ ውህደት እንዴት እንደሚሰራ፣ ገበያውም እንዴት እንደሚገጣጠም ያብራራል።
መጨረሻ የተዘመነው 2026-08-09
የ LeRobot dataset ቅርጸት
AY-Robots በ Hugging Face የተያዘውን የ LeRobot dataset ቅርጸት ተጠቅሞ የማሳያ ዳታ ሁሉንም ያከማቻል። ተግባራዊ ጥቅሙ ተንቀሳቃሽነት ነው: እዚህ የተቀረጸ dataset በቀጥታ ወደ LeRobot-ላይ-የተመሰረተ የስልጠና ኮድ ይጫናል፣ በሌላ ቦታ በተመሳሳይ ቅርጸት የተቀረጹ dataset ዎችም ያለ conversion ወደ መድረኩ ተስቅለው ሊጠቀሙ ይችላሉ።
Dataset የ episode ዎች ስብስብ ነው። አንድ episode ከተወሰነ መነሻ ሁኔታ እስከ መቅረጽ ካቆሙበት ነጥብ ድረስ አንድ ሙሉ የስራ ሙከራ ነው። በዲስክ ላይ፣ episode በሦስት ዓይነት ፋይሎች ይከፈላል: የቁጥር streams ያለው Parquet ፋይል፣ ለእያንዳንዱ ካሜራ አንድ የቪዲዮ ፋይል፣ ሁሉንም የሚያገናኝ metadata።
| መንገድ | ይዘት |
|---|---|
| data/.../episode_XXXXXX.parquet | ለእያንዳንዱ episode አንድ Parquet ፋይል: frame-በ-frame የጊዜ ማህተሞች፣ የ observation ሁኔታ፣ ድርጊቶች |
| videos/... | ለእያንዳንዱ episode ለእያንዳንዱ ካሜራ አንድ MP4፣ ከ Parquet ዳታ ጋር frame-የተስተካከለ |
| meta/info.json | የ dataset-ደረጃ metadata: የሮቦት ዓይነት፣ fps፣ የ feature schema፣ የ episode እና frame ብዛት |
| meta/episodes.jsonl | ለእያንዳንዱ episode index ው፣ ርዝመቱ፣ የሚገባበት ስራም ያለው አንድ መስመር |
| meta/tasks.jsonl | Episode ዎች በ index የሚያመለክቷቸው በተፈጥሮ-ቋንቋ የተጻፉ የስራ string ዎች |
በ info.json ውስጥ ያለው feature schema የስልጠና ኮድ ዳታዎን ለመረዳት የሚያነበው ነው: የትኞቹ observation key ዎች እንዳሉ፣ ቅርጻቸው፣ የቀረጻ ተመኑም። ሁለት dataset ዎች የሚስማሙት schema ዎቻቸው ከተመሳሰሉ ብቻ ነው፣ ይህ በትክክል የውህደት validation የሚያረጋግጠው ነው።
የመገጣጠሚያ እሴቶች መቶኛ ናቸው፣ ዲግሪ አይደሉም
በ AY-Robots dataset ዎች ውስጥ ያሉት ሁሉም የመገጣጠሚያ እሴቶች LeRobot-normalized ናቸው: እያንዳንዱ እሴት ከ -100 እስከ 100 ይደርሳል እናም የዚያን መገጣጠሚያ የተስተካከለ ክልል መቶኛ ይወክላል፣ በዲግሪ ያለ አንግል አይደለም። የ 0 ንባብ የተስተካከለው ክልል መሃል ነው፣ -100 እና 100 ደግሞ ወሰኖቹ ናቸው።
የ servo ዜሮ ነጥቦች በአካላዊ እጆች መካከል ይለያያሉ፣ ስለዚህ ከሁለት SO-100 ክፍሎች የመጡ ጥሬ አንግሎች የተለያዩ አቀማመጦችን ይገልጻሉ። ወደ ተስተካከለው ክልል Normalize ማድረግ ቀረጻዎችን በእጆች መካከል ሊነጻጸሩ የሚችሉ ያደርጋል፣ LeRobot የስልጠና pipeline ዎችም የሚጠብቁት ይህንኑ ነው። ለራስዎ መሳሪያ አንግሎች ካስፈለጉ፣ በ calibration ዳታዎ በመጠቀም ይለውጡ፤ መድረኩ ዲግሪዎችን አያከማችም።
በ dashboard ውስጥ ያሉ Cloud dataset ዎች
Dashboard > Datasets የ episode ብዛት፣ የፋይል መጠን፣ የስብስብ ሁኔታን ጨምሮ cloud dataset ዎችዎን ይዘረዝራል። Dataset ዎች የቴሌኦፕሬሽን ክፍለ ጊዜ ዳታ ሲመዘግብ በራስ-ሰር ይፈጠራሉ፣ በግልጽም አንድ መፍጠርና ከ desktop client ቀረጻዎችን በመስቀል መሙላት ይችላሉ።
- ይፍጠሩ: አዲስ dataset ዎች ከክፍለ ጊዜዎች በራስ-ሰር ይታያሉ፣ ወይም ባዶ አንድ ይፍጠሩ ወደ ውስጡም ይስቀሉ።
- ስም ይቀይሩ: በማንኛውም ጊዜ የማሳያ ስሙን ይቀይሩ፤ ለውጡ ራሱን ዳታውን አይነካውም።
- ይሰርዙ: dataset ውንና ሁሉንም episode ዎቹንና ፋይሎቹን ያስወግዳል። መሰረዝ ቋሚ ነው፣ ስለዚህ ዳታውን እንደገና ሊፈልጉት ከቻሉ መጀመሪያ archive ያውርዱ።
Episode browser
Dataset መክፈት ወደ episode browser ይወስድዎታል። እያንዳንዱ episode ለ camera streams ው video player እና በ episode ው ላይ normalized የመገጣጠሚያ እሴቶችን የሚያሳይ synchronized የመገጣጠሚያ ገበታዎች አሉት። ቪዲዮውን መርመር የ chart cursor ንም አብሮ ያንቀሳቅሳል፣ ይህም ችግሮችን ለማየት ፈጣን ያደርገዋል: ያልተስተካከለ አቀራረብ በገበታዎቹ ውስጥ እንደ spike ይታያል፣ ያልተሳካ grasp ቪዲዮውን ከመመልከትዎ በፊት እንኳ በ gripper channel ውስጥ ይታያል።
የ episode labels: Success, Recovery, Failure
እያንዳንዱ episode ከሦስቱ labels አንዱን ሊይዝ ይችላል። Success የስራውን ንጹህ ማሳያ ያመለክታል። Recovery በሙከራ መካከል የሆነ ነገር ተሳስቶ እርስዎ ያስተካከሉበትን episode ያመለክታል፤ እነዚህ ዋጋ ያላቸው ናቸው ምክንያቱም policy እንዴት ወደ ትክክለኛ መንገድ እንደሚመለስ ስለሚያስተምሩ። Failure ግቡን ያልደረሱ episode ዎችን ያመለክታል እናም በተለምዶ ከስልጠና ውጭ መቀመጥ አለበት። ሲገመግሙ label ማድረግ ከዳታ በጸጥታ የተማረ policy ን ከማስተካከል በጣም ርካሽ ነው።
Dataset ዎችን ማዋሃድ
ውህደት ብዙ ቀረጻዎችን ወደ አንድ ትልቅ dataset ያዋህዳል፣ ለምሳሌ በተመሳሳይ ስራ ላይ የአንድ ሳምንት ክፍለ ጊዜዎች ወይም ከሁለት calibrated እጆች የተገኙ ቀረጻዎች። ውህደቱ እያንዳንዱ የ LeRobot dataset ያለውን ብዙ tar.gz archive ዎችን ይወስዳል፣ ዳግም-index የተደረጉ episode ዎች ያሉት አንድ dataset ም ያመርታል።
- 1Archive ዎችን ያዘጋጁ
እያንዳንዱ ግቤት meta directory ውን ጨምሮ እንደ tar.gz archive የተጠቀለለ ሙሉ LeRobot dataset መሆን አለበት። ያለ info.json ያሉ ያልተጠናቀቁ archive ዎች ሊረጋገጡ አይችሉም እናም ውድቅ ይደረጋሉ።
- 2ብዙ archive ዎችን ይስቀሉ
በ Dashboard > Datasets ውስጥ ውህደት ይጀምሩ በአንድ ደረጃም ሊያዋህዷቸው የሚፈልጓቸውን ሁሉንም tar.gz archive ዎች ይምረጡ።
- 3Validation
መድረኩ fps፣ የ feature schema፣ robot_type በሁሉም ግቤቶች መካከል የሚስማሙ መሆናቸውን ይመረምራል። ከሦስቱ ማንኛውም ቢለያይ፣ ውህደቱ ልዩነቱ ተጠቅሶ ውድቅ ይደረጋል፣ ምክንያቱም ያልተስተካከሉ streams ያለው የተዋሃደ dataset ስልጠናን በጸጥታ ያበላሻል።
- 4ውጤቱን ይገምግሙ
የተዋሃደው dataset በዝርዝርዎ ውስጥ ከተዋሃደው የ episode ብዛት ጋር ይታያል። Episode browser ን ይክፈቱ ከእያንዳንዱ ምንጭ ጥቂት episode ዎችን በእሱ ላይ ከማሰልጠንዎ በፊት ይመርምሩ።
ሦስቱ የተኳኋኝነት ደንቦች ሆን ተብለው ጥብቅ ናቸው። የ frame rate ልዩነቶች የእያንዳንዱን timestep ትርጉም ይለውጣሉ፣ የ schema ልዩነቶች loaders ን ፈጽሞ ይሰብራሉ፣ የሮቦት ዓይነቶችን መቀላቀልም ማንም policy ሊጠቀምበት የማይችል dataset ያመርታል። ከተመሳሳይ ሞዴል ከተለያዩ እጆች ዳታ ማዋሃድ ካስፈለገዎት፣ ችግር የለውም: robot_type የሚያመለክተው ሞዴሉን ነው፣ አካላዊውን ክፍል አይደለም።
የ dataset ገበያ
ገበያው በሌሎች የተቀረጹ dataset ዎችን እንዲገዙ የራስዎንም እንዲሸጡ ያስችልዎታል። የተገዙ dataset ዎች እንደ ራስዎ ቀረጻዎች በተመሳሳይ LeRobot layout ውስጥ ወደ dashboard ዎ ይደርሳሉ፣ ስለዚህ ያለ ተጨማሪ ደረጃዎች ከ episode browser፣ ውህደት፣ ስልጠናም ጋር ይሰራሉ።
የሚሸጡ ከሆነ፣ ከመዘርዘርዎ በፊት ያደራጁ። Episode ዎችን ይመርምሩ፣ በታማኝነት label ያድርጓቸው፣ የስራ string ዎቹ በቀረጻዎቹ ውስጥ በእውነት የሚከሰተውን መግለጻቸውን ያረጋግጡ። Dataset ዎን የሚገመግም ገዢ ተመሳሳዩን episode browser ያያል፣ ንጹህ labels እና ወጥ ማሳያዎች ያላቸው dataset ዎችም ከቀረጹት ነገር ሁሉ ግማጭ ማራገፍ ይልቅ በጣም ዋጋ ያላቸው ናቸው።
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
ተለምዷዊ episode ምን ያህል ትልቅ ነው?▾
እንደ ትዕይንት ውስብስብነት፣ ለ 10 እስከ 20 ሰከንድ episode በሁለት ካሜራዎች በ 30 fps በግምት 5 እስከ 15 MB። በጥቂት መቶ episode ዎች ያለ ከባድ dataset በዝቅተኛ gigabyte ውስጥ ያርፋል።
Dataset ዎቼን ማውረድ እችላለሁ?▾
አዎ። Dataset ዎች ከ dashboard እንደ archive ማውረድ ይችላሉ። Layout ው መደበኛ LeRobot ስለሆነ፣ ማውረዱ በቀጥታ ከ LeRobot መሳሪያዎችና ከራስዎ የስልጠና ኮድ ጋር ይሰራል።
ከተለያዩ የሮቦት ዓይነቶች dataset ዎችን ማዋሃድ እችላለሁ?▾
አይደለም። ውህደቱ fps፣ የ feature schema፣ robot_type በሁሉም ግቤቶች መካከል መስማማት ይጠይቃል። Calibrated ከሆኑ፣ ከተመሳሳይ ሞዴል ከሁለት የተለያዩ አካላዊ እጆች ዳታ ሊዋሃድ ይችላል።
የመገጣጠሚያ ገበታዎቹ ዲግሪ ያሳያሉ?▾
አይደለም። ሁሉም የመገጣጠሚያ እሴቶች LeRobot-normalized ሆነው ወደ -100 እስከ 100 ክልል፣ የእያንዳንዱ መገጣጠሚያ የተስተካከለ ክልል መቶኛ ሆነው ተገልጸዋል። በ Parquet ፋይሎች ውስጥ የተከማቸውም በትክክል ይህ ነው።
Dataset ስሰርዝ ምን ይሆናል?▾
Dataset ውና ሁሉም episode ዎቹ፣ ቪዲዮዎቹ፣ metadata ው ቋሚ ሆነው ይወገዳሉ። Undo የለም፣ ስለዚህ እርግጠኛ ካልሆኑ መጀመሪያ archive ያውርዱ።
ACT፣ Diffusion Policy፣ SmolVLA፣ GR00T fine-tune ዎችን በ cloud ውስጥ በቴሌኦፕሬሽን dataset ዎችዎ ላይ ያሰልጥኑ፣ ከዚያም የሰለጠነውን policy በራስዎ እጅ ላይ ያሂዱ።
የ AY-Robots desktop ፕሮግራምን በ macOS፣ Windows፣ ወይም Linux ላይ ይጫኑ፣ የ SO-100 episode ዎችን በቅደም ተከተል ይቅረጹ፣ የ LeRobot ዳታ export ያድርጉ፣ CLI እና MCP ንም ይጠቀሙ።