ከ Dataset ዎች ጋር መስራት

በ AY-Robots ላይ ያለ እያንዳንዱ የቴሌኦፕሬሽን ክፍለ ጊዜ ለ manipulation ዳታ de facto exchange ቅርጸት በሆነው LeRobot ቅርጸት የተዋቀረ የማሳያ ዳታ ያመርታል። ይህ ገጽ በ dataset ውስጥ ያለውን ነገር፣ episode ዎችን በ dashboard ውስጥ እንዴት እንደሚመረምሩና እንደሚያደራጁ፣ ውህደት እንዴት እንደሚሰራ፣ ገበያውም እንዴት እንደሚገጣጠም ያብራራል።

መጨረሻ የተዘመነው 2026-08-09

የ LeRobot dataset ቅርጸት

AY-Robots በ Hugging Face የተያዘውን የ LeRobot dataset ቅርጸት ተጠቅሞ የማሳያ ዳታ ሁሉንም ያከማቻል። ተግባራዊ ጥቅሙ ተንቀሳቃሽነት ነው: እዚህ የተቀረጸ dataset በቀጥታ ወደ LeRobot-ላይ-የተመሰረተ የስልጠና ኮድ ይጫናል፣ በሌላ ቦታ በተመሳሳይ ቅርጸት የተቀረጹ dataset ዎችም ያለ conversion ወደ መድረኩ ተስቅለው ሊጠቀሙ ይችላሉ።

Dataset የ episode ዎች ስብስብ ነው። አንድ episode ከተወሰነ መነሻ ሁኔታ እስከ መቅረጽ ካቆሙበት ነጥብ ድረስ አንድ ሙሉ የስራ ሙከራ ነው። በዲስክ ላይ፣ episode በሦስት ዓይነት ፋይሎች ይከፈላል: የቁጥር streams ያለው Parquet ፋይል፣ ለእያንዳንዱ ካሜራ አንድ የቪዲዮ ፋይል፣ ሁሉንም የሚያገናኝ metadata።

መንገድይዘት
data/.../episode_XXXXXX.parquetለእያንዳንዱ episode አንድ Parquet ፋይል: frame-በ-frame የጊዜ ማህተሞች፣ የ observation ሁኔታ፣ ድርጊቶች
videos/...ለእያንዳንዱ episode ለእያንዳንዱ ካሜራ አንድ MP4፣ ከ Parquet ዳታ ጋር frame-የተስተካከለ
meta/info.jsonየ dataset-ደረጃ metadata: የሮቦት ዓይነት፣ fps፣ የ feature schema፣ የ episode እና frame ብዛት
meta/episodes.jsonlለእያንዳንዱ episode index ው፣ ርዝመቱ፣ የሚገባበት ስራም ያለው አንድ መስመር
meta/tasks.jsonlEpisode ዎች በ index የሚያመለክቷቸው በተፈጥሮ-ቋንቋ የተጻፉ የስራ string ዎች

በ info.json ውስጥ ያለው feature schema የስልጠና ኮድ ዳታዎን ለመረዳት የሚያነበው ነው: የትኞቹ observation key ዎች እንዳሉ፣ ቅርጻቸው፣ የቀረጻ ተመኑም። ሁለት dataset ዎች የሚስማሙት schema ዎቻቸው ከተመሳሰሉ ብቻ ነው፣ ይህ በትክክል የውህደት validation የሚያረጋግጠው ነው።

የመገጣጠሚያ እሴቶች መቶኛ ናቸው፣ ዲግሪ አይደሉም

በ AY-Robots dataset ዎች ውስጥ ያሉት ሁሉም የመገጣጠሚያ እሴቶች LeRobot-normalized ናቸው: እያንዳንዱ እሴት ከ -100 እስከ 100 ይደርሳል እናም የዚያን መገጣጠሚያ የተስተካከለ ክልል መቶኛ ይወክላል፣ በዲግሪ ያለ አንግል አይደለም። የ 0 ንባብ የተስተካከለው ክልል መሃል ነው፣ -100 እና 100 ደግሞ ወሰኖቹ ናቸው።

Normalized እሴቶች ትክክለኛ ነባሪ የሆኑበት ምክንያት

የ servo ዜሮ ነጥቦች በአካላዊ እጆች መካከል ይለያያሉ፣ ስለዚህ ከሁለት SO-100 ክፍሎች የመጡ ጥሬ አንግሎች የተለያዩ አቀማመጦችን ይገልጻሉ። ወደ ተስተካከለው ክልል Normalize ማድረግ ቀረጻዎችን በእጆች መካከል ሊነጻጸሩ የሚችሉ ያደርጋል፣ LeRobot የስልጠና pipeline ዎችም የሚጠብቁት ይህንኑ ነው። ለራስዎ መሳሪያ አንግሎች ካስፈለጉ፣ በ calibration ዳታዎ በመጠቀም ይለውጡ፤ መድረኩ ዲግሪዎችን አያከማችም።

በ dashboard ውስጥ ያሉ Cloud dataset ዎች

Dashboard > Datasets የ episode ብዛት፣ የፋይል መጠን፣ የስብስብ ሁኔታን ጨምሮ cloud dataset ዎችዎን ይዘረዝራል። Dataset ዎች የቴሌኦፕሬሽን ክፍለ ጊዜ ዳታ ሲመዘግብ በራስ-ሰር ይፈጠራሉ፣ በግልጽም አንድ መፍጠርና ከ desktop client ቀረጻዎችን በመስቀል መሙላት ይችላሉ።

  • ይፍጠሩ: አዲስ dataset ዎች ከክፍለ ጊዜዎች በራስ-ሰር ይታያሉ፣ ወይም ባዶ አንድ ይፍጠሩ ወደ ውስጡም ይስቀሉ።
  • ስም ይቀይሩ: በማንኛውም ጊዜ የማሳያ ስሙን ይቀይሩ፤ ለውጡ ራሱን ዳታውን አይነካውም።
  • ይሰርዙ: dataset ውንና ሁሉንም episode ዎቹንና ፋይሎቹን ያስወግዳል። መሰረዝ ቋሚ ነው፣ ስለዚህ ዳታውን እንደገና ሊፈልጉት ከቻሉ መጀመሪያ archive ያውርዱ።

Episode browser

Dataset መክፈት ወደ episode browser ይወስድዎታል። እያንዳንዱ episode ለ camera streams ው video player እና በ episode ው ላይ normalized የመገጣጠሚያ እሴቶችን የሚያሳይ synchronized የመገጣጠሚያ ገበታዎች አሉት። ቪዲዮውን መርመር የ chart cursor ንም አብሮ ያንቀሳቅሳል፣ ይህም ችግሮችን ለማየት ፈጣን ያደርገዋል: ያልተስተካከለ አቀራረብ በገበታዎቹ ውስጥ እንደ spike ይታያል፣ ያልተሳካ grasp ቪዲዮውን ከመመልከትዎ በፊት እንኳ በ gripper channel ውስጥ ይታያል።

የ episode labels: Success, Recovery, Failure

እያንዳንዱ episode ከሦስቱ labels አንዱን ሊይዝ ይችላል። Success የስራውን ንጹህ ማሳያ ያመለክታል። Recovery በሙከራ መካከል የሆነ ነገር ተሳስቶ እርስዎ ያስተካከሉበትን episode ያመለክታል፤ እነዚህ ዋጋ ያላቸው ናቸው ምክንያቱም policy እንዴት ወደ ትክክለኛ መንገድ እንደሚመለስ ስለሚያስተምሩ። Failure ግቡን ያልደረሱ episode ዎችን ያመለክታል እናም በተለምዶ ከስልጠና ውጭ መቀመጥ አለበት። ሲገመግሙ label ማድረግ ከዳታ በጸጥታ የተማረ policy ን ከማስተካከል በጣም ርካሽ ነው።

Dataset ዎችን ማዋሃድ

ውህደት ብዙ ቀረጻዎችን ወደ አንድ ትልቅ dataset ያዋህዳል፣ ለምሳሌ በተመሳሳይ ስራ ላይ የአንድ ሳምንት ክፍለ ጊዜዎች ወይም ከሁለት calibrated እጆች የተገኙ ቀረጻዎች። ውህደቱ እያንዳንዱ የ LeRobot dataset ያለውን ብዙ tar.gz archive ዎችን ይወስዳል፣ ዳግም-index የተደረጉ episode ዎች ያሉት አንድ dataset ም ያመርታል።

  1. 1
    Archive ዎችን ያዘጋጁ

    እያንዳንዱ ግቤት meta directory ውን ጨምሮ እንደ tar.gz archive የተጠቀለለ ሙሉ LeRobot dataset መሆን አለበት። ያለ info.json ያሉ ያልተጠናቀቁ archive ዎች ሊረጋገጡ አይችሉም እናም ውድቅ ይደረጋሉ።

  2. 2
    ብዙ archive ዎችን ይስቀሉ

    በ Dashboard > Datasets ውስጥ ውህደት ይጀምሩ በአንድ ደረጃም ሊያዋህዷቸው የሚፈልጓቸውን ሁሉንም tar.gz archive ዎች ይምረጡ።

  3. 3
    Validation

    መድረኩ fps፣ የ feature schema፣ robot_type በሁሉም ግቤቶች መካከል የሚስማሙ መሆናቸውን ይመረምራል። ከሦስቱ ማንኛውም ቢለያይ፣ ውህደቱ ልዩነቱ ተጠቅሶ ውድቅ ይደረጋል፣ ምክንያቱም ያልተስተካከሉ streams ያለው የተዋሃደ dataset ስልጠናን በጸጥታ ያበላሻል።

  4. 4
    ውጤቱን ይገምግሙ

    የተዋሃደው dataset በዝርዝርዎ ውስጥ ከተዋሃደው የ episode ብዛት ጋር ይታያል። Episode browser ን ይክፈቱ ከእያንዳንዱ ምንጭ ጥቂት episode ዎችን በእሱ ላይ ከማሰልጠንዎ በፊት ይመርምሩ።

ሦስቱ የተኳኋኝነት ደንቦች ሆን ተብለው ጥብቅ ናቸው። የ frame rate ልዩነቶች የእያንዳንዱን timestep ትርጉም ይለውጣሉ፣ የ schema ልዩነቶች loaders ን ፈጽሞ ይሰብራሉ፣ የሮቦት ዓይነቶችን መቀላቀልም ማንም policy ሊጠቀምበት የማይችል dataset ያመርታል። ከተመሳሳይ ሞዴል ከተለያዩ እጆች ዳታ ማዋሃድ ካስፈለገዎት፣ ችግር የለውም: robot_type የሚያመለክተው ሞዴሉን ነው፣ አካላዊውን ክፍል አይደለም።

የ dataset ገበያ

ገበያው በሌሎች የተቀረጹ dataset ዎችን እንዲገዙ የራስዎንም እንዲሸጡ ያስችልዎታል። የተገዙ dataset ዎች እንደ ራስዎ ቀረጻዎች በተመሳሳይ LeRobot layout ውስጥ ወደ dashboard ዎ ይደርሳሉ፣ ስለዚህ ያለ ተጨማሪ ደረጃዎች ከ episode browser፣ ውህደት፣ ስልጠናም ጋር ይሰራሉ።

የሚሸጡ ከሆነ፣ ከመዘርዘርዎ በፊት ያደራጁ። Episode ዎችን ይመርምሩ፣ በታማኝነት label ያድርጓቸው፣ የስራ string ዎቹ በቀረጻዎቹ ውስጥ በእውነት የሚከሰተውን መግለጻቸውን ያረጋግጡ። Dataset ዎን የሚገመግም ገዢ ተመሳሳዩን episode browser ያያል፣ ንጹህ labels እና ወጥ ማሳያዎች ያላቸው dataset ዎችም ከቀረጹት ነገር ሁሉ ግማጭ ማራገፍ ይልቅ በጣም ዋጋ ያላቸው ናቸው።

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

ተለምዷዊ episode ምን ያህል ትልቅ ነው?

እንደ ትዕይንት ውስብስብነት፣ ለ 10 እስከ 20 ሰከንድ episode በሁለት ካሜራዎች በ 30 fps በግምት 5 እስከ 15 MB። በጥቂት መቶ episode ዎች ያለ ከባድ dataset በዝቅተኛ gigabyte ውስጥ ያርፋል።

Dataset ዎቼን ማውረድ እችላለሁ?

አዎ። Dataset ዎች ከ dashboard እንደ archive ማውረድ ይችላሉ። Layout ው መደበኛ LeRobot ስለሆነ፣ ማውረዱ በቀጥታ ከ LeRobot መሳሪያዎችና ከራስዎ የስልጠና ኮድ ጋር ይሰራል።

ከተለያዩ የሮቦት ዓይነቶች dataset ዎችን ማዋሃድ እችላለሁ?

አይደለም። ውህደቱ fps፣ የ feature schema፣ robot_type በሁሉም ግቤቶች መካከል መስማማት ይጠይቃል። Calibrated ከሆኑ፣ ከተመሳሳይ ሞዴል ከሁለት የተለያዩ አካላዊ እጆች ዳታ ሊዋሃድ ይችላል።

የመገጣጠሚያ ገበታዎቹ ዲግሪ ያሳያሉ?

አይደለም። ሁሉም የመገጣጠሚያ እሴቶች LeRobot-normalized ሆነው ወደ -100 እስከ 100 ክልል፣ የእያንዳንዱ መገጣጠሚያ የተስተካከለ ክልል መቶኛ ሆነው ተገልጸዋል። በ Parquet ፋይሎች ውስጥ የተከማቸውም በትክክል ይህ ነው።

Dataset ስሰርዝ ምን ይሆናል?

Dataset ውና ሁሉም episode ዎቹ፣ ቪዲዮዎቹ፣ metadata ው ቋሚ ሆነው ይወገዳሉ። Undo የለም፣ ስለዚህ እርግጠኛ ካልሆኑ መጀመሪያ archive ያውርዱ።