
DROID፣ BridgeData V2 እና Open X-Embodiment በ6 እና 7-DoF ክንዶች ላይ ወደ 7-D end-effector ድርጊቶች ይቀየራሉ። አንድ SO-100 6 የመገጣጠሚያ ቦታዎችን ይወስዳል። ምን ይተላለፋል፣ ምን አይተላለፍም፣ በምትኩ ምን ማድረግ እንዳለበት።
አጭር እትም
- •የሶስቱም የLeRobot ግንባታዎች አንድ አይነት ስምምነት ይጋራሉ፡ 7-D end-effector action [x, y, z, roll, pitch, yaw, gripper] እና 8-D state ከፓድ ማስገቢያ ጋር። አንድ SO-100 ስድስት ፍፁም የጋራ ቦታዎችን ይወስዳል።
- •ያ 7-D ቬክተር የኮንቨርተሩ ውጤት ነው፡ የDROID የራሱ RLDS action field 6 የጋራ ፍጥነቶች እና የ gripper አቀማመጥ ሲሆን፣ የካርቴዥያን እይታ በ action_dict ውስጥ ይገኛል።
- •አራት ሰዓቶች፡ DROID 15 fps፣ BridgeData V2 5 fps፣ የ google_robot slice 3 fps፣ አንድ SO-100 በ 30 fps እየቀረጸ።
- •ከራስዎ ዳታ ጋር ማዋሃድ አይችሉም። validate_all_metadata በ fps፣ robot_type ወይም features ውስጥ ልዩነት ሲያገኝ ስህተት ያሳያል፣ እና ሦስቱም ይለያያሉ።
- •የሚተላለፈው ቅድመ-ስልጠና የተደረገባቸው ክብደቶች እንጂ ክፍሎች አይደሉም። ክፍት ምንጭ ዳታ ከ pi0 ቅድመ-ስልጠና ድብልቅ 9.1 በመቶ ነው።
- •በጣም ርካሹ ትክክለኛ አጠቃቀማቸው የሙከራ መሳሪያ ነው፡ ቅዳሜና እሁድ ከመቅረጽዎ በፊት የእርስዎን ፓይፕላይን የሚያረጋግጥ የታወቀ-ጥሩ 2 GB፣ 100-episode DROID ናሙና።
በGoogle Cloud bucket ላይ አንድ ሚሊዮን-ትራጀክተሪ የህዝብ ዳታ ስብስብ አለ እና SO-100 በጠረጴዛው ላይ በ110 እስከ 150 EUR ክፍሎች ያስወጣ SO-100 አለ። የመጀመሪያው ሁለተኛውን ማስተማር የማይችለው ለምንድን ነው? በከፊል ይችላል፣ ነገር ግን አብዛኛው ሽግግር ሰዎች በሚጠብቁት ቦታ አይከሰትም፣ እና በጣም ቀላል የሚመስለው ክፍል በጭራሽ አይሰራም።
የሚከተለው፡ በውስጥ ያለው ምንድን ነው DROID፣ BridgeData V2 እና Open X-Embodiment፣ እያንዳንዳቸው ከዝቅተኛ ወጪ 5-DoF ክንድ ጋር የሚጋጩበት፣ እና በምትኩ ምን ማድረግ እንዳለብን። ከታች ያለው እያንዳንዱ ቁጥር የመጣው ከወረቀቱ፣ ከዳታ ስብስብ ካርዱ ወይም ከሚመለከተው ምንጭ ፋይል ነው።
ሦስቱ የዳታ ስብስቦች በትክክል የያዙት ነገር
| DROID | BridgeData V2 | Open X-Embodiment | |
|---|---|---|---|
| ሮቦት | Franka Panda, 7 DoF, Robotiq 2F-85 | WidowX 250, 6 DoF, ~4,000 USD rig | 22 አካላት, 60 የውሂብ ስብስቦች, 34 ላቦራቶሪዎች |
| መጠን | 76ሺህ ትራጀክተሪዎች, 350 ሰዓታት | 60,096 ትራጀክተሪዎች | 1M+ ትራጀክተሪዎች, 527 ክህሎቶች |
| ብዝሃነት | 564 ትዕይንቶች, 84 ተግባራት, 50 ሰብሳቢዎች | 24 አካባቢዎች, 13 ክህሎቶች | 160,266 ተግባራት, 21 ተቋማት |
| ቅንብር | ሁሉም በቴሌኦፕሬትድ | 50,365 በቴሌኦፕሬትድ, 9,731 በስክሪፕት የተሰሩ | በእያንዳንዱ ምንጭ ላብራቶሪ |
| የቁጥጥር ፍጥነት | 15 Hz | 5 Hz | ይለያያል, 3 fps እና ከዚያ በላይ |
| ካሜራዎች | 2 x ZED 2 ውጫዊ, 1 x ZED Mini የእጅ አንጓ | እስከ 4, አብዛኛዎቹ ክፍሎች ቋሚውን ብቻ | ላብራቶሪው የተጠቀመው ማንኛውም |
| ጥሬ ማውረድ | 1.7 TB RLDS, 8.7 TB ጥሬ ስቴሪዮ | JPEG ማህደሮች | በእያንዳንዱ የውሂብ ስብስብ TFDS ባልዲዎች |
ጥቂት ሰዎች አሁንም 1.7 TB የ RLDS TFRecords ያወርዳሉ። የማህበረሰብ ድርጅት IPEC-COMMUNITY አብዛኛውን የ Open X-Embodiment በ LeRobot dataset ቅርጸት በ AV1 ቪዲዮ፣ DROID 392 GB የሚይዝበት። የምትሰሩበት ስሪት ይህ ነው፣ እና የእሱ meta/info.json መጀመሪያ ማንበብ ያለብዎት ነው።
DROID
ከሶስቱ በጣም ደረጃውን የጠበቀ። በሁሉም ቦታ አንድ ሪግ: Franka Panda ከ Robotiq 2F-85 ግሪፐር ጋር፣ ሁለት የሚስተካከሉ ZED 2 ስቴሪዮ ካሜራዎች እና የእጅ አንጓ ZED Mini፣ በ Meta Quest 2 መቆጣጠሪያዎች በቴሌኦፕሬትድ የሚሰራ፣ በ Polymetis በ 15 Hz በሁለቱም የመገጣጠሚያ እና መጨረሻ-ተፅዕኖ ፈጣሪ ቦታ። የቋንቋ መለያዎች በኋላ በ tasq.ai በኩል መጡ፣ በእያንዳንዱ ክፍል እስከ ሶስት።
- 76ሺህ ትራጀክተሪዎች፣ 350 ሰዓታት፣ 564 ትዕይንቶች፣ 84 ተግባራት፣ በሶስት አህጉራት ላይ 50 ሰብሳቢዎች።
- ዋናው ውጤት የጋራ ስልጠና እንጂ ብቸኛ ስልጠና አይደለም፡ 50/50 ከውስጥ-ጎራ ማሳያዎች ጋር የተቀላቀሉ ባችዎች በሚሰራጭበት ጊዜ ቀጣዩን ምርጥ ዘዴ በ22 በመቶ ፍጹም ስኬት፣ ከሱ ውጪ ደግሞ በ17 በመቶ አሸንፈዋል።
- IPEC-COMMUNITY/droid_lerobot: 92,233 ክፍሎች፣ 27,044,326 ፍሬሞች፣ ፍራንካ፣ 15 fps፣ codebase_version v2.0፣ ሶስት AV1 ዥረቶች በ180x320፣ 392 ጂቢ።
- 2 ጂቢ፣ 100-ክፍል ማረሚያ ናሙና በ gs://gresearch/robotics/droid_100 ላይ ይገኛል። ከዚያ ይጀምሩ።
ብሪጅዳታ V2
ለሆቢ ማዋቀር በጣም ቅርብ የሆነው፡ WidowX 250 6-DoF ክንድ፣ 60,096 ትራጀክተሪዎች በ24 አካባቢዎች እና 13 ክህሎቶች በ5 Hz። አወቃቀሩን ልብ ይበሉ፡ 50,365 የባለሙያ ቴሌኦፕሬትድ ማሳያዎች እና 9,731 ከዘፈቀደ ስክሪፕት ከተደረገ የፒክ-አንድ-ፕሌስ ፖሊሲ፣ ስለዚህ ወደ 16 በመቶ የሚሆነው የሰው ልጅ ማሳያ አይደለም፣ ይህም ለ የመኮረጅ ትምህርት ጥራት አስፈላጊ ነው። የተለመደው ማውረጃ፣ IPEC-COMMUNITY/bridge_orig_lerobot፣ 53,192 ክፍሎች እና 1,893,026 ፍሬሞች በ5 fps፣ robot_type widowx ሪፖርት ያደርጋል፡ ከወረቀቱ 60,096 ያነሰ ነው፣ ስለዚህ ቁጥሩን ከ meta/info.json ያንብቡ እንጂ አንዱንም አይጥቀሱ።
ክፍት ኤክስ-ኢምቦዲመንት
በተመሳሳይ መልኩ የውሂብ ስብስብ አይደለም፡ ከ34 ላብራቶሪዎች የተገኙ 60 ነባር የሮቦት የውሂብ ስብስቦች በአንድ የRLDS ስብስብ ውስጥ ተሰብስበው 22 አካላትን እና ከአንድ ሚሊዮን በላይ የትራጀክተሪዎችን ይሸፍናል። BridgeData V2 በውስጡ እንደ bridge_orig ይገኛል፤ የ google_robot ክፍል፣ fractal20220817_data፣ በ3 fps ወደ 87,212 ክፍሎች ይቀየራል።
ይህ አሰባሰብ ወረቀቱ በግልጽ የሚገልጸውን ማስጠንቀቂያ ይዟል። ለRT-X ሙከራዎች ደራሲዎቹ እያንዳንዱን ምንጭ ወደ 7-DoF የመጨረሻ-አክተር እርምጃ ይለውጣሉ፣ ነገር ግን የውሂብ ስብስቦች ላይ የማስተባበሪያ ፍሬሞችን አያስተካክሉም፣ እና የእርምጃ እሴቶች እንደ እያንዳንዱ ሮቦት የመጀመሪያ የቁጥጥር እቅድ ፍጹም ወይም አንጻራዊ አቀማመጥ ወይም ፍጥነት እንዲሆኑ ይፈቅዳሉ። የእነሱ መደምደሚያ፡ ተመሳሳይ የእርምጃ ቬክተር ለተለያዩ ሮቦቶች በጣም የተለያዩ እንቅስቃሴዎችን ሊያስከትል ይችላል።
ያልተጣጣመው ነገር፣ በአራት ክፍሎች
የአካላዊ መመሳሰል አለመጣጣም ብዙውን ጊዜ እንደ አንድ ግልጽ ያልሆነ ችግር ይቆጠራል። አራት ናቸው፣ በተለያየ መንገድ ይበላሻሉ፣ እና ሁለቱ በስክሪፕት ሊስተካከሉ አይችሉም።
1. የእንቅስቃሴ ነጻነት ደረጃዎች
አንድ SO-100 አምስት የእጅ መገጣጠሚያዎች እና አንድ ግሪፐር አለው። እንደ ሞተሮች ሲቆጠር 6-DoF ክንድ ነው፣ እና የSmolVLA ወረቀትም እንደዚያ ይጠራዋል። እንደ አቀማመጥ ዘዴ ሲቆጠር 5-DoF ነው፣ እና LeRobot በእሱ inverse-kinematics docstring ውስጥ እንደዚያ ይጠራዋል፣ ይህም የእጅ አንጓው አቅጣጫን በከፊል ብቻ በሚከታተልበት 5-DOF SO-101 ላይ ያለውን ለስላሳ-አቅጣጫ IK ይገልጻል። አንድ Franka ሰባት የአቀማመጥ መገጣጠሚያዎች አሉት። ይህ ክፍተት የትኞቹ አቀማመጦች እንዳሉ ይወስናል፡ 5-DoF ክንድ በአጠቃላይ የዘፈቀደ አቀማመጥ እና አቅጣጫን በአንድ ጊዜ መድረስ አይችልም፣ ስለዚህ መፍቻው ሊደርስበት የሚችለውን ቅርብ የሆነውን ይመልሳል፣ ይህም ከታየው እንቅስቃሴ የተለየ ነው። ዳራ: የእንቅስቃሴ ነጻነት ደረጃዎች.
# src/lerobot/robots/so_follower/so_follower.py
motors = {
"shoulder_pan": Motor(1, "sts3215", norm_mode_body),
"shoulder_lift": Motor(2, "sts3215", norm_mode_body),
"elbow_flex": Motor(3, "sts3215", norm_mode_body),
"wrist_flex": Motor(4, "sts3215", norm_mode_body),
"wrist_roll": Motor(5, "sts3215", norm_mode_body),
"gripper": Motor(6, "sts3215", MotorNormMode.RANGE_0_100),
}
# action keys are "<motor>.pos"; send_action sync_writes them to
# "Goal_Position" -> a 6-D ABSOLUTE JOINT POSITION command
# openpi/src/openpi/policies/droid_policy.py
def make_droid_example() -> dict:
return {
"observation/exterior_image_1_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/wrist_image_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/joint_position": np.random.rand(7), # seven Franka joints
"observation/gripper_position": np.random.rand(1),
"prompt": "do something",
}
# state = concat(joint_position, gripper_pos) -> 8-Dስለዚህ ዝግጁ የሆነ የ DROID ቼክፖይንት አቋራጭ መንገድ አይደለም። Physical Intelligence pi05_droidን በ gs://openpi-assets/checkpoints/pi05_droid ያቀርባል፣ እና ስፋቱን የሚያወድሰው ተመሳሳይ README እነዚህ የባለሙያ ቼክፖይንቶች ለእርስዎ ማዋቀር ላይሰሩ እንደሚችሉ ያስጠነቅቃል። የእሱ ሁኔታ ስምንት የፍራንካ መገጣጠሚያ ቁጥሮች ሲሆኑ የምስል ቁልፎቹ exterior_image_1_left እና wrist_image_left ናቸው። ምንም ባንዲራ ያንን ወደ ስድስት ሞተር SO-100 ትዕዛዝ አይለውጠውም።
2. የድርጊት ቬክተሩ በትክክል የሚናገረው
ከመጠን በላይ ጥልቀት ያለው። በ LeRobot ለውጦች ውስጥ ሦስቱም ግሪፐሩ ወዴት መሄድ እንዳለበት በካርቴዥያን ቦታ ይናገራሉ። አንድ SO-100 ስድስት ሰርቮዎች ወዴት መሄድ እንዳለባቸው ይናገራል። ለመቀየር የኪነማቲክ ሞዴል እና መፍቻ ያስፈልጋል እንጂ ቅርፅን መቀየር አይደለም።
| ባሕርይ | OXE, DROID እና Bridge በ LeRobot ቅርፅ | SO-100 በ LeRobot |
|---|---|---|
| የድርጊት ቬክተር | 7-D: x, y, z, roll, pitch, yaw, gripper | 6-D: ለእያንዳንዱ ሞተር አንድ የግብ አቀማመጥ |
| የሁኔታ ቬክተር | 8-D, ከፓድ ማስገቢያ ጋር (google_robot ኳተርኒዮን ይጠቀማል) | 6-D, ለእያንዳንዱ ሞተር አንድ |
| ፍሬም | ካርቴዥያን, በመረጃ ስብስቦች ላይ ያልተስተካከለ | የመገጣጠሚያ ቦታ, ለእያንዳንዱ ክንድ ማስተካከያ |
| ፍፁም ወይም አንፃራዊ | ሁለቱም, በመነሻ ላብራቶሪ የሚወሰን | ፍፁም የግብ አቀማመጦች |
| አሃዶች | በእያንዳንዱ የመረጃ ስብስብ መሠረት የተስተካከለ, ከዚያም የተከፋፈለ | በነባሪ ዲግሪዎች (use_degrees=True), አለበለዚያ -100 እስከ 100 |
| ጸጥ ያለ ውድቀት | እንደ ፍፁም የተነበበ ዴልታ | ያልተስተካከለ ክንድ |
openx2lerobot README የሚቀይራቸውን እያንዳንዱን የውሂብ ስብስብ አንድ ወጥ የሆነ 8-dim ሁኔታ እና 7-dim ተግባር ይመዘግባል፣ የpad ማስገቢያ የመጣው ከዚያ ነው። የDROID የራሱ RLDS ስኪማ የተለየ ነው፡ ዋናው action 6 የጋራ ፍጥነቶች እና 1 የግሪፐር አቀማመጥ ያለው 7-ቬክተር ነው፣ ከcartesian_position፣ cartesian_velocity፣ joint_position እና joint_velocity ጋር በaction_dict ስር። openpi የጋራ-ቦታ እይታን ያነባል፣ የLeRobot ግንባታ የካርቴዥያንን ይሰጥዎታል። ሁለቱም ስድስት ፍጹም የሰርቮ አንግል አይደሉም።
LeRobot የጎደለውን ክፍል ይልካል፡ የSO follower InverseKinematicsEEToJoints እና ForwardKinematicsJointsToEE ደረጃዎች ያሉት የኪነማቲክስ ፕሮሰሰር አለው። ቁልፎቹ ee.x, ee.y, ee.z በተጨማሪም የሽክርክር ቬክተር ee.wx, ee.wy, ee.wz እና ee.gripper_pos ናቸው፣ ስለዚህ የአቅጣጫ ኢንኮዲንግ እንኳን በፋይሎቹ ውስጥ ካለው roll-pitch-yaw የተለየ ነው። የIK ደረጃ ነባሪው 0.01 የሆነ orientation_weight ይወስዳል፣ የዶክስትሪንግ 0.0 ለቦታ-ብቻ IK ከስር-ተንቀሳቃሽ ክንዶች ላይ እንዲቀመጥ ይናገራል። ድልድዩን መገንባት ይችላሉ፣ ነገር ግን የእያንዳንዱ የተበደረ ተግባር የአቅጣጫ ግማሽ ግምታዊ ሆኖ ይቆያል።
3. የቁጥጥር ፍጥነት
DROID 15 Hz ነው፣ BridgeData V2 5 Hz ነው፣ የgoogle_robot slice 3 fps ነው፤ የpi0 ደራሲዎች የቅይጣቸውን ክፍት ምንጭ ክፍል በ2 እና 10 Hz መካከል ያለ ዝቅተኛ-ድግግሞሽ ቁጥጥር አድርገው ይገልጹታል። የLeRobot DatasetRecordConfig ነባሪው fps 30፣ episode_time_s 60፣ reset_time_s 60፣ num_episodes 50 ነው። አንድ በ5 Hz ዳታ የሰለጠነ አንድ ተግባር 200 ms እንደሚሸፍን ተማረ። በ30 Hz መልሰው ሲያጫውቱት ክንዱ ይሳባል፤ በዋህነት እንደገና ከለኩት የግሪፐር መዝጊያ ፍሬሙን ያበላሻሉ። ከዚህ ጋርም መጥፎ ግንኙነት አለው ፡ 100-ደረጃ መቆራረጥ በ5 Hz 20 ሰከንድ፣ በ30 Hz 3.3 ነው።
4. ካሜራዎች
BridgeData V2 በየ50 ትራጀክተሪዎች ሁለት የካሜራ አቀማመጦችን በዘፈቀደ መርጧል፣ እና የፕሮጀክቱ ገጽ አብዛኛው ዳታ ቋሚ እይታን ብቻ እንደያዘ ይገልጻል። DROID የሚስተካከሉ የZED 2 መጫኛዎችን እና የእጅ አንጓ ZED Mini ተጠቅሟል። እርስዎ በዓይንዎ ያስቀመጧቸው ሁለት የዩኤስቢ ዌብካሞች አሉዎት። የካሜራ አቀማመጥ ለ የሚያስቸግር ተለዋዋጭ አይደለም፤ የእይታ ኢንኮደር በአብዛኛው የተመካው በእሱ ላይ ነው፣ እና በፋይል ቅርጸቱ ውስጥ አቀማመጦቹ የተለዩ መሆናቸውን የሚነግርዎት ምንም ነገር የለም።
ክፍሎቹ ለመስራት በበቂ ሁኔታ ይጣጣማሉ። የዳታ ስብስብ ይጫናል፣ ስልጠና ይጀምራል፣ ኪሳራው ይቀንሳል፣ ቼክፖይንቶች ይታያሉ፣ ምንም ስህተት አይፈጠርም። ከዚያም ፖሊሲው በእጁ ላይ የሚታወቅ ነገር አያደርግም እና ስልጠና ስክሪፕትዎ ውስጥ ስህተት ለማደን አንድ ቀን ያጠፋሉ። ስህተት የለም፡ ሞዴሉ ክፍልዎ ውስጥ የሌለ ሮቦት የካርቴዥያን የድርጊት ስርጭት ተምሯል። ከኪሳራው ሲቀንስ ፖሊሲው ምንም አያደርግም ይጀምሩ፣ ከሃይፐርፓራሜትሮችዎ አይደለም።
ዳታውን ለማዋሃድ ሲሞክሩ ምን ይከሰታል
ግልጽ የሆነው እቅድ ማጣመር ነው፡ ጥቂት ሺህ የDROID ክፍሎች እና የእርስዎ 50። LeRobot እምቢ ይላል፣ እና እምቢታው የሚለያዩትን ሶስት ነገሮች ይዘረዝራል።
- 1ሙሉውን 1.7 ቴባ ሳይሆን የ100 ክፍል ናሙናውን ያውርዱ
አወቃቀሩን ለማየት 2 ጊባ በቂ ነው።
bashpip install gsutil tensorflow tensorflow-datasets gsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 2RLDSን ወደ LeRobot ቅርጸት ቀይር
openx2lerobot የOXE መደበኛ ለውጦችን ያጠቃልላል እና የሮቦት አይነትንና የቁጥጥር ድግግሞሽን ያብራራል። README ይህንን በ convert.sh ውስጥ ያስቀምጣል።
bashgit clone https://github.com/Tavish9/any4lerobot.git cd any4lerobot/openx2lerobot python openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 3ከማንኛውም ነገር በፊት meta/info.jsonን ያንብቡ
ይህ ፋይል የቀሪው ስራዎ እንደሚሰራ ይወስናል።
bashpython -c "import json;d=json.load(open('meta/info.json'));\ print(d['codebase_version'], d['robot_type'], d['fps']);\ print(d['features']['action']['shape'], d['features']['observation.state']['shape'])" - 4ውህደቱን ይሞክሩ እና ስህተቱን ያንብቡ
merge እያንዳንዱን የውሂብ ስብስብ ይጭናል፣ ከዚያም validate_all_metadata የfps፣ robot_type እና featuresን ከዝርዝሩ ውስጥ ከመጀመሪያው ጋር ያነጻጽራል፣ የመጀመሪያው ልዩነት ሲገኝ ስህተት ያሳያል።
bashlerobot-edit-dataset \ --new_repo_id you/mixed \ --operation.type merge \ --operation.repo_ids "['you/droid100_lerobot', 'you/my_so100_task']" # ValueError: Same fps is expected, but got fps=30 instead of 15.
የማጣቀሻ እሴቶቹ መጀመሪያ ከዘረዘሩት የውሂብ ስብስብ የመጡ ናቸው፣ ለዚህም ነው መልዕክቱ የDROIDን 15 ሳይሆን የእርስዎን 30 fps የሚያማርረው። fpsን ሲያስተካክሉ የrobot_type ፍተሻ ያጋጥምዎታል፤ ያንን ሲያስተካክሉ የባህሪ ፍተሻ ያጋጥምዎታል፣ ለድርጊቱ 7 ከ 6 ጋር። ምንም አይነት ቅደም ተከተል አያልፍም፣ እና ተመሳሳይ ጥበቃ በምዝገባ ጊዜ በ sanity_check_dataset_robot_compatibility በኩል ይሰራል።
በአሁኑ LeRobot ዋና so100_follower እና so101_follower ሁለቱም በአንድ የጋራ SOFollowerRobotConfig ላይ ተመዝግበዋል፣ ስለዚህ ከእውነተኛ ቀረጻ የመጣው ሕብረቁምፊ እርስዎ የሚጠብቁት ላይሆን ይችላል። ከራስዎ meta/info.json ያንብቡት፣ እና ማሰናከል የነበረብዎትን ፍተሻ የሆነ ነገር እየነገረዎት እንደነበረ አድርገው ይቁጠሩት።
ታዲያ በትክክል የሚተላለፈው ምንድን ነው?
ክብደቶች እንጂ ክፍሎች አይደሉም። እያንዳንዱ ዘመናዊ አጠቃላይ ፖሊሲ በቅድመ-ስልጠናው ወቅት የተወሰነውን ክፍል ወስዷል፣ እና እርስዎ ጥሩ-ማስተካከያ ያደርጉ ከተለቀቀ የፍተሻ ነጥብ ሲያደርጉት በትክክል ለማከናወን የሚያስችል ስሌት ባላቸው ሰዎች አስቀድሞ የተስተካከለውን ይወርሳሉ። የ pi0 ወረቀት ስለ መጠኑ ግልጽ ነው፡ 9.1 በመቶ የሚሆነው የቅድመ-ስልጠና ድብልቅ፣ በጊዜ ደረጃዎች የተቆጠረ፣ OXE፣ Bridge v2 እና DROIDን ጨምሮ ክፍት ምንጭ ዳታ ነው። ያ አሃዝ የ pi0 ነው፤ የእያንዳንዱ አቅራቢ ድብልቅ ይለያያል።
- የእይታ እና የቋንቋ ቅድመ-እውቀቶች፡ ኢንኮደሩ በሺዎች የሚቆጠሩ ኩሽናዎችን እና ኩባያዎችን አይቷል እና "ቀይ ብሎክ" የሚያመለክተውን ያውቃል።
- በማኒፑሌሽን መዋቅር ላይ ያለ ቅድመ-እውቀት፡ መቅረብ፣ መዝጋት፣ ማንሳት፣ ማጓጓዝ፣ መልቀቅ፣ ቁጥሮቹ ባይሆኑም እንኳ ከሰውነት ነጻ የሆነ።
- ለመፈተሽ የታወቀ ጥሩ የዳታ ስብስብ። ስራዎ 100 DROID ክፍሎችን ከመጠን በላይ ማስተካከል ካልቻለ፣ ችግሩ የእርስዎ ዝግጅት ነው።
- የማጣቀሻ ነጥቦች፡ በትናንሽ የዳታ ስብስብ ጎራዎች ውስጥ RT-1-X ከመጀመሪያው ዘዴ ወይም RT-1 በ 50 በመቶ ከፍ ያለ አማካይ የስኬት መጠን ላይ ደርሷል፣ እና RT-2-X ደግሞ RT-2ን በአዳዲስ ክህሎቶች ላይ በግምት 3 እጥፍ አሸንፏል።
- የሚሰራ የድርጊት ቁጥጥር የለም። ባለ 7-ልኬት ካርቴዥያን ኢላማ ባለ 6-ልኬት የመገጣጠሚያ ትዕዛዝ አይደለም።
- የካሜራ አቀማመጥ ዝውውር የለም፣ እና በዳታው ውስጥ አቀማመጦቹ እንደሚለያዩ የሚነግርዎት ነገር የለም።
- የጊዜ ዝውውር የለም፡ 3፣ 5 እና 15 fps ምንጮች ከ 30 fps መቅጃ ጋር።
- የመያዣ ዝውውር የለም። Robotiq 2F-85 እና በ STS3215 ላይ የታተመ መንጋጋ በኃይል፣ በስትሮክ እና በዳይናሚክስ ይለያያሉ።
- መጠን ብቻውን ለጸሐፊዎቹም በቂ አልነበረም፡ በትላልቅ የዳታ ስብስብ ጎራዎች ውስጥ RT-1-X በዚያ ዳታ ስብስብ ላይ ብቻ የሰለጠነውን RT-1 አላሸነፈም።
- የሚያስፈልጉዎት የራስዎ ክፍሎች ብዛት ላይ ቅናሽ የለም።
| የሞዴሉ ንብርብር | ይተላለፋል? | ለምን |
|---|---|---|
| የእይታ ኢንኮደር | አዎ፣ በጠንካራ ሁኔታ | ነገሮች እና ትዕይንቶች ከሰውነት ነጻ ናቸው |
| የቋንቋ መሰረት | አዎ | መመሪያዎች ጽሑፍ እንጂ ጂኦሜትሪ አይደሉም |
| የሞዳል-አቋራጭ ውህደት | በአብዛኛው | በጥያቄው ውስጥ ለተጠቀሰው ነገር ትኩረት ይሰጣል |
| የፕሮፕሪዮሴፕሽን ኢንኮደር | አይ | የግብዓት ልኬት እና የመገጣጠሚያ ትርጉሞች ይለያያሉ |
| የድርጊት ራስ | አይ | እርስዎ በሌሉበት ባለ 7-ልኬት ካርቴዥያን ቦታ ላይ የሰለጠነ |
| የመደበኛነት ስታቲስቲክስ | አይ፣ እና አደገኛ ነው | የውጭ ስታቲስቲክስ እያንዳንዱን ትዕዛዝ ያዛባል |
ለዚህ ነው SmolVLA ዝቅተኛ ዋጋ ባለው ክንድ ላይ በተለየ መንገድ የሚሰራው። ጥናቱ ከHugging Face 481 የማህበረሰብ ዳታ ስብስቦችን ይመርጣል፣ በእምቦዲመንት አይነት፣ የክፍሎች ብዛት፣ የዳታ ጥራት እና የፍሬም ሽፋን ተጣርቶ: 22.9K ክፍሎች፣ 10.6M ፍሬሞች፣ በእውነተኛ SO-100 እና SO-101 ክንዶች ላይ ተገምግሟል። ትንሽ እና የተዛመደ ትልቅ እና ያልተዛመደውን ያሸንፋል። በ ACT against SmolVLA ያወዳድሩ።
መወሰድ ያለባቸው ሶስት መንገዶች
መንገድ ሀ: ዳታውን አስቀድሞ ከወሰደ ቼክፖይንት ማስተካከል
አብዛኛዎቹ ሰዎች ይህንን መውሰድ አለባቸው። DROID ወይም Open X-Embodimentን በጭራሽ አይነኩም: ቅድመ-ስልጠናው አስቀድሞ የክሮስ-እምቦዲመንት ዳታ የወሰደ ፖሊሲ ይምረጡ፣ የራስዎን ክፍሎች ይመዝግቡ፣ ያስተካክሉ።
| ፖሊሲ | ፓራሜትሮች | ዝቅተኛ ክፍሎች | የዳታ ስብስብ ቅርጸት | GPU ደረጃ | ግምት | መሰረታዊ ቼክፖይንት |
|---|---|---|---|---|---|---|
| GR00T N1.7 | ~3 B, ~40 M በጥሩ ማስተካከያ የሰለጠነ | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 152 ms per step | nvidia/GR00T-N1.7-3B |
| GR00T N1.5 | ~3 B | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 165 ms | nvidia/GR00T-N1.5-3B |
| Pi0.5 | ~3 B, PaliGemma የጀርባ አጥንት | 50 | LeRobot v3.0 | A100 or H100 80 GB | 485 ms | lerobot/pi05_base |
| SmolVLA | ~450 M | 30 | LeRobot v3.0 | RTX 4090 or any 24 GB | 245 ms | lerobot/smolvla_base |
| ACT | ~80 M | 50 | LeRobot v3.0 | RTX 4090 or any 24 GB | 20 ms | የለም፣ ከመጀመሪያው |
ACT ሐቀኛ የሆነ ልዩ ሁኔታ ነው፡ ምንም መሰረታዊ ሞዴል የለውም፣ ስለዚህ ምንም አይነት የህዝብ ዳታ አይደርሰውም። ይህ በራስ-ሰር ጉዳት አይደለም፣ ምክንያቱም በአንድ የድርጊት እርምጃ 20 ms ስለሚወስድ፣ ፈጣን ዑደትን መዝጋት ከሚችሉት አምስቱ ውስጥ ብቸኛው ነው፣ እንደ የACT ገጽ ያብራራል። ተግባርን በመጠቀም ይምረጡ አምስቱም ሲነጻጸሩ, GR00T N1.7 ከ Pi0.5 ጋር ሲነጻጸር, እና በ85 ሞዴሎች ላይ የተደረጉ 332 የቤንችማርክ ውጤቶች በ አሬናው.
መንገድ B: DROIDን እንደ የሙከራ መሳሪያ መጠቀም
የ100-ክፍል ናሙና በዚህ ወር ከሚያወርዷቸው ምርጥ 2 ጊባ ውስጥ አንዱ ነው፣ እና ለስልጠና አይደለም። ትክክል መሆኑን የሚያውቁት የዳታ ስብስብ ነው። የእርስዎን መቀየሪያ፣ ሎደር እና አጭር የGPU ስራ በእሱ ላይ ያሂዱ፤ የሚከሽፍ ማንኛውም ነገር ርካሽ በሆነበት ጊዜ የተገኘ የመሠረተ ልማት ስህተት ነው። NVIDIA በትልቅ ደረጃ ተመሳሳይ ነገር ያደርጋል፡ የGR00T N1.7 ካርድ አራት ከስልጠና በኋላ የተሰሩ ልዩነቶችን ይዘረዝራል፣ ለ Bridge እና Fractal በ SimplerEnv፣ DROID እና LIBERO።
መንገድ ሐ: የራስዎን ሆን ብለው ይመዝግቡ
ከሠላሳ እስከ ሃምሳ ክፍሎች ከ76,000 ጋር ሲነጻጸር ትንሽ ይመስላል፣ ነገር ግን የእርስዎ ክንድ፣ ካሜራዎችዎ እና ጠረጴዛዎ ያሉት የእርስዎ ብቻ መሆናቸውን እስኪያስታውሱ ድረስ። በLeRobot ነባሪዎች፣ 50 ክፍሎች 100 ደቂቃ የሰዓት ጊዜ ነው። ይመልከቱ የመጀመሪያውን የውሂብ ስብስብዎን ይመዝግቡ፣ SO-100 የውሂብ ስብስብ እና የውሂብ ጥራት መመሪያውን።

ከህዝብ መረጃ ወደሚሰራ ፖሊሲ ለመድረስ ሁለት መንገዶች
All of this runs on your own machine plus a rented GPU. Knowing the manual path matters because when something breaks you will know which layer broke.
- 1Install LeRobot with the extras the scripts need
The record and train entry points each declare their own extra.
bashpip install 'lerobot[core_scripts]' # lerobot-record pip install 'lerobot[training]' # lerobot-train pip install gsutil tensorflow tensorflow-datasets - 2Get a small, known-good slice
100 DROID episodes, 2 GB.
bashgsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 3Convert to LeRobot form
Writes the unified 8-D state and 7-D action, annotating robot type and control frequency.
bashpython openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 4Check the version against your trainer
The converter README documents v3.0 output; the published IPEC-COMMUNITY datasets report v2.0. GR00T wants v2.0 or v2.1 and crashes on v3.0; Pi0.5, SmolVLA and ACT want v3.0. Mind the gap: the only conversion script on LeRobot main goes 2.1 to 3.0.
bashpython src/lerobot/scripts/convert_dataset_v21_to_v30.py \ --repo-id=you/droid100_lerobot - 5Record your own episodes
Defaults: 30 fps, 60 s per episode, 60 s reset, 50 episodes. The teleoperator type is so100_leader.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.cameras="{front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --dataset.repo_id=you/so100_pick_block \ --dataset.num_episodes=50 \ --dataset.single_task="Pick up the red block and put it in the bowl" - 6Fine-tune on your data only
Weights from public data, actions from your own. Do not mix the datasets.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=you/so100_pick_block \ --policy.device=cuda \ --batch_size=4 \ --steps=20000
Not in training; the GPU job is hours. The conversion, the version mismatch and the moment you find your dataset is v2.0 and your trainer wants v3.0 are days. Read dataset rejected as v3 first.
The platform removes the GPU and pipeline plumbing. It does not remove the embodiment mismatch: point the trainer at a converted DROID dataset and you get a policy trained on Franka actions, exactly as you would locally.
- 1Pick a policy, not a dataset
The five trainable policies, with parameter counts, GPU tiers and latencies, are at /policies.
- 2Record with the desktop client
It writes LeRobot-format datasets, episodes, camera streams and joint states, straight out of a teleop session. No conversion step to get wrong.
- 3Or bring a dataset you already have
The training form accepts one from /directory, a Hugging Face repo id, or your own machine. A repo id means a converted OXE dataset will load, and the mismatch loads with it.
- 4Train on a rented GPU
The backend rents a card on a spot market by required VRAM. SmolVLA or ACT on 24 GB: 2 to 5 hours, about 1 to 3 USD. GR00T or Pi0.5 on A100 or H100: 3 to 6 hours, about 4 to 12 USD. See /pricing.
- 5Serve it back to the arm
/api/inference/pod auto-provisions a GPU pod serving the policy; the local client talks to that endpoint. Pods carry an idle watchdog and destroy themselves, so nothing keeps billing silently.
Inference has to sit next to the servos for fast tasks. The control loop is 20 to 485 ms per action step depending on the model, and public-internet round trips turn a working policy into a hesitant one. Remote inference is fine for slow pick-and-place, not fast reactive motion.
The platform helps with the boring parts: the right format for the right arm at the right frame rate, and no babysitting a spot instance. It helps with nothing else in this article.

እያንዳንዱ መንገድ ምን ያህል ያስከፍላል
| መንገድ | ማከማቻ | የሰው ጊዜ | የጂፒዩ ወጪ | እጅዎን የማንቀሳቀስ ዕድል |
|---|---|---|---|---|
| የተለወጠ DROID ብቻውን | 392 GB | የመቀየር ቀናት | 4 to 12 USD | በጣም ዝቅተኛ፣ የተሳሳተ የእንቅስቃሴ ቦታ |
| DROID ከእርስዎ ክፍሎች ጋር ተዋህዷል | ሁለቱም | በ validate_all_metadata ታግዷል | n/a | ምንም የለም፣ አይሰራም |
| SmolVLA፣ ከ30 እስከ 50 የራስዎ ክፍሎች | ጥቂት ጊባ | 100 ደቂቃ ቀረጻ | 1 to 3 USD | ከፍተኛ |
| GR00T N1.7፣ 50 የራስዎ ክፍሎች | ጥቂት ጊባ | 100 ደቂቃ ቀረጻ | 4 to 12 USD | ከፍተኛ |
| ACT ከመጀመሪያው፣ 50 የራስዎ ክፍሎች | ጥቂት ጊባ | 100 ደቂቃ ቀረጻ | 1 to 3 USD | ከፍተኛ፣ 20 ms ግምት |
| DROID ናሙና እንደ የሙከራ መሳሪያ | 2 GB | አንድ ከሰዓት | አንድ አጭር ሩጫ | ከፍተኛ፣ እንደ ማረጋገጫ |
አለመመጣጠኑ ቁም ነገሩ ነው፡ ብዙ ዳታ የሚበደረው መንገድ በጣም ውድ እና ክንድዎን የማንቀሳቀስ እድሉ አነስተኛ ነው። ከሁለት ሰዓት ባነሰ ጊዜ ውስጥ የራስዎ ቴሌኦፕሬሽን የሌላ ሰው ፍራንካን ቴራባይት ይበልጣል። ገና ክንድ የለዎትም? /live ምንም ምዝገባ ሳይኖር አካላዊ SO-100ን ያሰራጫል። ከዚያ የመጀመሪያ ፖሊሲዎን ያሰለጥኑ, እና SmolVLA on SO-100 ለተለየ መመሪያ።
የ2 ጊባ DROID ናሙናውን ያውርዱ እና የቧንቧ መስመርዎን ለማረጋገጥ ይጠቀሙበት። ሌላውን 1.7 ቴባ ችላ ይበሉ። በቋሚ ካሜራዎች የአንድ ተግባር 50 ክፍሎችን ይመዝግቡ። መጀመሪያ SmolVLAን በጥሩ ሁኔታ ያስተካክሉ፣ ምክንያቱም በ24 ጊባ ካርድ ላይ ቢያንስ 30 ክፍሎች ሲኖሩት ለመድገም በጣም ርካሽ ስለሆነ፣ ከዚያ GR00T N1.7ን በተመሳሳይ ዳታ ላይ ይሞክሩ። በእርስዎ ተግባር ላይ ያወዳድሩ፣ በመለኪያ ላይ አይደለም።
ክንድዎን አስቀድመው የሚዛመዱ የውሂብ ስብስቦችን ይመዝግቡ
የዴስክቶፕ ደንበኛው የLeRobot-ቅርጸት የውሂብ ስብስቦችን በቀጥታ ከቴሌኦፕ ክፍለ ጊዜ ይጽፋል፡ ትክክለኛው ክንድ፣ ትክክለኛው የፍሬም ፍጥነት፣ ትክክለኛው የድርጊት ቦታ። ምንም የRLDS ልወጣ የለም፣ ምንም ዳግም ማስተካከያ የለም።
የዴስክቶፕ ደንበኛውን ያግኙበ DROID ላይ ፖሊሲን ማሰልጠን እና በእኔ SO-100 ላይ ማስኬድ እችላለሁ?▾
በቀጥታ አይደለም። በLeRobot ግንባታ ውስጥ የDROID ድርጊቶች በ15 fps ፍራንካ ፓንዳ ላይ 7-D end-effector ትዕዛዞች ናቸው፤ በጥሬው RLDS ውስጥ ደግሞ 6 የጋራ ፍጥነቶች እና የመያዣ ቦታ ናቸው። አንድ SO-100 6 ፍጹም የጋራ ቦታዎችን ይወስዳል። የተገላቢጦሽ-ኪነማቲክስ ንብርብር ያስፈልግዎታል፣ እና ያኔም ቢሆን 5-DoF የእጅ አንጓ የዘፈቀደ 6-DoF አቀማመጦችን ማባዛት አይችልም።
የ DROID ወይም Bridge ክፍሎችን ከራሴ SO-100 ክፍሎች ጋር መቀላቀል እችላለሁ?▾
አይ. validate_all_metadata ተመሳሳይ fps፣ robot_type እና feature schema ይፈልጋል እና በመጀመሪያው አለመመጣጠን ላይ ValueErrorን ያነሳል። ሦስቱም ይለያያሉ፡ 15 ወይም 5 fps ከ30 ጋር፣ franka ወይም widowx ከክንድዎ ጋር፣ የድርጊት ቅርጾች 7 ከ6 ጋር። ሜታዳታውን ማረጋገጫውን ለማለፍ እንደገና መጻፍ ትርጉሙን አያስተካክለውም።
ታዲያ Open X-Embodiment ለዝቅተኛ ዋጋ ክንድ ከንቱ ነው?▾
አይ፣ ነገር ግን ዋጋው የሚደርስዎት በቅድመ-የሰለጠኑ ክብደቶች እንጂ በክፍሎች አይደለም። OXE፣ Bridge v2 እና DROIDን ጨምሮ ክፍት ምንጭ የውሂብ ስብስቦች የpi0 ቅድመ-ስልጠና ድብልቅ 9.1 በመቶ ናቸው፣ እና NVIDIA በBridge፣ Fractal፣ DROID እና LIBERO ላይ ከስልጠና በኋላ የተሰሩ GR00T N1.7 ልዩነቶችን ይልካል። ማድረግ የማይችሉት ነገር ቢኖር እነዚያን ክፍሎች ከራስዎ ቀረጻ ጋር ማያያዝ ነው።
ከህዝብ መስቀል-አካላዊ ዳታ የትኛው ፖሊሲ የበለጠ ይጠቀማል?▾
Pi0.5 እና የGR00T ሞዴሎች አብዛኛውን የመስቀል-አካላዊ ቅድመ-ስልጠና ይይዛሉ፣ ነገር ግን SmolVLA ብዙውን ጊዜ በዝቅተኛ ዋጋ ክንድ ላይ በተሻለ ሁኔታ ይሰራል። የቅድመ-ስልጠና ስብስቡ 481 የማህበረሰብ የውሂብ ስብስቦች፣ 22.9K ክፍሎች እና 10.6M ፍሬሞች ሲሆን በእውነተኛ SO-100 እና SO-101 ክንዶች ላይ ተገምግሟል። ACT ተቃራኒው ነው፡ ምንም መሰረታዊ ሞዴል የለም፣ በአንድ የድርጊት ደረጃ 20 ms።
በእርግጥ ስንት የራሴ ክፍሎች ያስፈልጉኛል?▾
ለSmolVLA 30፣ ለGR00T N1.7፣ GR00T N1.5፣ Pi0.5 እና ACT 50። በLeRobot ነባሪዎች መሰረት በአንድ ክፍል 60 ሰከንድ እና 60 ሰከንድ ዳግም ማስጀመር፣ 50 ክፍሎች 100 ደቂቃ የሰዓት ጊዜ ነው። የተበደረ የመስቀል-አካላዊ ዳታ እነዚህን ቁጥሮች አይቀንስም።
Sources
- DROID: በትልቅ ደረጃ በዱር ውስጥ ያለ የሮቦት ማኒፑሌሽን ዳታሴት
- DROID ሰነዶች: የማውረጃ መጠኖች እና የRLDS ክፍል ስኪማ
- BridgeData V2: በትልቅ ደረጃ ለሮቦት ትምህርት የሚሆን ዳታሴት
- BridgeData V2 ፕሮጀክት ገጽ: ቅንብር እና የካሜራ ሽፋን
- Open X-Embodiment: የሮቦቲክስ ትምህርት ዳታሴቶች እና RT-X ሞዴሎች
- Open X-Embodiment ፕሮጀክት ገጽ
- google-deepmind/open_x_embodiment: የዳታሴት ዝርዝር እና RT-1-X ቼክፖይንቶች
- any4lerobot: የopenx2lerobot መቀየሪያ እና የተዋሃደ 8-D ሁኔታው፣ 7-D ድርጊቱ
- IPEC-COMMUNITY/droid_lerobot: meta/info.json እና የሪፖ መጠን
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: የgoogle_robot ቁራጭ በ3 fps
- huggingface/lerobot: SO follower, kinematics processor, aggregate and record configs
- openpi: የDROID ፖሊሲ ግብዓቶች እና የpi05_droid ቼክፖይንት
- pi0: ለአጠቃላይ ሮቦት ቁጥጥር የሚሆን የራዕይ-ቋንቋ-ድርጊት ፍሰት ሞዴል
- SmolVLA: ተመጣጣኝ እና ቀልጣፋ ሮቦቲክስ የሚሆን የራዕይ-ቋንቋ-ድርጊት ሞዴል
Sources
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- DROID docs: download sizes and the RLDS episode schema
- BridgeData V2: A Dataset for Robot Learning at Scale
- BridgeData V2 project page: composition and camera coverage
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Open X-Embodiment project page
- google-deepmind/open_x_embodiment: dataset list and RT-1-X checkpoints
- any4lerobot: the openx2lerobot converter and its unified 8-D state, 7-D action
- IPEC-COMMUNITY/droid_lerobot: meta/info.json and repo size
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: the google_robot slice at 3 fps
- huggingface/lerobot: SO follower, kinematics processor, aggregate and record configs
- openpi: DROID policy inputs and the pi05_droid checkpoint
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started