
DROID, BridgeData V2 மற்றும் Open X-Embodiment ஆகியவை 6 மற்றும் 7-DoF கைகளில் 7-D இறுதி-செயல்பாட்டு செயல்களாக மாற்றப்படுகின்றன. ஒரு SO-100 ஆனது 6 கூட்டு நிலைகளை எடுக்கிறது. எது மாற்றப்படுகிறது, எது மாற்றப்படவில்லை, அதற்கு பதிலாக என்ன செய்ய வேண்டும்.
சுருக்கமான பதிப்பு
- •LeRobot இன் மூன்று உருவாக்கங்களும் ஒரு பொதுவான மரபைப் பகிர்ந்து கொள்கின்றன: ஒரு 7-D இறுதி-செயல்பாட்டு செயல் [x, y, z, roll, pitch, yaw, gripper] மற்றும் ஒரு பேட் ஸ்லாட்டுடன் கூடிய 8-D நிலை. ஒரு SO-100 ஆறு முழுமையான கூட்டு நிலைகளை எடுத்துக்கொள்கிறது.
- •அந்த 7-D திசையன் மாற்றியின் கலைப்பொருள்: DROID இன் சொந்த RLDS செயல் புலம் 6 கூட்டு வேகங்கள் மற்றும் ஒரு கிரிப்பர் நிலை, action_dict இல் கார்ட்டீசியன் காட்சியுடன்.
- •நான்கு கடிகாரங்கள்: DROID 15 fps, BridgeData V2 5 fps, google_robot ஸ்லைஸ் 3 fps, ஒரு SO-100 பதிவு 30 fps இல்.
- •உங்கள் சொந்த தரவுகளுடன் அவற்றை ஒன்றிணைக்க முடியாது. fps, robot_type அல்லது அம்சங்களில் வேறுபடும் முதல் ஒன்றில் validate_all_metadata பிழையை எழுப்புகிறது, மேலும் மூன்றுமே வேறுபடுகின்றன.
- •மாற்றப்படுவது முன்-பயிற்சி பெற்ற எடைகள், அத்தியாயங்கள் அல்ல. திறந்த மூலத் தரவு pi0 இன் முன்-பயிற்சி கலவையின் 9.1 சதவீதம் ஆகும்.
- •அவற்றின் மலிவான உண்மையான பயன்பாடு ஒரு சோதனை சாதனம்: ஒரு வார இறுதியில் பதிவு செய்வதற்கு முன் உங்கள் பைப்லைனை நிரூபிக்கும் ஒரு அறியப்பட்ட-நல்ல 2 GB, 100-அத்தியாய DROID மாதிரி.
Google Cloud பக்கெட்டில் ஒரு மில்லியன்-பாதை பொதுத் தரவுத்தொகுப்பு உள்ளது மற்றும் ஒரு SO-100 மேசையில் உள்ளது, அதன் பாகங்களின் விலை 110 முதல் 150 EUR ஆகும். முதல் தரவுத்தொகுப்பு இரண்டாவதுக்கு ஏன் கற்றுக்கொடுக்க முடியாது? ஓரளவு முடியும், ஆனால் மக்கள் எதிர்பார்க்கும் இடத்தில் கிட்டத்தட்ட எந்த மாற்றமும் நடக்காது, மேலும் எளிதானதாகத் தோன்றும் பகுதி வேலை செய்யவே செய்யாது.
பின்வருபவை: உள்ளே என்ன இருக்கிறது DROID, BridgeData V2 மற்றும் Open X-Embodiment, அங்கு ஒவ்வொன்றும் ஒரு குறைந்த விலை 5-DoF கைடன் மோதுகிறது, அதற்கு பதிலாக என்ன செய்ய வேண்டும். கீழே உள்ள ஒவ்வொரு எண்ணும் அது சார்ந்த கட்டுரை, தரவுத்தொகுப்பு அட்டை அல்லது மூலக் கோப்பிலிருந்து வந்தது.
மூன்று தரவுத்தொகுப்புகளும் உண்மையில் என்ன கொண்டிருக்கின்றன
| DROID | BridgeData V2 | Open X-Embodiment | |
|---|---|---|---|
| ரோபோ | Franka Panda, 7 DoF, Robotiq 2F-85 | WidowX 250, 6 DoF, ~4,000 USD rig | 22 உருவகங்கள், 60 தரவுத்தொகுப்புகள், 34 ஆய்வகங்கள் |
| அளவு | 76k தடங்கள், 350 மணிநேரம் | 60,096 தடங்கள் | 1M+ தடங்கள், 527 திறன்கள் |
| பல்வகைத்தன்மை | 564 காட்சிகள், 84 பணிகள், 50 சேகரிப்பாளர்கள் | 24 சூழல்கள், 13 திறன்கள் | 160,266 பணிகள், 21 நிறுவனங்கள் |
| கலவை | அனைத்தும் தொலை இயக்கப்பட்டது | 50,365 தொலை இயக்கப்பட்டது, 9,731 ஸ்கிரிப்ட் செய்யப்பட்டது | மூல ஆய்வகம் வாரியாக |
| கட்டுப்பாட்டு விகிதம் | 15 Hz | 5 Hz | மாறுபடும், 3 fps மற்றும் அதற்கு மேல் |
| கேமராக்கள் | 2 x ZED 2 வெளிப்புறம், 1 x ZED Mini மணிக்கட்டு | 4 வரை, பெரும்பாலான எபிசோடுகளில் நிலையான ஒன்று மட்டுமே | ஆய்வகம் பயன்படுத்தியவை |
| மூல பதிவிறக்கம் | 1.7 TB RLDS, 8.7 TB மூல ஸ்டீரியோ | JPEG காப்பகங்கள் | தரவுத்தொகுப்பு வாரியாக TFDS பக்கெட்டுகள் |
1.7 TB RLDS TFRecords ஐ இன்னும் சிலரே பதிவிறக்குகிறார்கள். சமூக அமைப்பு IPEC-COMMUNITY ஆனது Open X-Embodiment இன் பெரும்பாலானவற்றை LeRobot தரவுத்தொகுப்பு வடிவத்தில் AV1 வீடியோவுடன் மறுபதிப்பு செய்துள்ளது, இதில் DROID 392 GB ஆக உள்ளது. அதுவே நீங்கள் வேலை செய்யப் போகும் பதிப்பு, அதன் meta/info.json ஐ முதலில் படிக்க வேண்டும்.
DROID
மூன்றில் மிகவும் தரப்படுத்தப்பட்டது. எல்லா இடங்களிலும் ஒரே அமைப்பு: ஒரு Franka Panda, Robotiq 2F-85 கிரிப்பருடன், இரண்டு சரிசெய்யக்கூடிய ZED 2 ஸ்டீரியோ கேமராக்கள் மற்றும் ஒரு மணிக்கட்டு ZED Mini, Meta Quest 2 கன்ட்ரோலர்கள் மூலம் தொலை இயக்கப்பட்டது, Polymetis வழியாக 15 Hz இல் கூட்டு மற்றும் இறுதி-செயல்பாட்டாளர் இடைவெளியில் பதிவு செய்யப்பட்டது. மொழி லேபிள்கள் பின்னர் tasq.ai வழியாக வந்தன, ஒவ்வொரு எபிசோடிற்கு மூன்று வரை.
- 76k தடங்கள், 350 மணிநேரம், 564 காட்சிகள், 84 பணிகள், மூன்று கண்டங்களில் 50 சேகரிப்பாளர்கள்.
- முக்கிய முடிவு தனித்த பயிற்சி அல்ல, மாறாக இணைப் பயிற்சி: களத்தில் உள்ள விளக்கங்களுடன் 50/50 கலக்கப்பட்ட தொகுதிகள், அடுத்த சிறந்த முறையை விநியோகத்தில் 22 சதவீத முழுமையான வெற்றியாலும், அதற்கு வெளியே 17 சதவீதத்தாலும் விஞ்சின.
- IPEC-COMMUNITY/droid_lerobot: 92,233 அத்தியாயங்கள், 27,044,326 பிரேம்கள், franka, 15 fps, codebase_version v2.0, 180x320 இல் மூன்று AV1 ஸ்ட்ரீம்கள், 392 GB.
- 2 GB, 100 அத்தியாயங்கள் கொண்ட பிழைத்திருத்த மாதிரி gs://gresearch/robotics/droid_100 இல் உள்ளது. அங்கிருந்து தொடங்கவும்.
பிரிட்ஜ்டேட்டா V2
ஒரு பொழுதுபோக்கு அமைப்பிற்கு மிக அருகில்: ஒரு WidowX 250 6-DoF கை, 24 சூழல்கள் மற்றும் 13 திறன்களில் 5 Hz இல் 60,096 தடங்கள். கலவையை கவனிக்கவும்: 50,365 நிபுணர் தொலைதூர இயக்க விளக்கங்கள் மற்றும் சீரற்ற ஸ்கிரிப்ட் செய்யப்பட்ட பிக்-அண்ட்-பிளேஸ் கொள்கையிலிருந்து 9,731, எனவே சுமார் 16 சதவீதம் மனித விளக்கங்கள் அல்ல, இது முக்கியமானது அனுபவக் கற்றல் தரம். வழக்கமான பதிவிறக்கம், IPEC-COMMUNITY/bridge_orig_lerobot, 53,192 அத்தியாயங்கள் மற்றும் 1,893,026 பிரேம்களை 5 fps இல், robot_type widowx: கட்டுரையின் 60,096 ஐ விடக் குறைவாக இருப்பதாகக் கூறுகிறது, எனவே meta/info.json இலிருந்து எண்ணிக்கையைப் படிக்கவும், இரண்டையும் மேற்கோள் காட்ட வேண்டாம்.
ஓப்பன் எக்ஸ்-எம்பாடிமென்ட்
அதே அர்த்தத்தில் ஒரு தரவுத்தொகுப்பு அல்ல: 34 ஆய்வகங்களில் இருந்து 60 ஏற்கனவே உள்ள ரோபோ தரவுத்தொகுப்புகள் ஒரு RLDS தொகுப்பில் சேர்க்கப்பட்டு, 22 உருவகங்கள் மற்றும் ஒரு மில்லியனுக்கும் அதிகமான பாதைகளை உள்ளடக்கியது. BridgeData V2 ஆனது bridge_orig ஆக அதற்குள் உள்ளது; google_robot ஸ்லைஸ், fractal20220817_data, 3 fps இல் 87,212 எபிசோடுகளாக மாற்றப்படுகிறது.
இந்த தொகுப்பில் ஒரு எச்சரிக்கை உள்ளது, அதை ஆய்வுக் கட்டுரை வெளிப்படையாகக் கூறுகிறது. RT-X சோதனைகளுக்காக, ஆசிரியர்கள் ஒவ்வொரு மூலத்தையும் 7-DoF எண்ட்-எஃபெக்டர் செயலாக மாற்றுகிறார்கள், ஆனால் தரவுத்தொகுப்புகள் முழுவதும் ஒருங்கிணைப்பு சட்டகங்களை சீரமைக்கவில்லை, மேலும் ஒவ்வொரு ரோபோவின் அசல் கட்டுப்பாட்டு திட்டத்தின்படி, செயல் மதிப்புகள் முழுமையான அல்லது சார்பு நிலைகள் அல்லது வேகங்களாக இருக்க அனுமதிக்கின்றன. அவர்களின் முடிவு: ஒரே செயல் திசையன் வெவ்வேறு ரோபோக்களுக்கு மிகவும் மாறுபட்ட இயக்கங்களைத் தூண்டலாம்.

பொருந்தாமை, நான்கு பாகங்களில்
உடல் உருவப் பொருத்தமின்மை பொதுவாக ஒரு தெளிவற்ற பிரச்சனையாகக் கருதப்படுகிறது. இது நான்கு வகையாகும், அவை வெவ்வேறு விதமாகத் தோல்வியடைகின்றன, மேலும் இரண்டை ஸ்கிரிப்டிங் மூலம் சரிசெய்ய முடியாது.
1. சுதந்திரத்தின் நிலைகள்
ஒரு SO-100 ஐந்து கை மூட்டுகளையும் ஒரு கிரிப்பரையும் கொண்டுள்ளது. மோட்டர்களாகக் கணக்கிட்டால் அது ஒரு 6-DoF கை ஆகும், மேலும் SmolVLA ஆய்வுக் கட்டுரை அதை அப்படித்தான் குறிப்பிடுகிறது; நிலைநிறுத்தும் பொறிமுறையாகக் கணக்கிட்டால் அது 5-DoF ஆகும், மேலும் LeRobot அதன் தலைகீழ்-இயக்கவியல் டாக்ஸ்ட்ரிங்கில் அதை அப்படித்தான் குறிப்பிடுகிறது, இது 5-DOF SO-101 இல் மென்மையான-திசை IK ஐ விவரிக்கிறது, அங்கு மணிக்கட்டு திசையை ஓரளவு மட்டுமே கண்காணிக்கிறது. ஒரு Franka ஏழு நிலைநிறுத்தும் மூட்டுகளைக் கொண்டுள்ளது. அந்த இடைவெளி எந்த நிலைகள் உள்ளன என்பதை தீர்மானிக்கிறது: ஒரு 5-DoF கை பொதுவாக ஒரு தன்னிச்சையான நிலை மற்றும் திசையை ஒரே நேரத்தில் அடைய முடியாது, எனவே தீர்வு காண்பவர் முடிந்தவரை நெருக்கமானதை வழங்குகிறது, இது நிரூபிக்கப்பட்ட இயக்கத்திலிருந்து வேறுபட்டது. பின்னணி: .
# src/lerobot/robots/so_follower/so_follower.py
motors = {
"shoulder_pan": Motor(1, "sts3215", norm_mode_body),
"shoulder_lift": Motor(2, "sts3215", norm_mode_body),
"elbow_flex": Motor(3, "sts3215", norm_mode_body),
"wrist_flex": Motor(4, "sts3215", norm_mode_body),
"wrist_roll": Motor(5, "sts3215", norm_mode_body),
"gripper": Motor(6, "sts3215", MotorNormMode.RANGE_0_100),
}
# action keys are "<motor>.pos"; send_action sync_writes them to
# "Goal_Position" -> a 6-D ABSOLUTE JOINT POSITION command
# openpi/src/openpi/policies/droid_policy.py
def make_droid_example() -> dict:
return {
"observation/exterior_image_1_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/wrist_image_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/joint_position": np.random.rand(7), # seven Franka joints
"observation/gripper_position": np.random.rand(1),
"prompt": "do something",
}
# state = concat(joint_position, gripper_pos) -> 8-Dஆகவே, ஒரு ஆயத்த DROID செக்பாயிண்ட் ஒரு குறுக்குவழி அல்ல. Physical Intelligence ஆனது pi05_droid ஐ gs://openpi-assets/checkpoints/pi05_droid இல் வழங்குகிறது, மற்றும் அதன் பரந்த தன்மையைப் பாராட்டும் அதே README, இந்த நிபுணத்துவ செக்பாயிண்ட்கள் உங்கள் அமைப்பிற்குப் பொதுமைப்படுத்தப்படாமல் போகலாம் என்று எச்சரிக்கிறது. அதன் நிலை எட்டு Franka கூட்டு எண்கள் மற்றும் அதன் பட விசைகள் exterior_image_1_left மற்றும் wrist_image_left ஆகும். எந்தக் கொடியும் அதை ஆறு-மோட்டார் SO-100 கட்டளையாக மாற்றாது.
2. செயல் திசையன் உண்மையில் என்ன சொல்கிறது
பரிமாணத்தன்மையை விட ஆழமானது. LeRobot மாற்றங்களில், மூன்றுமே கிரிப்பர் எங்கு செல்ல வேண்டும் என்பதை கார்ட்டீசியன் வெளியில் கூறுகின்றன. ஒரு SO-100 ஆறு சர்வோக்கள் எங்கு செல்ல வேண்டும் என்று கூறுகிறது. மாற்றுவதற்கு ஒரு இயக்கவியல் மாதிரி மற்றும் ஒரு தீர்வு தேவை, மறுவடிவமைப்பு அல்ல.
| பண்பு | LeRobot வடிவத்தில் OXE, DROID மற்றும் Bridge | LeRobot இல் SO-100 |
|---|---|---|
| செயல் திசையன் | 7-D: x, y, z, roll, pitch, yaw, gripper | 6-D: ஒரு மோட்டாருக்கு ஒரு இலக்கு நிலை |
| நிலை திசையன் | 8-D, ஒரு பேட் ஸ்லாட்டுடன் (google_robot ஒரு குவாட்டர்னியனைப் பயன்படுத்துகிறது) | 6-D, ஒரு மோட்டாருக்கு ஒன்று |
| சட்டம் | கார்ட்டீசியன், தரவுத்தொகுப்புகள் முழுவதும் சீரற்றது | கூட்டு வெளி, கைக்குரிய அளவுத்திருத்தம் |
| முழுமையானதா அல்லது சார்புடையதா | ஏதேனும் ஒன்று, மூல ஆய்வகத்தால் தீர்மானிக்கப்பட்டது | முழுமையான இலக்கு நிலைகள் |
| அலகுகள் | தரவுத்தொகுப்புக்கு இயல்பாக்கப்பட்டது, பின்னர் தனித்தனியாக்கப்பட்டது | இயல்பாக டிகிரி (use_degrees=True), இல்லையெனில் -100 முதல் 100 வரை |
| மௌனமான தோல்வி | ஒரு டெல்டா முழுமையானதாகப் படிக்கப்பட்டது | அளவுத்திருத்தம் செய்யப்படாத கை |
openx2lerobot README ஆனது, அது மாற்றும் ஒவ்வொரு தரவுத்தொகுப்பிற்கும் ஒரு ஒருங்கிணைந்த 8-dim நிலை மற்றும் 7-dim செயலை ஆவணப்படுத்துகிறது, இங்கிருந்துதான் pad ஸ்லாட் வருகிறது. DROID-ன் சொந்த RLDS ஸ்கீமா வேறுபடுகிறது: அதன் உயர்-நிலை action என்பது 6 ஜாயிண்ட் வேகங்கள் மற்றும் 1 கிரிப்பர் நிலை கொண்ட ஒரு 7-வெக்டர் ஆகும், இதில் cartesian_position, cartesian_velocity, joint_position மற்றும் joint_velocity ஆகியவை action_dict-ன் கீழ் உள்ளன. openpi ஜாயிண்ட்-ஸ்பேஸ் காட்சியைப் படிக்கிறது, LeRobot உருவாக்கம் உங்களுக்கு கார்ட்டீசியன் காட்சியை வழங்குகிறது. இவை இரண்டும் ஆறு முழுமையான சர்வோ கோணங்கள் அல்ல.
LeRobot விடுபட்ட பகுதியை வழங்குகிறது: SO follower ஆனது InverseKinematicsEEToJoints மற்றும் ForwardKinematicsJointsToEE படிகளைக் கொண்ட ஒரு இயக்கவியல் செயலியைக் கொண்டுள்ளது. அதன் கீகள் ee.x, ee.y, ee.z மற்றும் ஒரு சுழற்சி வெக்டர் ee.wx, ee.wy, ee.wz மற்றும் ee.gripper_pos ஆகும், எனவே கோப்புகளில் உள்ள roll-pitch-yaw-லிருந்து ஓரியண்டேஷன் என்கோடிங் கூட வேறுபடுகிறது. IK படி ஒரு orientation_weight-ஐ எடுத்துக்கொள்கிறது, இயல்புநிலை 0.01 ஆகும், அதன் docstring ஆனது under-actuated arms-ல் position-only IK-க்கு 0.0 என அமைக்க வேண்டும் என்று கூறுகிறது. நீங்கள் பாலத்தை உருவாக்கலாம், ஆனால் கடன் வாங்கப்பட்ட ஒவ்வொரு செயலின் ஓரியண்டேஷன் பாதி தோராயமாகவே இருக்கும்.
3. கட்டுப்பாட்டு விகிதம்
DROID 15 Hz, BridgeData V2 5 Hz, google_robot ஸ்லைஸ் 3 fps; pi0-ன் ஆசிரியர்கள் தங்கள் கலவையின் ஓப்பன் சோர்ஸ் பகுதியை 2 மற்றும் 10 Hz-க்கு இடையில் குறைந்த அதிர்வெண் கட்டுப்பாடு என்று விவரிக்கிறார்கள். LeRobot-ன் DatasetRecordConfig ஆனது இயல்புநிலையாக fps 30, episode_time_s 60, reset_time_s 60, num_episodes 50 என உள்ளது. 5 Hz தரவுகளில் பயிற்சி பெற்ற ஒரு ஒரு செயல் 200 ms-ஐ உள்ளடக்கியது என்று கற்றுக்கொண்டது. அதை 30 Hz-ல் மீண்டும் இயக்கினால் கை ஊர்ந்து செல்லும்; அப்பாவியாக மீண்டும் மாதிரி எடுத்தால், கிரிப்பர் மூடும் பிரேமை நீங்கள் சிதைத்துவிடுவீர்கள். இது உடன் மோசமாக செயல்படுகிறது: ஒரு 100-படி துண்டு 5 Hz-ல் 20 வினாடிகள், 30 Hz-ல் 3.3 வினாடிகள்.
4. கேமராக்கள்
BridgeData V2 ஆனது ஒவ்வொரு 50 பாதைகளுக்கும் இரண்டு கேமரா நிலைகளை சீரற்றதாக்கியது, மேலும் அதன் திட்டப் பக்கம் பெரும்பாலான தரவுகள் நிலையான காட்சியை மட்டுமே கொண்டுள்ளன என்பதைக் குறிப்பிடுகிறது. DROID ஆனது சரிசெய்யக்கூடிய ZED 2 மவுண்ட்கள் மற்றும் ஒரு மணிக்கட்டு ZED மினியைப் பயன்படுத்தியது. நீங்கள் இரண்டு USB வெப்கேமராக்களை கண்ணால் நிலைநிறுத்தியுள்ளீர்கள். கேமரா நிலை ஒரு தொந்தரவான மாறி அல்ல ; இது காட்சி குறியாக்கி முக்கியமாக கவனம் செலுத்தியவற்றில் பெரும்பாலானவை, மேலும் கோப்பு வடிவத்தில் எதுவும் நிலைகள் வேறுபடுகின்றன என்று உங்களுக்குச் சொல்லவில்லை.
துண்டுகள் இயங்குவதற்கு போதுமான அளவு பொருந்துகின்றன. தரவுத்தொகுப்பு ஏற்றப்படுகிறது, பயிற்சி தொடங்குகிறது, இழப்பு குறைகிறது, சரிபார்ப்புப் புள்ளிகள் தோன்றுகின்றன, எதுவும் பிழையாக இல்லை. பின்னர் கொள்கை கையில் அடையாளம் காணக்கூடிய எதையும் செய்யவில்லை, மேலும் உங்கள் பயிற்சி ஸ்கிரிப்டில் ஒரு பிழையைத் தேடி ஒரு நாளை செலவிடுகிறீர்கள். பிழை இல்லை: உங்கள் அறையில் இல்லாத ஒரு ரோபோவிற்கான கார்ட்டீசியன் செயல் விநியோகத்தை மாதிரி கற்றுக்கொண்டது. இழப்பு குறைகிறது, கொள்கை எதுவும் செய்யவில்லை என்பதிலிருந்து தொடங்கவும், உங்கள் ஹைப்பர்பாராமீட்டர்களில் இருந்து அல்ல.
நீங்கள் எப்படியும் தரவை ஒன்றிணைக்க முயற்சிக்கும்போது என்ன நடக்கும்
தெளிவான திட்டம் என்னவென்றால், சில ஆயிரம் DROID எபிசோட்களுடன் உங்கள் 50 எபிசோட்களை இணைப்பதுதான். LeRobot மறுக்கிறது, மேலும் அந்த மறுப்பு வேறுபடும் மூன்று விஷயங்களைக் குறிப்பிடுகிறது.
- 1முழு 1.7 TB ஐ அல்லாமல், 100 எபிசோட் மாதிரியைப் பதிவிறக்கவும்
கட்டமைப்பைப் பார்க்க 2 GB போதுமானது.
bashpip install gsutil tensorflow tensorflow-datasets gsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 2RLDS ஐ LeRobot வடிவத்திற்கு மாற்றவும்
openx2lerobot ஆனது OXE நிலையான மாற்றங்களை உள்ளடக்கியது மற்றும் ரோபோ வகை மற்றும் கட்டுப்பாட்டு அதிர்வெண்ணைக் குறிக்கிறது. README இதை convert.sh இல் குறிப்பிடுகிறது.
bashgit clone https://github.com/Tavish9/any4lerobot.git cd any4lerobot/openx2lerobot python openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 3மற்ற எதற்கும் முன் meta/info.json ஐப் படிக்கவும்
உங்கள் நாளின் மீதிப் பகுதி செயல்படுகிறதா என்பதை இந்த கோப்பு தீர்மானிக்கிறது.
bashpython -c "import json;d=json.load(open('meta/info.json'));\ print(d['codebase_version'], d['robot_type'], d['fps']);\ print(d['features']['action']['shape'], d['features']['observation.state']['shape'])" - 4இணைப்பை முயற்சி செய்து பிழையைப் படிக்கவும்
merge ஆனது ஒவ்வொரு தரவுத்தொகுப்பையும் ஏற்றுகிறது, பின்னர் validate_all_metadata ஆனது fps, robot_type மற்றும் அம்சங்களை பட்டியலில் உள்ள முதல் தரவுத்தொகுப்புடன் சரிபார்க்கிறது, முதல் பொருந்தாத தன்மையில் பிழையை எழுப்புகிறது.
bashlerobot-edit-dataset \ --new_repo_id you/mixed \ --operation.type merge \ --operation.repo_ids "['you/droid100_lerobot', 'you/my_so100_task']" # ValueError: Same fps is expected, but got fps=30 instead of 15.
குறிப்பு மதிப்புகள் நீங்கள் முதலில் பட்டியலிட்ட தரவுத்தொகுப்பிலிருந்து வருகின்றன, அதனால்தான் செய்தி DROID இன் 15 fps ஐப் பற்றி அல்லாமல் உங்கள் 30 fps ஐப் பற்றி புகார் செய்கிறது. fps ஐ சரிசெய்தால், robot_type சரிபார்ப்பை எதிர்கொள்வீர்கள்; அதை சரிசெய்தால், அம்ச சரிபார்ப்பை எதிர்கொள்வீர்கள், செயலுக்கு 6 க்கு எதிராக 7. எந்த வரிசைப்படுத்தலும் ஏற்கப்படாது, மேலும் sanity_check_dataset_robot_compatibility வழியாக பதிவு செய்யும் நேரத்தில் அதே பாதுகாப்புச் சரிபார்ப்பு இயங்கும்.
தற்போதைய LeRobot மெயினில் so100_follower மற்றும் so101_follower இரண்டும் ஒரு பகிரப்பட்ட SOFollowerRobotConfig இல் பதிவு செய்யப்பட்டுள்ளன, எனவே ஒரு உண்மையான பதிவிலிருந்து வரும் சரம் நீங்கள் எதிர்பார்ப்பது போல் இருக்காது. அதை உங்கள் சொந்த meta/info.json இலிருந்து படித்து, நீங்கள் முடக்க வேண்டிய ஒரு சரிபார்ப்பை உங்களுக்கு ஏதோ சொல்லும் ஒரு சரிபார்ப்பாகக் கருதுங்கள்.
உண்மையில் என்ன மாற்றப்படுகிறது?
எடை மதிப்புகள், எபிசோடுகள் அல்ல. ஒவ்வொரு நவீன பொதுவான கொள்கையும் முன்-பயிற்சியில் சிலவற்றை உள்வாங்கிக் கொண்டது, மேலும் நீங்கள் வெளியிடப்பட்ட ஒரு இலிருந்து செய்யும்போது, அதைச் சரியாகச் செய்யத் தேவையான கணக்கீட்டுத் திறன் கொண்டவர்களால் ஏற்கனவே சரிசெய்யப்பட்டதை நீங்கள் பெறுகிறீர்கள். pi0 இன் ஆய்வறிக்கை விகிதம் குறித்து வெளிப்படையாக உள்ளது: அதன் முன்-பயிற்சி கலவையின் 9.1 சதவீதம், நேரப்படிகளில் கணக்கிடப்படும்போது, OXE, Bridge v2 மற்றும் DROID உள்ளிட்ட திறந்த மூலத் தரவுகளாகும். இந்த எண்ணிக்கை pi0 இன் கணக்கீடு; ஒவ்வொரு விற்பனையாளரின் கலவையும் வேறுபடும்.
- காட்சி மற்றும் மொழி முன்னுரிமைகள்: என்கோடர் ஆயிரக்கணக்கான சமையலறைகளையும் குவளைகளையும் பார்த்துள்ளது மற்றும் "சிவப்பு தொகுதி" எதைக் குறிக்கிறது என்பதை அறிந்திருக்கிறது.
- கையாளுதல் அமைப்பு மீதான ஒரு முன்னுரிமை: அணுகுதல், மூடுதல், தூக்குதல், கொண்டு செல்லுதல், விடுவித்தல், எண்கள் இல்லாவிட்டாலும் உருவமைப்பு-சுதந்திரமானது.
- சோதனைக்கான அறியப்பட்ட-நல்ல தரவுத்தொகுப்பு. உங்கள் பணி 100 DROID எபிசோடுகளை மிகையாகப் பொருத்த முடியாவிட்டால், சிக்கல் உங்கள் அமைப்பில் உள்ளது.
- குறிப்புப் புள்ளிகள்: சிறிய அளவிலான தரவுத்தொகுப்பு களங்களில் RT-1-X அசல் முறை அல்லது RT-1 ஐ விட 50 சதவீதம் அதிக சராசரி வெற்றி விகிதத்தை அடைந்தது, மேலும் RT-2-X, RT-2 ஐ வளர்ந்து வரும் திறன்களில் சுமார் 3 மடங்கு வென்றது.
- பயன்படுத்தக்கூடிய செயல் மேற்பார்வை இல்லை. ஒரு 7-D கார்ட்டீசியன் இலக்கு ஒரு 6-D கூட்டு கட்டளை அல்ல.
- கேமரா-நிலை மாற்றம் இல்லை, மேலும் தரவுகளில் எதுவும் நிலைகள் வேறுபடுகின்றன என்று உங்களுக்குச் சொல்லவில்லை.
- நேர மாற்றம் இல்லை: 30 fps ரெக்கார்டருக்கு எதிராக 3, 5 மற்றும் 15 fps ஆதாரங்கள்.
- கிரிப்பர் மாற்றம் இல்லை. ஒரு Robotiq 2F-85 மற்றும் STS3215 இல் அச்சிடப்பட்ட தாடை விசை, அசைவு மற்றும் இயக்கவியலில் வேறுபடுகின்றன.
- அளவு மட்டுமே அதன் ஆசிரியர்களுக்கும் போதுமானதாக இல்லை: பெரிய தரவுத்தொகுப்பு களங்களில் RT-1-X, அந்த தரவுத்தொகுப்பில் மட்டும் பயிற்சி பெற்ற RT-1 ஐ வெல்லவில்லை.
- உங்களுக்குத் தேவையான உங்கள் சொந்த எபிசோடுகளின் எண்ணிக்கையில் குறைப்பு இல்லை.
| மாதிரியின் அடுக்கு | மாற்றப்படுகிறதா? | ஏன் |
|---|---|---|
| Vision encoder | ஆம், வலுவாக | பொருட்களும் காட்சிகளும் உருவமைப்பு-சுதந்திரமானவை |
| Language grounding | ஆம் | அறிவுறுத்தல்கள் உரை, வடிவியல் அல்ல |
| Cross-modal fusion | பெரும்பாலும் | தூண்டுதலில் பெயரிடப்பட்ட பொருளுக்கு கவனம் செலுத்துகிறது |
| Proprioception encoder | இல்லை | உள்ளீட்டு பரிமாணம் மற்றும் கூட்டு சொற்பொருள் வேறுபடுகின்றன |
| Action head | இல்லை | நீங்கள் இல்லாத ஒரு 7-D கார்ட்டீசியன் இடத்தில் பயிற்சி பெற்றது |
| Normalisation statistics | இல்லை, மற்றும் ஆபத்தானது | வெளிநாட்டு புள்ளிவிவரங்கள் ஒவ்வொரு கட்டளையையும் மாற்றுகின்றன |
இதனால்தான் SmolVLA குறைந்த விலை கையில் வித்தியாசமாக செயல்படுகிறது. அதன் ஆய்வுக் கட்டுரை Hugging Face இலிருந்து 481 சமூக தரவுத்தொகுப்புகளைத் தேர்ந்தெடுக்கிறது, அவை உடல் வகை, எபிசோட் எண்ணிக்கை, தரவுத் தரம் மற்றும் பிரேம் கவரேஜ் ஆகியவற்றின் அடிப்படையில் வடிகட்டப்படுகின்றன: 22.9K எபிசோடுகள், 10.6M பிரேம்கள், உண்மையான SO-100 மற்றும் SO-101 கைகளில் மதிப்பீடு செய்யப்பட்டன. சிறிய மற்றும் பொருத்தமானவை பெரிய மற்றும் பொருந்தாதவற்றை வெல்லும். ஒப்பிடுக: ACT எதிராக SmolVLA.
மேற்கொள்ள வேண்டிய மூன்று வழிகள்
வழி A: ஏற்கனவே தரவை உட்கொண்ட ஒரு செக்பாயிண்டிலிருந்து ஃபைன்-ட்யூன் செய்தல்
பெரும்பாலான மக்கள் இதைத் தேர்ந்தெடுக்க வேண்டும். நீங்கள் DROID அல்லது Open X-Embodiment ஐ ஒருபோதும் தொடக்கூடாது: குறுக்கு-உடல் தரவை ஏற்கனவே உறிஞ்சிய ஒரு கொள்கையைத் தேர்ந்தெடுத்து, உங்கள் சொந்த எபிசோடுகளைப் பதிவுசெய்து, ஃபைன்-ட்யூன் செய்யுங்கள்.
| கொள்கை | அளவுகள் | குறைந்தபட்ச எபிசோடுகள் | தரவுத்தொகுப்பு வடிவம் | GPU அடுக்கு | முடிவு | அடிப்படை செக்பாயிண்ட் |
|---|---|---|---|---|---|---|
| GR00T N1.7 | ~3 B, ~40 M trained in fine-tuning | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 152 ms per step | nvidia/GR00T-N1.7-3B |
| GR00T N1.5 | ~3 B | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 165 ms | nvidia/GR00T-N1.5-3B |
| Pi0.5 | ~3 B, PaliGemma backbone | 50 | LeRobot v3.0 | A100 or H100 80 GB | 485 ms | lerobot/pi05_base |
| SmolVLA | ~450 M | 30 | LeRobot v3.0 | RTX 4090 or any 24 GB | 245 ms | lerobot/smolvla_base |
| ACT | ~80 M | 50 | LeRobot v3.0 | RTX 4090 or any 24 GB | 20 ms | none, from scratch |
ACT ஒரு நேர்மையான விளிம்பு நிலை: அடிப்படை மாதிரி இல்லாததால், பொதுத் தரவு எதுவும் அதை அடைவதில்லை. இது தானாகவே ஒரு குறைபாடு அல்ல, ஏனெனில் ஒரு செயல் படிக்கு 20 மில்லி விநாடிகளில், இது ஒரு வேகமான சுழற்சியை முடிக்கக்கூடிய ஐந்து மாதிரிகளில் இது மட்டுமே, ACT பக்கம், விளக்குகிறது. பணியின் அடிப்படையில் தேர்வு செய்ய ஐந்து மாதிரிகளும் ஒப்பிடப்பட்டுள்ளன, GR00T N1.7 against Pi0.5, மற்றும் 85 மாதிரிகளில் 332 பெஞ்ச்மார்க் முடிவுகள் அரங்கில்.
பாதை B: DROID ஐ ஒரு சோதனை சாதனமாகப் பயன்படுத்துதல்
100-எபிசோட் மாதிரி இந்த மாதம் நீங்கள் பதிவிறக்கும் சிறந்த 2 GB ஆகும், இது பயிற்சிக்கு அல்ல. இது சரியான தரவுத்தொகுப்பு என்று உங்களுக்குத் தெரியும். உங்கள் மாற்றி, லோடர் மற்றும் ஒரு சிறிய GPU வேலையை இதில் இயக்கவும்; தோல்வியுற்ற எதுவும் மலிவாக இருக்கும்போதே கண்டறியப்பட்ட ஒரு உள்கட்டமைப்பு பிழை ஆகும். NVIDIA பெரிய அளவில் இதையே செய்கிறது: GR00T N1.7 கார்டு சிம்பிளர்என்வ், பிரிட்ஜ் மற்றும் ஃபிராக்டல், DROID மற்றும் LIBERO க்கான நான்கு பயிற்சிக்குப் பிந்தைய வகைகளை பட்டியலிடுகிறது.
பாதை C: உங்களுடையதை, வேண்டுமென்றே பதிவு செய்யவும்
முப்பது முதல் ஐம்பது 76,000 க்கு அடுத்ததாக இது சிறியதாகத் தோன்றலாம், ஆனால் உங்களுடையது மட்டுமே உங்கள் கை, உங்கள் கேமராக்கள் மற்றும் உங்கள் மேசையுடன் இருப்பதை நீங்கள் நினைவில் கொள்ள வேண்டும். LeRobot இன் இயல்புநிலைகளில், 50 எபிசோடுகள் 100 நிமிடங்கள் ஆகும். காண்க , மற்றும் .

பொதுத் தரவுகளிலிருந்து செயல்படும் கொள்கைக்குச் செல்ல இரண்டு வழிகள்
All of this runs on your own machine plus a rented GPU. Knowing the manual path matters because when something breaks you will know which layer broke.
- 1Install LeRobot with the extras the scripts need
The record and train entry points each declare their own extra.
bashpip install 'lerobot[core_scripts]' # lerobot-record pip install 'lerobot[training]' # lerobot-train pip install gsutil tensorflow tensorflow-datasets - 2Get a small, known-good slice
100 DROID episodes, 2 GB.
bashgsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 3Convert to LeRobot form
Writes the unified 8-D state and 7-D action, annotating robot type and control frequency.
bashpython openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 4Check the version against your trainer
The converter README documents v3.0 output; the published IPEC-COMMUNITY datasets report v2.0. GR00T wants v2.0 or v2.1 and crashes on v3.0; Pi0.5, SmolVLA and ACT want v3.0. Mind the gap: the only conversion script on LeRobot main goes 2.1 to 3.0.
bashpython src/lerobot/scripts/convert_dataset_v21_to_v30.py \ --repo-id=you/droid100_lerobot - 5Record your own episodes
Defaults: 30 fps, 60 s per episode, 60 s reset, 50 episodes. The teleoperator type is so100_leader.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.cameras="{front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --dataset.repo_id=you/so100_pick_block \ --dataset.num_episodes=50 \ --dataset.single_task="Pick up the red block and put it in the bowl" - 6Fine-tune on your data only
Weights from public data, actions from your own. Do not mix the datasets.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=you/so100_pick_block \ --policy.device=cuda \ --batch_size=4 \ --steps=20000
Not in training; the GPU job is hours. The conversion, the version mismatch and the moment you find your dataset is v2.0 and your trainer wants v3.0 are days. Read dataset rejected as v3 first.
The platform removes the GPU and pipeline plumbing. It does not remove the embodiment mismatch: point the trainer at a converted DROID dataset and you get a policy trained on Franka actions, exactly as you would locally.
- 1Pick a policy, not a dataset
The five trainable policies, with parameter counts, GPU tiers and latencies, are at /policies.
- 2Record with the desktop client
It writes LeRobot-format datasets, episodes, camera streams and joint states, straight out of a teleop session. No conversion step to get wrong.
- 3Or bring a dataset you already have
The training form accepts one from /directory, a Hugging Face repo id, or your own machine. A repo id means a converted OXE dataset will load, and the mismatch loads with it.
- 4Train on a rented GPU
The backend rents a card on a spot market by required VRAM. SmolVLA or ACT on 24 GB: 2 to 5 hours, about 1 to 3 USD. GR00T or Pi0.5 on A100 or H100: 3 to 6 hours, about 4 to 12 USD. See /pricing.
- 5Serve it back to the arm
/api/inference/pod auto-provisions a GPU pod serving the policy; the local client talks to that endpoint. Pods carry an idle watchdog and destroy themselves, so nothing keeps billing silently.
Inference has to sit next to the servos for fast tasks. The control loop is 20 to 485 ms per action step depending on the model, and public-internet round trips turn a working policy into a hesitant one. Remote inference is fine for slow pick-and-place, not fast reactive motion.
The platform helps with the boring parts: the right format for the right arm at the right frame rate, and no babysitting a spot instance. It helps with nothing else in this article.

ஒவ்வொரு பாதையின் செலவு
| பாதை | சேமிப்பு | மனித நேரம் | GPU செலவு | உங்கள் கையை நகர்த்தும் வாய்ப்பு |
|---|---|---|---|---|
| மாற்றப்பட்ட DROID மட்டும் | 392 GB | மாற்றத்திற்கான நாட்கள் | 4 to 12 USD | மிகக் குறைவு, தவறான செயல்வெளி |
| உங்கள் அத்தியாயங்களுடன் இணைக்கப்பட்ட DROID | இரண்டும் | validate_all_metadata ஆல் தடுக்கப்பட்டது | பொருந்தாது | ஏதுமில்லை, இது இயங்காது |
| SmolVLA, 30 முதல் 50 சொந்த அத்தியாயங்கள் | சில GB | 100 நிமிட பதிவு | 1 to 3 USD | அதிகம் |
| GR00T N1.7, 50 சொந்த அத்தியாயங்கள் | சில GB | 100 நிமிட பதிவு | 4 to 12 USD | அதிகம் |
| ACT புதிதாக, 50 சொந்த அத்தியாயங்கள் | சில GB | 100 நிமிட பதிவு | 1 to 3 USD | அதிகம், 20 ms ஊகிப்பு |
| சோதனை சாதனமாக DROID மாதிரி | 2 GB | ஒரு பிற்பகல் | ஒரு குறுகிய ஓட்டம் | அதிகம், சரிபார்ப்பாக |
அசமச்சீர்மைதான் முக்கியம்: அதிக தரவுகளைப் பயன்படுத்தும் பாதை மிகவும் விலை உயர்ந்தது மற்றும் உங்கள் கையை நகர்த்துவதற்கான வாய்ப்பு குறைவு. உங்கள் சொந்த இரண்டு மணி நேரத்திற்கும் குறைவான டெலிஆபரேஷன் என்பது மற்றவர்களின் ஃபிராங்காவின் ஒரு டெராபைட்டை விட சிறந்தது. இன்னும் கை இல்லையா? /live பதிவு இல்லாமல் ஒரு இயற்பியல் SO-100 ஐ ஸ்ட்ரீம் செய்கிறது. பின்னர் உங்கள் முதல் கொள்கையைப் பயிற்றுவிக்கவும், மற்றும் SO-100 இல் SmolVLA குறிப்பிட்ட வழிகாட்டிக்கு.
2 GB DROID மாதிரியைப் பதிவிறக்கி, உங்கள் பைப்லைனை நிரூபிக்க அதைப் பயன்படுத்தவும். மற்ற 1.7 TB ஐப் புறக்கணிக்கவும். நிலையான கேமராக்களுடன் ஒரு பணியின் 50 எபிசோட்களைப் பதிவு செய்யவும். முதலில் SmolVLA ஐ ஃபைன்-ட்யூன் செய்யவும், ஏனெனில் 24 GB கார்டில் குறைந்தபட்சம் 30 எபிசோட்களுடன் இது மீண்டும் மீண்டும் செய்வதற்கு மலிவானது, பின்னர் அதே தரவில் GR00T N1.7 ஐ முயற்சிக்கவும். ஒரு பெஞ்ச்மார்க்கில் அல்லாமல், உங்கள் பணியில் ஒப்பிடவும்.
உங்கள் கைக்கு ஏற்கனவே பொருந்தும் தரவுத்தொகுப்புகளைப் பதிவுசெய்யவும்
டெஸ்க்டாப் கிளையன்ட் LeRobot-வடிவமைப்பு தரவுத்தொகுப்புகளை ஒரு டெலிஓப் அமர்விலிருந்து நேரடியாக எழுதுகிறது: சரியான கை, சரியான பிரேம் வீதம், சரியான செயல்வெளி. RLDS மாற்றம் இல்லை, மறுவரைபடம் இல்லை.
டெஸ்க்டாப் கிளையன்ட்டைப் பெறுங்கள்DROID இல் ஒரு கொள்கையைப் பயிற்றுவித்து அதை எனது SO-100 இல் இயக்க முடியுமா?▾
நேரடியாக முடியாது. LeRobot உருவாக்கத்தில் DROID செயல்கள் 15 fps இல் ஒரு Franka Panda இல் 7-D எண்ட்-எஃபெக்டர் கட்டளைகள் ஆகும்; மூல RLDS இல் அவை 6 கூட்டு வேகங்கள் மற்றும் ஒரு கிரிப்பர் நிலை. ஒரு SO-100 6 முழுமையான கூட்டு நிலைகளை எடுக்கும். உங்களுக்கு ஒரு தலைகீழ்-கினெமேடிக்ஸ் அடுக்கு தேவைப்படும், அப்போதும் கூட ஒரு 5-DoF மணிக்கட்டு தன்னிச்சையான 6-DoF போஸ்களை மீண்டும் உருவாக்க முடியாது.
DROID அல்லது Bridge எபிசோட்களை எனது சொந்த SO-100 எபிசோட்களுடன் கலக்க முடியுமா?▾
இல்லை. validate_all_metadata ஆனது ஒரே மாதிரியான fps, robot_type மற்றும் feature schema ஐக் கோருகிறது மற்றும் முதல் பொருந்தாத தன்மையில் ValueError ஐ எழுப்புகிறது. மூன்றுமே வேறுபடுகின்றன: 30 க்கு எதிராக 15 அல்லது 5 fps, உங்கள் கைக்கு எதிராக franka அல்லது widowx, 6 க்கு எதிராக 7 இன் செயல் வடிவங்கள். சரிபார்ப்பை கடக்க மெட்டாடேட்டாவை மீண்டும் எழுதுவது செமண்டிக்ஸை சரிசெய்யாது.
அப்படியானால், குறைந்த விலை கைக்கு Open X-Embodiment பயனற்றதா?▾
இல்லை, ஆனால் அதன் மதிப்பு முன்-பயிற்சியளிக்கப்பட்ட எடைகள் மூலம் உங்களை வந்தடைகிறது, எபிசோட்கள் மூலம் அல்ல. OXE, Bridge v2 மற்றும் DROID உள்ளிட்ட திறந்த மூல தரவுத்தொகுப்புகள் pi0 இன் முன்-பயிற்சி கலவையின் 9.1 சதவீதம் ஆகும், மேலும் NVIDIA ஆனது Bridge, Fractal, DROID மற்றும் LIBERO இல் பிந்தைய பயிற்சி பெற்ற GR00T N1.7 வகைகளை அனுப்புகிறது. நீங்கள் செய்ய முடியாதது என்னவென்றால், அந்த எபிசோட்களை உங்கள் சொந்த பதிவில் இணைப்பது.
பொது குறுக்கு-உருவமைப்பு தரவுகளிலிருந்து எந்த கொள்கை அதிகம் பயனடைகிறது?▾
Pi0.5 மற்றும் GR00T மாதிரிகள் அதிக குறுக்கு-உருவமைப்பு முன்-பயிற்சியைக் கொண்டுள்ளன, ஆனால் SmolVLA பெரும்பாலும் குறைந்த விலை கையில் சிறப்பாக செயல்படுகிறது: அதன் முன்-பயிற்சி தொகுப்பு 481 சமூக தரவுத்தொகுப்புகள், 22.9K எபிசோட்கள் மற்றும் 10.6M பிரேம்கள் ஆகும், இது உண்மையான SO-100 மற்றும் SO-101 கைகளில் மதிப்பிடப்பட்டது. ACT இதற்கு நேர் எதிரானது: அடிப்படை மாதிரி இல்லை, ஒரு செயல் படிக்கு 20 ms.
எனக்கு உண்மையில் எத்தனை சொந்த எபிசோட்கள் தேவை?▾
SmolVLA க்கு 30, GR00T N1.7, GR00T N1.5, Pi0.5 மற்றும் ACT க்கு 50. LeRobot இன் இயல்புநிலைகளான ஒரு எபிசோடுக்கு 60 வி மற்றும் 60 வி மீட்டமைப்பில், 50 எபிசோட்கள் 100 நிமிட சுவர் கடிகார நேரம் ஆகும். கடன் வாங்கப்பட்ட குறுக்கு-உருவமைப்பு தரவு அந்த எண்களைக் குறைக்காது.
Sources
- DROID: ஒரு பெரிய அளவிலான, களத்தில் உள்ள ரோபோ கையாளுதல் தரவுத்தொகுப்பு
- DROID ஆவணங்கள்: பதிவிறக்க அளவுகள் மற்றும் RLDS எபிசோட் ஸ்கீமா
- BridgeData V2: பெரிய அளவில் ரோபோ கற்றலுக்கான ஒரு தரவுத்தொகுப்பு
- BridgeData V2 திட்டப் பக்கம்: அமைப்பு மற்றும் கேமரா கவரேஜ்
- Open X-Embodiment: ரோபோடிக் கற்றல் தரவுத்தொகுப்புகள் மற்றும் RT-X மாதிரிகள்
- Open X-Embodiment திட்டப் பக்கம்
- google-deepmind/open_x_embodiment: தரவுத்தொகுப்பு பட்டியல் மற்றும் RT-1-X சரிபார்ப்புப் புள்ளிகள்
- any4lerobot: openx2lerobot மாற்றி மற்றும் அதன் ஒருங்கிணைந்த 8-D நிலை, 7-D செயல்
- IPEC-COMMUNITY/droid_lerobot: meta/info.json மற்றும் களஞ்சிய அளவு
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: 3 fps இல் google_robot ஸ்லைஸ்
- huggingface/lerobot: SO பின்தொடர்பவர், இயக்கவியல் செயலி, ஒருங்கிணைப்பு மற்றும் பதிவு உள்ளமைவுகள்
- openpi: DROID கொள்கை உள்ளீடுகள் மற்றும் pi05_droid சரிபார்ப்புப் புள்ளி
- pi0: பொது ரோபோ கட்டுப்பாட்டிற்கான ஒரு பார்வை-மொழி-செயல்பாட்டு ஓட்ட மாதிரி
- SmolVLA: மலிவான மற்றும் திறமையான ரோபோடிக்ஸிற்கான ஒரு பார்வை-மொழி-செயல்பாட்டு மாதிரி
Sources
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- DROID docs: download sizes and the RLDS episode schema
- BridgeData V2: A Dataset for Robot Learning at Scale
- BridgeData V2 project page: composition and camera coverage
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Open X-Embodiment project page
- google-deepmind/open_x_embodiment: dataset list and RT-1-X checkpoints
- any4lerobot: the openx2lerobot converter and its unified 8-D state, 7-D action
- IPEC-COMMUNITY/droid_lerobot: meta/info.json and repo size
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: the google_robot slice at 3 fps
- huggingface/lerobot: SO follower, kinematics processor, aggregate and record configs
- openpi: DROID policy inputs and the pi05_droid checkpoint
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started