
DROID, BridgeData V2 және Open X-Embodiment 6 және 7 еркіндік дәрежелі қолдарда 7-D соңғы эффектілік әрекеттерге түрленеді. SO-100 6 буын позициясын қабылдайды. Не ауысады, не ауыспайды, оның орнына не істеу керек.
Қысқаша нұсқасы
- •Үшеуінің де LeRobot құрастырулары бір конвенцияны бөліседі: 7-D соңғы эффекті әрекеті [x, y, z, roll, pitch, yaw, gripper] және толтыру ұясы бар 8-D күйі. SO-100 алты абсолютті буын позициясын қабылдайды.
- •Бұл 7-D векторы конвертердің артефактісі: DROID-тың өзінің RLDS әрекет өрісі 6 буын жылдамдығы мен қысқыш позициясынан тұрады, Cartesian көрінісі action_dict ішінде.
- •Төрт сағат: DROID 15 fps, BridgeData V2 5 fps, google_robot кесіндісі 3 fps, SO-100 жазбасы 30 fps.
- •Оларды өзіңіздің деректеріңізбен біріктіре алмайсыз. validate_all_metadata fps, robot_type немесе ерекшеліктердің біріншісінде айырмашылық болса, қате жібереді, ал үшеуі де әртүрлі.
- •Тасымалданатыны алдын ала оқытылған салмақтар, эпизодтар емес. Ашық бастапқы деректер pi0-дің алдын ала оқыту қоспасының 9.1 пайызын құрайды.
- •Олардың ең арзан нақты қолданысы – сынақ құрылғысы: демалыс күндері жазбас бұрын құбырыңызды дәлелдейтін, белгілі-жақсы 2 ГБ, 100 эпизодты DROID үлгісі.
Google Cloud шелегінде миллион траекториялы жалпыға қолжетімді деректер жинағы және SO-100 үстелде тұрған, бөлшектері 110-150 EUR тұратын SO-100 бар. Неліктен біріншісі екіншісін үйрете алмайды? Ол ішінара үйрете алады, бірақ тасымалдаудың ешқайсысы адамдар күткен жерде болмайды, ал ең оңай болып көрінетін бөлігі мүлдем жұмыс істемейді.
Төмендегілер: ішінде не бар DROID, BridgeData V2 және Open X-Embodiment, мұнда әрқайсысы арзан 5-DoF қолмен қақтығысады және оның орнына не істеу керек. Төмендегі әрбір сан тиісті мақаладан, деректер жинағы картасынан немесе бастапқы файлдан алынған.
Үш деректер жинағында не бар
| DROID | BridgeData V2 | Open X-Embodiment | |
|---|---|---|---|
| Робот | Franka Panda, 7 DoF, Robotiq 2F-85 | WidowX 250, 6 DoF, ~4,000 USD қондырғысы | 22 іске асыру, 60 деректер жинағы, 34 зертхана |
| Масштаб | 76 мың траектория, 350 сағат | 60,096 траектория | 1М+ траектория, 527 дағды |
| Әртүрлілік | 564 көрініс, 84 тапсырма, 50 жинақтаушы | 24 орта, 13 дағды | 160,266 тапсырма, 21 мекеме |
| Құрамы | барлығы телебасқарылатын | 50,365 телебасқарылатын, 9,731 сценарийленген | әрбір бастапқы зертханаға |
| Басқару жылдамдығы | 15 Гц | 5 Гц | әр түрлі, 3 кадр/сек жоғары |
| Камералар | 2 x ZED 2 сыртқы, 1 x ZED Mini білек | 4-ке дейін, көптеген эпизодтарда тек бекітілгені | зертхана қолданған кез келген |
| Шикі жүктеу | 1.7 ТБ RLDS, 8.7 ТБ шикі стерео | JPEG мұрағаттары | деректер жинағына арналған TFDS шелектері |
1.7 ТБ RLDS TFRecords деректерін әлі де аз адамдар жүктейді. Қауымдастық ұйымы IPEC-COMMUNITY Open X-Embodiment деректерінің көп бөлігін AV1 бейнесімен LeRobot деректер жинағы форматында қайта жариялады, мұнда DROID 392 ГБ алады. Сіз жұмыс істейтін нұсқа осы, және оның meta/info.json файлын бірінші оқу керек.
DROID
Үшеуінің ішіндегі ең стандартталғаны. Барлық жерде бір қондырғы: Robotiq 2F-85 қысқышы бар Franka Panda, екі реттелетін ZED 2 стерео камерасы және білекке арналған ZED Mini, Meta Quest 2 контроллерлерімен телебасқарылатын, Polymetis арқылы 15 Гц жиілікте буын және соңғы эффекті кеңістігінде. Тіл белгілері кейінірек tasq.ai арқылы, әрбір эпизодқа.
- 76k траектория, 350 сағат, 564 көрініс, 84 тапсырма, үш континентте 50 коллектор.
- Негізгі нәтиже жеке оқыту емес, бірлескен оқыту болып табылады: домен ішіндегі демонстрациялармен 50/50 араласқан топтамалар келесі ең жақсы әдістен таратуда абсолютті сәттілік бойынша 22 пайызға, одан тыс 17 пайызға асып түсті.
- IPEC-COMMUNITY/droid_lerobot: 92,233 episodes, 27,044,326 frames, franka, 15 fps, codebase_version v2.0, three AV1 streams at 180x320, 392 GB.
- 2 ГБ, 100 эпизодтық жөндеу үлгісі gs://gresearch/robotics/droid_100 мекенжайында орналасқан. Сол жерден бастаңыз.
BridgeData V2
Хобби қондырғысына ең жақын: WidowX 250 6-DoF қолы, 24 ортада және 13 дағдыда 5 Гц жиілікпен 60,096 траектория. Құрамын ескеріңіз: 50,365 сарапшы телеоперациялық демонстрациялар және рандомизацияланған сценарийлік таңдау-орналастыру саясатынан 9,731, яғни шамамен 16 пайызы адам демонстрациясы емес, бұл маңызды имитациялық оқыту сапасы үшін. Әдеттегі жүктеу, IPEC-COMMUNITY/bridge_orig_lerobot, 53,192 эпизод және 1,893,026 кадрды 5 fps жылдамдықпен, robot_type widowx деп хабарлайды: мақаладағы 60,096-дан аз, сондықтан екеуін де келтірмей, санды meta/info.json файлынан оқыңыз.
Open X-Embodiment
Дәл сол мағынадағы деректер жинағы емес: 34 зертханадан алынған 60 қолданыстағы робот деректер жинағы 22 іске асыруды және миллионнан астам траекторияны қамтитын бір RLDS жинағына біріктірілген. BridgeData V2 оның ішінде bridge_orig ретінде орналасқан; google_robot бөлігі, fractal20220817_data, 3 кадр/сек жылдамдықпен 87,212 эпизодқа түрленеді.
Біріктірудің мақалада ашық айтылған бір ескертуі бар. RT-X эксперименттері үшін авторлар әрбір дереккөзді 7 еркіндік дәрежесі бар соңғы эффектор әрекетіне түрлендіреді, бірақ деректер жинақтары бойынша координаттар жүйелерін тураламайды және әрекет мәндеріне әр роботтың бастапқы басқару схемасына сәйкес абсолютті немесе салыстырмалы позициялар немесе жылдамдықтар болуына рұқсат береді. Олардың қорытындысы: бірдей әрекет векторы әртүрлі роботтар үшін өте әртүрлі қозғалыстарды тудыруы мүмкін.

Сәйкессіздік, төрт бөлімде
Денелік сәйкессіздік әдетте бір бұлыңғыр мәселе ретінде қарастырылады. Олар төртеу, әртүрлі жолмен істен шығады және екеуін скрипт арқылы түзету мүмкін емес.
1. Еркіндік дәрежелері
SO-100-де бес қол буыны және қысқыш бар. Моторлар ретінде санағанда, бұл 6-DoF қол, және SmolVLA мақаласы оны солай атайды; позициялау механизмі ретінде санағанда, бұл 5-DoF, және LeRobot оны өзінің кері кинематикалық құжатында солай атайды, ол білек бағдарды тек ішінара бақылайтын 5-DOF SO-101-дегі жұмсақ бағдарлы IK-ді сипаттайды. Franka-да жеті позициялау буыны бар. Бұл айырмашылық қандай позалардың бар екенін анықтайды: 5-DoF қол әдетте бір уақытта кез келген позиция мен бағдарға жете алмайды, сондықтан шешуші көрсетілген қозғалыстан өзгеше, ең жақын нұсқаны қайтарады. Анықтама: .
# src/lerobot/robots/so_follower/so_follower.py
motors = {
"shoulder_pan": Motor(1, "sts3215", norm_mode_body),
"shoulder_lift": Motor(2, "sts3215", norm_mode_body),
"elbow_flex": Motor(3, "sts3215", norm_mode_body),
"wrist_flex": Motor(4, "sts3215", norm_mode_body),
"wrist_roll": Motor(5, "sts3215", norm_mode_body),
"gripper": Motor(6, "sts3215", MotorNormMode.RANGE_0_100),
}
# action keys are "<motor>.pos"; send_action sync_writes them to
# "Goal_Position" -> a 6-D ABSOLUTE JOINT POSITION command
# openpi/src/openpi/policies/droid_policy.py
def make_droid_example() -> dict:
return {
"observation/exterior_image_1_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/wrist_image_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/joint_position": np.random.rand(7), # seven Franka joints
"observation/gripper_position": np.random.rand(1),
"prompt": "do something",
}
# state = concat(joint_position, gripper_pos) -> 8-DДайын DROID чекпойнты қысқа жол емес. Physical Intelligence pi05_droid-ті gs://openpi-assets/checkpoints/pi05_droid мекенжайында жеткізеді, және оның кеңдігін мақтайтын сол README бұл сарапшы чекпойнттары сіздің орнатуыңызға жалпыланбауы мүмкін екенін ескертеді. Оның күйі сегіз Franka буын нөмірлерінен тұрады және оның кескін кілттері exterior_image_1_left және wrist_image_left. Ешбір флаг оны алты моторлы SO-100 командасына айналдырмайды.
2. Әрекет векторы іс жүзінде не айтады
Өлшемділіктен тереңірек. LeRobot түрлендірулерінде үшеуі де ұстағыш қайда баруы керектігін, Картезиан кеңістігінде айтады. SO-100 алты серво қайда баруы керектігін айтады. Түрлендіру үшін кинематикалық модель мен шешуші қажет, қайта пішімдеу емес.
| Сипаттама | LeRobot пішіміндегі OXE, DROID және Bridge | LeRobot-тағы SO-100 |
|---|---|---|
| Әрекет векторы | 7-D: x, y, z, roll, pitch, yaw, ұстағыш | 6-D: әр моторға бір мақсатты позиция |
| Күй векторы | 8-D, толтыру ұясымен (google_robot кватернионды қолданады) | 6-D, әр моторға бір |
| Кадр | Картезиандық, деректер жиынтықтары бойынша тураланбаған | буын кеңістігі, қол бойынша калибрлеу |
| Абсолютті немесе салыстырмалы | екеуі де, бастапқы зертхана шешеді | абсолютті мақсатты позициялар |
| Бірліктер | деректер жиынтығы бойынша қалыпқа келтірілген, содан кейін дискреттелген | әдепкі бойынша градуспен (use_degrees=True), әйтпесе -100-ден 100-ге дейін |
| Үнсіз сәтсіздік | абсолютті ретінде оқылған дельта | калибрленбеген қол |
The openx2lerobot README құжаты әрбір түрлендірілетін деректер жиынтығы үшін бірыңғай 8-dim күйі мен 7-dim әрекетін құжаттайды, бұл pad ұясының шығу тегі. DROID-тің өзінің RLDS схемасы ерекшеленеді: оның жоғарғы деңгейдегі action 6 буын жылдамдығы мен 1 қысқыш позициясынан тұратын 7-вектор болып табылады, cartesian_position, cartesian_velocity, joint_position және joint_velocity action_dict астында орналасқан. openpi буын кеңістігін оқиды, LeRobot құрастыруы сізге Декарттық нұсқаны береді. Екеуі де алты абсолютті серво бұрышы емес.
LeRobot жетіспейтін бөлікті жеткізеді: SO follower-да InverseKinematicsEEToJoints және ForwardKinematicsJointsToEE қадамдары бар кинематикалық процессор бар. Оның кілттері ee.x, ee.y, ee.z плюс айналу векторы ee.wx, ee.wy, ee.wz және ee.gripper_pos, сондықтан бағдарды кодтау файлдардағы roll-pitch-yaw-дан ерекшеленеді. IK қадамы orientation_weight параметрін қабылдайды, әдепкі мәні 0.01, оның docstring-і жеткіліксіз басқарылатын қолдарда тек позициялық IK үшін 0.0 мәнін орнатуды айтады. Сіз көпірді сала аласыз, бірақ әрбір алынған әрекеттің бағдар жартысы жуықталған күйде қалады.
3. Басқару жылдамдығы
DROID 15 Гц, BridgeData V2 5 Гц, google_robot бөлігі 3 кадр/сек; pi0 авторлары өз қоспасының ашық бастапқы бөлігін 2 мен 10 Гц аралығындағы төмен жиілікті басқару ретінде сипаттайды. LeRobot's DatasetRecordConfig әдепкі бойынша fps 30, episode_time_s 60, reset_time_s 60, num_episodes 50. 5 Гц деректермен үйретілген бір әрекеттің 200 мс қамтитынын білді. Оны 30 Гц жиілікте қайта ойнатсаңыз, қол баяу қозғалады; қарапайым қайта іріктеу арқылы қысқыш жабылған кадрды бұзасыз. Ол сондай-ақ мен нашар әрекеттеседі: 100 қадамдық бөлік 5 Гц жиілікте 20 секунд, 30 Гц жиілікте 3.3 секунд.
4. Камералар
BridgeData V2 әр 50 траектория сайын екі камераның орналасуын кездейсоқ етіп өзгертті, және оның жоба бетінде деректердің көп бөлігі тек бекітілген көріністі ғана қамтитыны атап өтілген. DROID реттелетін ZED 2 бекіткіштерін және білекке арналған ZED Mini-ді қолданды. Сізде көзбен орналастырылған екі USB веб-камера бар. Камераның орналасуы үшін мазасыз айнымалы емес ; бұл визуалды кодтағыштың негізгі кілті болған нәрсенің көп бөлігі, және файл пішімінде ешнәрсе сізге позалардың әртүрлі екенін айтпайды.
Бөлшектер жұмыс істеу үшін жеткілікті түрде біріктірілген. Деректер жинағы жүктеледі, оқыту басталады, шығын азаяды, бақылау нүктелері пайда болады, қателер жоқ. Содан кейін саясат қолда ешқандай танылатын әрекет жасамайды және сіз бір күнді оқыту сценарийіңіздегі қатені іздеумен өткізесіз. Қате жоқ: модель сіздің бөлмеңізде жоқ робот үшін Декарттық әрекет таралуын үйренді. Гиперпараметрлеріңізден емес, шығын азаяды, саясат ештеңе істемейді деген жерден бастаңыз.
Деректерді біріктіруге тырысқанда не болады
Айқын жоспар - біріктіру: бірнеше мың DROID эпизодтары мен сіздің 50-іңіз. LeRobot бас тартады, және бас тарту үш түрлі нәрсені атайды.
- 1Толық 1.7 ТБ емес, 100 эпизодтық үлгіні жүктеп алыңыз
2 ГБ құрылымды көруге жеткілікті.
bashpip install gsutil tensorflow tensorflow-datasets gsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 2RLDS-ті LeRobot пішіміне түрлендіру
openx2lerobot OXE стандартты түрлендірулерін орап, робот түрін және басқару жиілігін белгілейді. README мұны convert.sh файлына орналастырады.
bashgit clone https://github.com/Tavish9/any4lerobot.git cd any4lerobot/openx2lerobot python openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 3Басқа ештеңе істемей тұрып meta/info.json файлын оқыңыз
Бұл файл күніңіздің қалған бөлігінің жұмыс істейтінін шешеді.
bashpython -c "import json;d=json.load(open('meta/info.json'));\ print(d['codebase_version'], d['robot_type'], d['fps']);\ print(d['features']['action']['shape'], d['features']['observation.state']['shape'])" - 4Біріктіруді қолданып көріңіз және қатені оқыңыз
merge әрбір деректер жинағын жүктейді, содан кейін validate_all_metadata fps, robot_type және мүмкіндіктерді тізімдегі біріншіге қарсы тексереді, бірінші сәйкессіздікте қате шығарады.
bashlerobot-edit-dataset \ --new_repo_id you/mixed \ --operation.type merge \ --operation.repo_ids "['you/droid100_lerobot', 'you/my_so100_task']" # ValueError: Same fps is expected, but got fps=30 instead of 15.
Анықтамалық мәндер сіз бірінші тізімдеген деректер жинағынан алынады, сондықтан хабарлама DROID-тің 15-і емес, сіздің 30 fps туралы шағымданады. fps-ті түзетіңіз, сонда сіз robot_type тексеруіне тап боласыз; оны түзетіңіз, сонда сіз мүмкіндіктерді тексеруіне тап боласыз, әрекет үшін 6-ға қарсы 7. Ешқандай реттеу өтпейді, және дәл сол қорғаушы sanity_check_dataset_robot_compatibility арқылы жазу кезінде іске қосылады.
Қазіргі LeRobot main-да so100_follower және so101_follower екеуі де бір ортақ SOFollowerRobotConfig-ке тіркелген, сондықтан нақты жазбадан алынған жол сіз күткендей болмауы мүмкін. Оны өзіңіздің meta/info.json файлыңыздан оқыңыз және өшіруге тура келген тексеруді сізге бірдеңе айтып тұрған тексеру ретінде қарастырыңыз.
Сонымен, нақты не беріледі?
Эпизодтар емес, салмақтар. Әрбір заманауи жалпылама саясат оның бір бөлігін алдын ала оқытуда сіңірді, және сіз дәлдеп баптау шығарылған бақылау нүктесінен арқылы оны дұрыс орындауға есептеу қуаты бар адамдармен келісілген күйінде мұра етесіз. pi0-дің мақаласы пропорция туралы ашық айтады: оның алдын ала оқыту қоспасының 9.1 пайызы, уақыт қадамдарымен есептегенде, OXE, Bridge v2 және DROID сияқты ашық бастапқы деректер болып табылады. Бұл көрсеткіш pi0-ге тиесілі; әр жеткізушінің қоспасы әртүрлі.
- Визуалды және тілдік алғышарттар: кодтағыш мыңдаған асүйлер мен кружкаларды көрген және «қызыл блок» нені білдіретінін біледі.
- Манипуляция құрылымына қатысты алғышарт: жақындау, жабу, көтеру, тасымалдау, босату, сандар болмаса да, денеге тәуелсіз.
- Тестілеуге арналған белгілі, жақсы деректер жиынтығы. Егер сіздің жұмысыңыз 100 DROID эпизодын шамадан тыс үйрете алмаса, мәселе сіздің орнатуыңызда.
- Анықтамалық нүктелер: шағын масштабты деректер жиынтығы домендерінде RT-1-X бастапқы әдіс немесе RT-1-ге қарағанда орташа сәттілік деңгейін 50 пайызға арттырды, ал RT-2-X пайда болған дағдылар бойынша RT-2-ден шамамен 3 есе асып түсті.
- Қолдануға жарамды әрекетті бақылау жоқ. 7-D Декарттық нысана 6-D буындық команда емес.
- Камераның позасын тасымалдау жоқ, және деректерде позалардың әртүрлі екенін көрсететін ештеңе жоқ.
- Уақытты тасымалдау жоқ: 30 кадр/сек жазу құрылғысына қарсы 3, 5 және 15 кадр/сек көздер.
- Қысқышты тасымалдау жоқ. Robotiq 2F-85 және STS3215-тегі басып шығарылған жақ күші, жүрісі және динамикасы бойынша ерекшеленеді.
- Масштабтың өзі авторлар үшін де жеткіліксіз болды: үлкен деректер жиынтығы домендерінде RT-1-X тек сол деректер жиынтығында оқытылған RT-1-ді жеңе алмады.
- Өзіңіздің эпизодтарыңыздың қажетті санының азаюы жоқ.
| Модель қабаты | Беріле ме? | Неліктен |
|---|---|---|
| Көру кодтағышы | Иә, қатты | Нысандар мен көріністер денеге тәуелсіз |
| Тілдік негіздеу | Иә | Нұсқаулар мәтін, геометрия емес |
| Кросс-модальды біріктіру | Көбінесе | Нұсқауда аталған нысанға назар аударады |
| Проприоцепция кодтағышы | Жоқ | Кіріс өлшемі мен буын семантикасы әртүрлі |
| Әрекет басы | Жоқ | Сіз жоқ 7-D Декарттық кеңістікте оқытылған |
| Қалыпқа келтіру статистикасы | Жоқ, және қауіпті | Бөгде статистика әр команданы ығыстырады |
Сондықтан SmolVLA арзан қолда басқаша әрекет етеді. Оның мақаласында Hugging Face-тен 481 қауымдастық деректер жиынтығы таңдалған, олар дене түрі, эпизод саны, деректер сапасы және кадр қамтуы бойынша сүзілген: 22.9K эпизод, 10.6M кадр, нақты SO-100 және SO-101 қолдарында бағаланған. Кішкентай және сәйкес келгені үлкен және сәйкес келмегеннен жақсы. Салыстырыңыз ACT SmolVLA-ға қарсы.
Жүруге тұрарлық үш жол
А жолы: деректерді сіңіріп қойған бақылау нүктесінен дәлдеп баптау
Көпшілік осы жолды таңдауы керек. Сіз DROID немесе Open X-Embodiment-ке ешқашан тиіспейсіз: алдын ала оқытуы кросс-дене деректерін сіңіріп қойған саясатты таңдаңыз, өзіңіздің эпизодтарыңызды жазыңыз, дәлдеп баптаңыз.
| Саясат | Параметрлер | Мин. эпизодтар | Деректер жинағының форматы | GPU деңгейі | Қорытынды | Базалық бақылау нүктесі |
|---|---|---|---|---|---|---|
| GR00T N1.7 | ~3 B, ~40 M trained in fine-tuning | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 152 ms per step | nvidia/GR00T-N1.7-3B |
| GR00T N1.5 | ~3 B | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 165 ms | nvidia/GR00T-N1.5-3B |
| Pi0.5 | ~3 B, PaliGemma backbone | 50 | LeRobot v3.0 | A100 or H100 80 GB | 485 ms | lerobot/pi05_base |
| SmolVLA | ~450 M | 30 | LeRobot v3.0 | RTX 4090 or any 24 GB | 245 ms | lerobot/smolvla_base |
| ACT | ~80 M | 50 | LeRobot v3.0 | RTX 4090 or any 24 GB | 20 ms | none, from scratch |
ACT – бұл адал шекті жағдай: базалық модель жоқ, сондықтан оған ешбір жалпыға қолжетімді деректер жетпейді. Бұл автоматты түрде кемшілік емес, өйткені әрекет қадамына 20 мс жұмсай отырып, ол бес модельдің ішінде жылдам циклді жаба алатын жалғыз модель, мұны ACT беті, көрсетеді. Тапсырма бойынша таңдаңыз, қолдана отырып барлық бес модельді салыстыру, GR00T N1.7 мен Pi0.5-ті салыстыру, және 85 модель бойынша 332 эталондық нәтижелерді аренада.
B жолы: DROID-ты сынақ құрылғысы ретінде пайдалану
100 эпизодтық үлгі – бұл осы айда жүктеп алатын ең жақсы 2 ГБ, және ол оқытуға арналмаған. Бұл дұрыс екенін білетін деректер жинағы. Онда конвертерді, жүктегішті және қысқа GPU жұмысын іске қосыңыз; сәтсіздікке ұшыраған кез келген нәрсе – арзан кезде табылған инфрақұрылымдық қате. NVIDIA мұны ауқымды түрде де жасайды: GR00T N1.7 картасы SimplerEnv-тегі Bridge және Fractal, DROID және LIBERO үшін төрт оқытудан кейінгі нұсқаны тізімдейді.
C жолы: өзіңіздікін әдейі жазыңыз
Отыздан елуге дейін 76 000-ның қасында аз естіледі, бірақ сіздікі сіздің қолыңызбен, камераларыңызбен және үстеліңізбен жалғыз екенін ұмытпаңыз. LeRobot әдепкі параметрлері бойынша, 50 эпизод 100 минут нақты уақытты құрайды. Қараңыз , және .

Жалпы деректерден жұмыс істейтін саясатқа жетудің екі жолы
All of this runs on your own machine plus a rented GPU. Knowing the manual path matters because when something breaks you will know which layer broke.
- 1Install LeRobot with the extras the scripts need
The record and train entry points each declare their own extra.
bashpip install 'lerobot[core_scripts]' # lerobot-record pip install 'lerobot[training]' # lerobot-train pip install gsutil tensorflow tensorflow-datasets - 2Get a small, known-good slice
100 DROID episodes, 2 GB.
bashgsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 3Convert to LeRobot form
Writes the unified 8-D state and 7-D action, annotating robot type and control frequency.
bashpython openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 4Check the version against your trainer
The converter README documents v3.0 output; the published IPEC-COMMUNITY datasets report v2.0. GR00T wants v2.0 or v2.1 and crashes on v3.0; Pi0.5, SmolVLA and ACT want v3.0. Mind the gap: the only conversion script on LeRobot main goes 2.1 to 3.0.
bashpython src/lerobot/scripts/convert_dataset_v21_to_v30.py \ --repo-id=you/droid100_lerobot - 5Record your own episodes
Defaults: 30 fps, 60 s per episode, 60 s reset, 50 episodes. The teleoperator type is so100_leader.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.cameras="{front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --dataset.repo_id=you/so100_pick_block \ --dataset.num_episodes=50 \ --dataset.single_task="Pick up the red block and put it in the bowl" - 6Fine-tune on your data only
Weights from public data, actions from your own. Do not mix the datasets.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=you/so100_pick_block \ --policy.device=cuda \ --batch_size=4 \ --steps=20000
Not in training; the GPU job is hours. The conversion, the version mismatch and the moment you find your dataset is v2.0 and your trainer wants v3.0 are days. Read dataset rejected as v3 first.
The platform removes the GPU and pipeline plumbing. It does not remove the embodiment mismatch: point the trainer at a converted DROID dataset and you get a policy trained on Franka actions, exactly as you would locally.
- 1Pick a policy, not a dataset
The five trainable policies, with parameter counts, GPU tiers and latencies, are at /policies.
- 2Record with the desktop client
It writes LeRobot-format datasets, episodes, camera streams and joint states, straight out of a teleop session. No conversion step to get wrong.
- 3Or bring a dataset you already have
The training form accepts one from /directory, a Hugging Face repo id, or your own machine. A repo id means a converted OXE dataset will load, and the mismatch loads with it.
- 4Train on a rented GPU
The backend rents a card on a spot market by required VRAM. SmolVLA or ACT on 24 GB: 2 to 5 hours, about 1 to 3 USD. GR00T or Pi0.5 on A100 or H100: 3 to 6 hours, about 4 to 12 USD. See /pricing.
- 5Serve it back to the arm
/api/inference/pod auto-provisions a GPU pod serving the policy; the local client talks to that endpoint. Pods carry an idle watchdog and destroy themselves, so nothing keeps billing silently.
Inference has to sit next to the servos for fast tasks. The control loop is 20 to 485 ms per action step depending on the model, and public-internet round trips turn a working policy into a hesitant one. Remote inference is fine for slow pick-and-place, not fast reactive motion.
The platform helps with the boring parts: the right format for the right arm at the right frame rate, and no babysitting a spot instance. It helps with nothing else in this article.

Әр жолдың құны қанша
| Жол | Сақтау орны | Адам уақыты | GPU құны | Қолыңызды қозғалту мүмкіндігі |
|---|---|---|---|---|
| Тек DROID конверттелген | 392 GB | конвертация күндері | 4 to 12 USD | өте төмен, әрекет кеңістігі қате |
| DROID эпизодтарыңызбен біріктірілген | both | blocked by validate_all_metadata | n/a | жоқ, ол іске қосылмайды |
| SmolVLA, 30-дан 50-ге дейін жеке эпизодтар | бірнеше ГБ | 100 мин жазу | 1 to 3 USD | жоғары |
| GR00T N1.7, 50 жеке эпизодтар | бірнеше ГБ | 100 мин жазу | 4 to 12 USD | жоғары |
| ACT нөлден бастап, 50 жеке эпизодтар | бірнеше ГБ | 100 мин жазу | 1 to 3 USD | жоғары, 20 ms қорытынды |
| DROID үлгісі сынақ құрылғысы ретінде | 2 GB | бір түстен кейін | бір қысқа іске қосу | жоғары, валидация ретінде |
Асимметрия мәселесі мынада: ең көп деректерді қарызға алатын жол ең қымбат және қолыңызды қозғалту ықтималдығы ең аз. Өзіңіздің екі сағаттан аз телеоперация біреудің Franka-сының терабайтынан артық. Әлі қолыңыз жоқ па? /live тіркелусіз физикалық SO-100-ді тікелей эфирде көрсетеді. Содан кейін алғашқы саясатыңызды үйретіңіз, және SO-100-дегі SmolVLA арнайы нұсқаулық үшін.
2 ГБ DROID үлгісін жүктеп алып, оны өз желіңізді дәлелдеу үшін пайдаланыңыз. Қалған 1.7 ТБ-ны елемеңіз. Тұрақты камералармен бір тапсырманың 50 эпизодын жазыңыз. Алдымен SmolVLA-ны дәл реттеңіз, себебі 24 ГБ картада ең аз 30 эпизодпен жұмыс істеу ең арзан, содан кейін сол деректерде GR00T N1.7-ні қолданып көріңіз. Өлшемдік көрсеткіштер бойынша емес, өз тапсырмаңыз бойынша салыстырыңыз.
Қолыңызға сәйкес келетін деректер жинақтарын жазыңыз
Дербес компьютер клиенті LeRobot форматындағы деректер жинақтарын телеоперация сеансынан тікелей жазады: дұрыс қол, дұрыс кадр жиілігі, дұрыс әрекет кеңістігі. RLDS түрлендірусіз, қайта карталаусыз.
Дербес компьютер клиентін алыңызDROID-та саясатты үйретіп, оны SO-100-де іске қоса аламын ба?▾
Тікелей емес. LeRobot құрастыруында DROID әрекеттері Franka Panda-да 15 fps жылдамдықпен 7-D соңғы эффектілік командалар болып табылады; бастапқы RLDS-те олар 6 буын жылдамдығы және қысқыш позициясы. SO-100 6 абсолютті буын позициясын қабылдайды. Сізге кері кинематика қабаты қажет болады, тіпті сонда да 5-DoF білезік кез келген 6-DoF позаларды қайталай алмайды.
DROID немесе Bridge эпизодтарын өзімнің SO-100 эпизодтарыммен араластыра аламын ба?▾
Жоқ. validate_all_metadata бірдей fps, robot_type және feature schema талап етеді және бірінші сәйкессіздікте ValueError көтереді. Үшеуі де ерекшеленеді: 15 немесе 5 fps 30-ға қарсы, franka немесе widowx сіздің қолыңызға қарсы, әрекет пішіндері 7 6-ға қарсы. Метадеректерді тексеруден өту үшін қайта жазу семантиканы түзетпейді.
Онда Open X-Embodiment арзан қол үшін пайдасыз ба?▾
Жоқ, бірақ оның құндылығы сізге алдын ала үйретілген салмақтар арқылы жетеді, эпизодтар арқылы емес. OXE, Bridge v2 және DROID сияқты ашық бастапқы деректер жинақтары pi0-дің алдын ала оқыту қоспасының 9.1 пайызын құрайды, ал NVIDIA Bridge, Fractal, DROID және LIBERO-да кейіннен үйретілген GR00T N1.7 нұсқаларын жеткізеді. Сіз жасай алмайтын нәрсе - бұл эпизодтарды өзіңіздің жазбаңызға қосу.
Қай саясат көпшілікке қолжетімді кросс-дене деректерінен ең көп пайда көреді?▾
Pi0.5 және GR00T модельдері кросс-дене алдын ала оқытудың ең көп бөлігін қамтиды, бірақ SmolVLA көбінесе арзан қолда жақсы жұмыс істейді: оның алдын ала оқыту жинағы 481 қауымдастық деректер жинағы, 22.9K эпизод және 10.6M кадрдан тұрады, нақты SO-100 және SO-101 қолдарында бағаланған. ACT керісінше: негізгі модель жоқ, әрекет қадамына 20 мс.
Маған қанша эпизод қажет?▾
SmolVLA үшін 30, GR00T N1.7, GR00T N1.5, Pi0.5 және ACT үшін 50. LeRobot-тың әдепкі параметрлері бойынша эпизодқа 60 с және қалпына келтіруге 60 с болғанда, 50 эпизод 100 минутты құрайды. Қарызға алынған кросс-дене деректері бұл сандарды төмендетпейді.
Sources
- DROID: Үлкен көлемді, нақты жағдайдағы робот манипуляциясы деректер жинағы
- DROID құжаттамасы: жүктеу өлшемдері және RLDS эпизод схемасы
- BridgeData V2: Масштабтағы робот оқытуға арналған деректер жинағы
- BridgeData V2 жобасының беті: құрамы және камера қамтуы
- Open X-Embodiment: Роботтық оқыту деректер жинақтары және RT-X модельдері
- Open X-Embodiment жобасының беті
- google-deepmind/open_x_embodiment: деректер жинағы тізімі және RT-1-X бақылау нүктелері
- any4lerobot: openx2lerobot конвертері және оның бірыңғай 8-D күйі, 7-D әрекеті
- IPEC-COMMUNITY/droid_lerobot: meta/info.json және репо өлшемі
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: 3 fps жылдамдықтағы google_robot кесіндісі
- huggingface/lerobot: SO ізбасары, кинематикалық процессор, жинақтау және жазу конфигурациялары
- openpi: DROID саясат кірістері және pi05_droid бақылау нүктесі
- pi0: Жалпы роботты басқаруға арналған көру-тіл-әрекет ағыны моделі
- SmolVLA: Қолжетімді және тиімді робототехникаға арналған көру-тіл-әрекет моделі
Sources
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- DROID docs: download sizes and the RLDS episode schema
- BridgeData V2: A Dataset for Robot Learning at Scale
- BridgeData V2 project page: composition and camera coverage
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Open X-Embodiment project page
- google-deepmind/open_x_embodiment: dataset list and RT-1-X checkpoints
- any4lerobot: the openx2lerobot converter and its unified 8-D state, 7-D action
- IPEC-COMMUNITY/droid_lerobot: meta/info.json and repo size
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: the google_robot slice at 3 fps
- huggingface/lerobot: SO follower, kinematics processor, aggregate and record configs
- openpi: DROID policy inputs and the pi05_droid checkpoint
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started