
DROID, BridgeData V2 va Open X-Embodiment 6 va 7-DoF qo'llarda 7-D oxirgi effektorni harakatlariga aylanadi. SO-100 6 ta bo'g'in pozitsiyasini qabul qiladi. Nima o'tadi, nima o'tmaydi, buning o'rniga nima qilish kerak.
Qisqacha versiyasi
- •Uchala LeRobot qurilmasi ham bitta konvensiyaga ega: 7-D oxirgi effektorni boshqarish harakati [x, y, z, roll, pitch, yaw, gripper] va toʻldiruvchi uyasi boʻlgan 8-D holat. SO-100 oltita mutlaq boʻgʻin pozitsiyasini oladi.
- •Bu 7-D vektor konvertorning artefaktidir: DROIDning oʻz RLDS harakat maydoni 6 ta boʻgʻin tezligi va tutqich pozitsiyasidan iborat boʻlib, Cartesian koʻrinishi action_dict ichida joylashgan.
- •Toʻrtta soat: DROID 15 fps, BridgeData V2 5 fps, google_robot boʻlagi 3 fps, SO-100 yozuvi 30 fps.
- •Ularni oʻzingizning maʼlumotlaringiz bilan birlashtira olmaysiz. validate_all_metadata fps, robot_type yoki features farq qilgan birinchi joyda xatolik beradi va uchalasi ham farq qiladi.
- •Oʻtkaziladigan narsa oldindan oʻqitilgan vaznlar, epizodlar emas. Ochiq manbali maʼlumotlar pi0 ning oldindan oʻqitish aralashmasining 9.1 foizini tashkil qiladi.
- •Ularning eng arzon haqiqiy qoʻllanilishi sinov moslamasidir: dam olish kunlari yozishdan oldin sizning quvuringizni isbotlaydigan, maʼlum-yaxshi 2 GB, 100-epizodli DROID namunasi.
Google Cloud bucketda millionlab traektoriyali ommaviy maʼlumotlar toʻplami va stol ustida SO-100 joylashgan boʻlib, uning qismlari 110 dan 150 EUR gacha turadi. Nima uchun birinchisi ikkinchisiga oʻrgata olmaydi? Qisman oʻrgatishi mumkin, ammo uzatishning deyarli hech biri odamlar kutgan joyda sodir boʻlmaydi va eng oson koʻringan qismi umuman ishlamaydi.
Quyida keltirilganlar: ichida nimalar bor DROID, BridgeData V2 va Open X-Embodiment, ularning har biri arzon 5-DoF qoʻl bilan toʻqnashganda va buning oʻrniga nima qilish kerakligi. Quyidagi har bir raqam tegishli maqola, maʼlumotlar kartasi yoki manba faylidan olingan.
Uchta maʼlumotlar toʻplami aslida nimalarni oʻz ichiga oladi
| DROID | BridgeData V2 | Open X-Embodiment | |
|---|---|---|---|
| Robot | Franka Panda, 7 DoF, Robotiq 2F-85 | WidowX 250, 6 DoF, ~4,000 USD rig | 22 mujassamalar, 60 ma'lumotlar to'plami, 34 laboratoriya |
| Miqyos | 76k traektoriya, 350 soat | 60,096 traektoriya | 1M+ traektoriya, 527 ko'nikma |
| Xilma-xillik | 564 sahna, 84 vazifa, 50 yig'uvchi | 24 muhit, 13 ko'nikma | 160,266 vazifa, 21 muassasa |
| Tarkib | barchasi masofadan boshqariladi | 50,365 masofadan boshqariladigan, 9,731 skriptli | har bir manba laboratoriyasi bo'yicha |
| Boshqaruv tezligi | 15 Hz | 5 Hz | o'zgaruvchan, 3 kadr/sekunddan yuqori |
| Kameralar | 2 x ZED 2 exterior, 1 x ZED Mini wrist | 4 tagacha, ko'pgina epizodlarda faqat qattiq o'rnatilgani | laboratoriya ishlatgan narsa |
| Xom yuklab olish | 1.7 TB RLDS, 8.7 TB raw stereo | JPEG archives | per-dataset TFDS buckets |
Hozirda kam odam 1.7 TB hajmli RLDS TFRecords'ni yuklab oladi. Jamoat tashkiloti IPEC-COMMUNITY Open X-Embodiment'ning ko'p qismini AV1 video bilan LeRobot ma'lumotlar to'plami shaklida qayta nashr etdi, bu yerda DROID 392 GB joy egallaydi. Siz aynan shu versiya bilan ishlaysiz va uning meta/info.json faylini birinchi bo'lib o'qish kerak.
DROID
Uchtadan eng standartlashtirilgani. Hamma joyda bitta qurilma: Robotiq 2F-85 tutqichli Franka Panda, ikkita sozlanishi mumkin bo'lgan ZED 2 stereo kamera va bilakdagi ZED Mini, Meta Quest 2 kontrollerlari yordamida masofadan boshqariladi, Polymetis orqali 15 Hz chastotada bo'g'in va oxirgi-effektor fazosida. Til yorliqlari keyinchalik tasq.ai orqali, har bir epizod.
- 76 ming traektoriyalar, 350 soat, 564 sahna, 84 vazifa, uch qit'ada 50 ta kollektor.
- Asosiy natija mustaqil o'qitish emas, balki birgalikda o'qitishdir: domen ichidagi namoyishlar bilan 50/50 aralashtirilgan partiyalar keyingi eng yaxshi usuldan tarqatishda mutlaq muvaffaqiyat bo'yicha 22 foizga, undan tashqarida esa 17 foizga ustun keldi.
- IPEC-COMMUNITY/droid_lerobot: 92,233 epizod, 27,044,326 kadr, franka, 15 fps, codebase_version v2.0, 180x320 o'lchamli uchta AV1 oqimi, 392 GB.
- 2 GB hajmli, 100 epizodli disk raskadrovka namunasi gs://gresearch/robotics/droid_100 manzilida joylashgan. Ishni u yerdan boshlang.
BridgeData V2
Hobby sozlamalariga eng yaqini: a WidowX 250 6-DoF qo'li, 24 ta muhit va 13 ta ko'nikma bo'yicha 5 Hz chastotada 60,096 ta traektoriya. Tarkibiga e'tibor bering: 50,365 ta ekspert teleoperatsiyali namoyishlar va tasodifiy skriptli tanlash va joylashtirish siyosatidan 9,731 ta, shuning uchun taxminan 16 foizi inson namoyishi emas, bu esa imitatsion o'rganish sifati uchun muhimdir. Odatiy yuklab olish, IPEC-COMMUNITY/bridge_orig_lerobot, 53,192 epizod va 1,893,026 kadrni 5 fps tezlikda, robot_type widowx: maqoladagi 60,096 dan kamroq ekanligini ko'rsatadi, shuning uchun hisobni meta/info.json faylidan o'qing, ikkalasidan ham iqtibos keltirmang.
Open X-Embodiment
Xuddi shu ma'noda ma'lumotlar to'plami emas: 34 ta laboratoriyadan 60 ta mavjud robot ma'lumotlar to'plami 22 ta mujassamlanishni va bir milliondan ortiq traektoriyalarni qamrab oluvchi bitta RLDS to'plamiga birlashtirilgan. BridgeData V2 uning ichida bridge_orig sifatida joylashgan; google_robot bo'lagi, fractal20220817_data, 3 kadr/sek tezlikda 87,212 epizodga aylanadi.
Birlashtirishda maqolada ochiq aytilgan bir ogohlantirish mavjud. RT-X tajribalari uchun mualliflar har bir manbani 7-DoF oxirgi-effektor harakatiga aylantiradilar, ammo ma'lumotlar to'plamlari bo'ylab koordinata ramkalarini moslashtirmaydilar va harakat qiymatlarining har bir robotning asl boshqaruv sxemasiga ko'ra mutlaq yoki nisbiy pozitsiyalar yoki tezliklar bo'lishiga ruxsat beradilar. Ularning xulosasi: bir xil harakat vektori turli robotlar uchun juda boshqacha harakatlarni keltirib chiqarishi mumkin.

Nomuvofiqlik, to'rt qismda
Mujassamlanish nomuvofiqligi odatda bitta noaniq muammo sifatida qaraladi. U to'rtta bo'lib, ular har xil tarzda ishlamay qoladi va ikkitasini skript yordamida tuzatib bo'lmaydi.
1. Erkinlik darajalari
SO-100 beshta qo'l bo'g'imi va bitta qisqichga ega. Dvigatellar sifatida hisoblanganda bu 6-DoF qo'l bo'lib, SmolVLA maqolasida shunday ataladi; joylashtirish mexanizmi sifatida hisoblanganda bu 5-DoF bo'lib, LeRobot uni o'zining teskari kinematika docstring'ida shunday ataydi, u 5-DOF SO-101 da bilak faqat qisman yo'nalishni kuzatadigan yumshoq yo'nalishli IKni tasvirlaydi. Franka yettita joylashtirish bo'g'imiga ega. Bu farq qaysi pozalar mavjudligini belgilaydi: 5-DoF qo'l odatda bir vaqtning o'zida ixtiyoriy joylashuv va yo'nalishga erisha olmaydi, shuning uchun yechim topuvchi erisha oladigan eng yaqinini qaytaradi, bu ko'rsatilgan harakatdan farqli harakatdir. Ma'lumot uchun: erkinlik darajalari.
# src/lerobot/robots/so_follower/so_follower.py
motors = {
"shoulder_pan": Motor(1, "sts3215", norm_mode_body),
"shoulder_lift": Motor(2, "sts3215", norm_mode_body),
"elbow_flex": Motor(3, "sts3215", norm_mode_body),
"wrist_flex": Motor(4, "sts3215", norm_mode_body),
"wrist_roll": Motor(5, "sts3215", norm_mode_body),
"gripper": Motor(6, "sts3215", MotorNormMode.RANGE_0_100),
}
# action keys are "<motor>.pos"; send_action sync_writes them to
# "Goal_Position" -> a 6-D ABSOLUTE JOINT POSITION command
# openpi/src/openpi/policies/droid_policy.py
def make_droid_example() -> dict:
return {
"observation/exterior_image_1_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/wrist_image_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/joint_position": np.random.rand(7), # seven Franka joints
"observation/gripper_position": np.random.rand(1),
"prompt": "do something",
}
# state = concat(joint_position, gripper_pos) -> 8-DDemak, tayyor DROID nazorat nuqtasi oson yo'l emas. Physical Intelligence pi05_droidni gs://openpi-assets/checkpoints/pi05_droid manzilida yetkazib beradi, va uning kengligini maqtaydigan xuddi shu README bu ekspert nazorat nuqtalari sizning sozlamalaringizga mos kelmasligi mumkinligidan ogohlantiradi. Uning holati sakkizta Franka bo'g'in raqamlari va uning tasvir kalitlari exterior_image_1_left va wrist_image_left. Hech qanday flag buni olti motorli SO-100 buyrug'iga aylantirmaydi.
2. Harakat vektori aslida nimani anglatadi
O'lchovlilikdan chuqurroq. LeRobot konversiyalarida uchalasi ham tutqich qayerga borishi kerakligini, Dekart fazosida aytadi. SO-100 oltita servoning qayerga borishi kerakligini aytadi. Konvertatsiya qilish uchun kinematik model va yechuvchi kerak, qayta shakllantirish emas.
| Xususiyat | OXE, DROID va Bridge LeRobot shaklida | SO-100 LeRobotda |
|---|---|---|
| Harakat vektori | 7-D: x, y, z, roll, pitch, yaw, gripper | 6-D: har bir motor uchun bitta maqsad pozitsiyasi |
| Holat vektori | 8-D, with a pad slot (google_robot uses a quaternion) | 6-D, har bir motor uchun bitta |
| Ramka | Dekart, ma'lumotlar to'plamlari bo'ylab moslashtirilmagan | bo'g'in fazosi, har bir qo'l uchun kalibrlash |
| Mutlaq yoki nisbiy | ikkalasi ham, manba laboratoriyasi tomonidan hal qilinadi | mutlaq maqsad pozitsiyalari |
| Birliklar | ma'lumotlar to'plami bo'yicha normallashtirilgan, so'ngra diskretlashtirilgan | degrees by default (use_degrees=True), else -100 to 100 |
| Jim xato | mutlaq deb o'qilgan delta | kalibrlanmagan qo'l |
openx2lerobot README hujjatida u o'zgartiradigan har bir ma'lumotlar to'plami uchun yagona 8-dim holat va 7-dim harakat tasvirlangan, pad uyasi ham shundan kelib chiqqan. DROID'ning o'z RLDS sxemasi farq qiladi: uning yuqori darajadagi action'i 6 ta bo'g'in tezligi va 1 ta qisqich holatidan iborat 7-vektor bo'lib, action_dict ostida cartesian_position, cartesian_velocity, joint_position va joint_velocity mavjud. openpi bo'g'in fazosi ko'rinishini o'qiydi, LeRobot qurilmasi sizga Kartesiyalik ko'rinishni taqdim etadi. Ularning hech biri oltita mutlaq servo burchagi emas.
LeRobot yetishmayotgan qismni taqdim etadi: SO follower InverseKinematicsEEToJoints va ForwardKinematicsJointsToEE qadamlariga ega kinematika protsessoriga ega. Uning kalitlari ee.x, ee.y, ee.z, shuningdek, aylanish vektori ee.wx, ee.wy, ee.wz va ee.gripper_pos bo'lib, shuning uchun hatto yo'nalish kodlashi ham fayllardagi roll-pitch-yaw'dan farq qiladi. IK qadami orientation_weight'ni qabul qiladi, sukut bo'yicha 0.01, uning docstring'ida kam harakatlanuvchi qo'llarda faqat pozitsiyaga asoslangan IK uchun 0.0 ni o'rnatish aytilgan. Siz ko'prikni qurishingiz mumkin, ammo har bir olingan harakatning yo'nalish yarmi taxminiy bo'lib qoladi.
3. Boshqaruv tezligi
DROID 15 Hz, BridgeData V2 5 Hz, google_robot bo'lagi 3 fps; pi0 mualliflari o'z aralashmasining open-source qismini 2 va 10 Hz oralig'idagi past chastotali boshqaruv sifatida ta'riflaydilar. LeRobot'ning DatasetRecordConfig'i sukut bo'yicha fps 30, episode_time_s 60, reset_time_s 60, num_episodes 50 ga o'rnatilgan. 5 Hz ma'lumotlarida o'qitilgan siyosat bir harakat 200 ms ni qamrab olishini o'rgangan. Uni 30 Hz da qayta ijro etsangiz, qo'l sekin harakatlanadi; sodda tarzda qayta namuna olsangiz, qisqich yopiladigan kadrni buzib yuborasiz. Bu harakatni bo'laklarga ajratish bilan ham yomon o'zaro ta'sir qiladi: 100 qadamli bo'lak 5 Hz da 20 soniya, 30 Hz da esa 3.3 soniyani tashkil etadi.
4. Kameralar
BridgeData V2 har 50 traektoriya uchun ikkita kamera holatini tasodifiy tanladi va uning loyiha sahifasida ma'lumotlarning aksariyati baribir faqat qat'iy ko'rinishni o'z ichiga olganligi qayd etilgan. DROID sozlanishi ZED 2 o'rnatgichlari va bilakdagi ZED Mini'dan foydalangan. Sizda ko'z bilan joylashtirilgan ikkita USB veb-kamera bor. Kamera holati uchun bezovta qiluvchi o'zgaruvchi emas; bu vizual kodlovchi asoslangan narsalarning ko'p qismi va fayl formati sizga holatlarning farq qilishini aytmaydi.
Qismlar ishlash uchun yetarlicha yaxshi mos keladi. Ma'lumotlar to'plami yuklanadi, o'qitish boshlanadi, yo'qotish kamayadi, nazorat nuqtalari paydo bo'ladi, hech qanday xato yo'q. Keyin siyosat qo'lda hech qanday tanib bo'ladigan ish qilmaydi va siz bir kunni o'qitish skriptingizdagi xatoni qidirishga sarflaysiz. Xato yo'q: model xonangizda mavjud bo'lmagan robot uchun Dekart harakat taqsimotini o'rgangan. Giperparametrlaringizdan emas, balki yo'qotish kamayadi, siyosat hech narsa qilmaydi joyidan boshlang.
Ma'lumotlarni baribir birlashtirishga harakat qilsangiz nima bo'ladi
Aniq reja shundan iboratki: bir necha ming DROID epizodlarini o'zingizning 50 ta epizodingiz bilan birlashtirish. LeRobot rad etadi va rad etish sababi uchta farqni ko'rsatadi.
- 1To'liq 1.7 TB emas, balki 100 epizodli namunani tortib oling
2 GB tuzilmani ko'rish uchun yetarli.
bashpip install gsutil tensorflow tensorflow-datasets gsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 2RLDSni LeRobot shakliga o'tkazish
openx2lerobot OXE standart transformatsiyalarini o'z ichiga oladi va robot turini hamda boshqaruv chastotasini izohlaydi. README buni convert.sh fayliga joylashtiradi.
bashgit clone https://github.com/Tavish9/any4lerobot.git cd any4lerobot/openx2lerobot python openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 3Boshqa har qanday narsadan oldin meta/info.json faylini o'qing
Bu fayl kuningizning qolgan qismi ishlashini hal qiladi.
bashpython -c "import json;d=json.load(open('meta/info.json'));\ print(d['codebase_version'], d['robot_type'], d['fps']);\ print(d['features']['action']['shape'], d['features']['observation.state']['shape'])" - 4Birlashtirishni sinab ko'ring va xatoni o'qing
merge har bir ma'lumotlar to'plamini yuklaydi, so'ngra validate_all_metadata fps, robot_type va xususiyatlarni ro'yxatdagi birinchi elementga nisbatan tekshiradi va birinchi mos kelmaslikda xato beradi.
bashlerobot-edit-dataset \ --new_repo_id you/mixed \ --operation.type merge \ --operation.repo_ids "['you/droid100_lerobot', 'you/my_so100_task']" # ValueError: Same fps is expected, but got fps=30 instead of 15.
Ma'lumotnomalar qiymatlari siz birinchi bo'lib ro'yxatga kiritgan ma'lumotlar to'plamidan keladi, shuning uchun xabar DROIDning 15 fps o'rniga sizning 30 fps haqida shikoyat qiladi. fpsni tuzatsangiz, robot_type tekshiruviga duch kelasiz; uni tuzatsangiz, xususiyat tekshiruviga duch kelasiz, harakat uchun 6 ga qarshi 7. Hech qanday tartiblash o'tmaydi va xuddi shu himoya sanity_check_dataset_robot_compatibility orqali yozish vaqtida ishlaydi.
Joriy LeRobot mainda so100_follower va so101_follower ikkalasi ham bitta umumiy SOFollowerRobotConfig ga ro'yxatdan o'tgan, shuning uchun haqiqiy yozuvdagi satr siz kutgan narsa bo'lmasligi mumkin. Uni o'zingizning meta/info.json faylingizdan o'qing va o'chirib qo'yishingiz kerak bo'lgan tekshiruvni sizga nimadir aytayotgan tekshiruv deb hisoblang.
Xo'sh, aslida nima o'tkaziladi?
Vaznlar, epizodlar emas. Har bir zamonaviy umumiy siyosat oldindan o'qitishda uning bir qismini o'zlashtirgan va siz nozik sozlash chiqarilgan nazorat nuqtasi dan foydalansangiz, uni to'g'ri bajarish uchun hisoblash quvvatiga ega odamlar tomonidan allaqachon moslashtirilgan holda meros qilib olasiz. pi0 ning maqolasi uning nisbati haqida ochiq-oydin: uning oldindan o'qitish aralashmasining 9,1 foizi, vaqt qadamlarida hisoblangan, OXE, Bridge v2 va DROID kabi ochiq manbali ma'lumotlardir. Bu raqam pi0 ga tegishli; har bir yetkazib beruvchining aralashmasi farq qiladi.
- Vizual va til prioritetlari: kodlovchi minglab oshxona va krujkalarni ko'rgan va "qizil blok" nimani anglatishini biladi.
- Manipulyatsiya tuzilishi bo'yicha prioritet: yaqinlashish, yopish, ko'tarish, tashish, qo'yib yuborish, raqamlar bir xil bo'lmaganda ham tana-mustaqil.
- Sinov uchun ma'lum va yaxshi ma'lumotlar to'plami. Agar sizning ishingiz 100 ta DROID epizodini haddan tashqari moslashtira olmasa, muammo sizning sozlamangizda.
- Ma'lumot nuqtalari: kichik miqyosli ma'lumotlar to'plami sohalarida RT-1-X asl usul yoki RT-1 ga qaraganda 50 foizga yuqori o'rtacha muvaffaqiyat darajasiga erishdi va RT-2-X paydo bo'lgan ko'nikmalar bo'yicha RT-2 ni taxminan 3 barobar ortda qoldirdi.
- Foydali harakat nazorati yo'q. 7-D Dekart nishoni 6-D bo'g'in buyrug'i emas.
- Kamera holatini o'tkazish yo'q va ma'lumotlarda holatlar farq qilishini hech narsa aytmaydi.
- Vaqtni o'tkazish yo'q: 30 kadr/sekund yozuvchiga qarshi 3, 5 va 15 kadr/sekund manbalar.
- Tutqichni o'tkazish yo'q. Robotiq 2F-85 va STS3215 dagi bosma jag' kuch, harakat va dinamikada farq qiladi.
- Hatto uning mualliflari uchun ham miqyosning o'zi yetarli emas edi: katta ma'lumotlar to'plami sohalarida RT-1-X faqat shu ma'lumotlar to'plamida o'qitilgan RT-1 ni mag'lub eta olmadi.
- O'zingizning epizodlaringiz sonini kamaytirish yo'q.
| Model qatlami | O'tkaziladimi? | Nima uchun |
|---|---|---|
| Vizual kodlovchi | Ha, kuchli | Obyektlar va sahnalar tana-mustaqil |
| Tilni asoslash | Ha | Ko'rsatmalar matn, geometriya emas |
| Modallararo sintez | Asosan | So'rovda nomlangan obyektga e'tibor beradi |
| Propriotseptsiya kodlovchi | Yo'q | Kirish o'lchami va bo'g'in semantikasi farq qiladi |
| Harakat boshi | Yo'q | Siz bo'lmagan 7-D Dekart fazosida o'qitilgan |
| Normalizatsiya statistikasi | Yo'q va xavfli | Chet el statistikasi har bir buyruqni o'zgartiradi |
Shuning uchun SmolVLA arzon qo'lda boshqacha ishlaydi. Uning maqolasida Hugging Face'dan 481 ta jamoat ma'lumotlar to'plami tanlab olingan bo'lib, ular mujassamlash turi, epizodlar soni, ma'lumotlar sifati va kadrlar qamrovi bo'yicha filtrlangan: 22.9K epizod, 10.6M kadr, haqiqiy SO-100 va SO-101 qo'llarida baholangan. Kichik va mos keladigan katta va mos kelmaydiganidan ustun. Qiyoslang ACT against SmolVLA.
Qilinishi kerak bo'lgan uchta yo'l
A yo'li: ma'lumotlarni allaqachon o'zlashtirgan nazorat nuqtasidan nozik sozlash
Ko'pchilik bu yo'lni tanlashi kerak. Siz hech qachon DROID yoki Open X-Embodimentga tegmaysiz: oldindan o'qitish jarayonida o'zaro mujassamlash ma'lumotlarini allaqachon o'zlashtirgan siyosatni tanlang, o'zingizning epizodlaringizni yozib oling, nozik sozlang.
| Siyosat | Parametrlar | Minimal epizodlar | Ma'lumotlar to'plami formati | GPU darajasi | Xulosa | Tayanch nazorat nuqtasi |
|---|---|---|---|---|---|---|
| GR00T N1.7 | ~3 B, ~40 M nozik sozlashda o'qitilgan | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | har bir qadam uchun 152 ms | nvidia/GR00T-N1.7-3B |
| GR00T N1.5 | ~3 B | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 165 ms | nvidia/GR00T-N1.5-3B |
| Pi0.5 | ~3 B, PaliGemma tayanch modeli | 50 | LeRobot v3.0 | A100 or H100 80 GB | 485 ms | lerobot/pi05_base |
| SmolVLA | ~450 M | 30 | LeRobot v3.0 | RTX 4090 or any 24 GB | 245 ms | lerobot/smolvla_base |
| ACT | ~80 M | 50 | LeRobot v3.0 | RTX 4090 or any 24 GB | 20 ms | yo'q, noldan |
ACT halol chekka holatdir: tayanch model yo'q, shuning uchun ommaviy ma'lumotlarning hech biri unga yetib bormaydi. Bu avtomatik ravishda kamchilik emas, chunki har bir harakat qadami uchun 20 ms tezlikda u tezkor tsiklni yopishi mumkin bo'lgan beshtadan yagona hisoblanadi, chunki ACT sahifasida ko'rsatilgan. Vazifaga qarab tanlang, foydalanib beshtasi solishtirilgan, GR00T N1.7 Pi0.5 ga qarshi, va 85 ta model bo'yicha 332 ta benchmark natijalari arenada.
B yo'li: DROIDni sinov moslamasi sifatida ishlatish
100 epizodli namuna bu oy yuklab oladigan eng yaxshi 2 GB ma'lumotdir va u o'qitish uchun emas. Bu siz to'g'ri ekanligini biladigan ma'lumotlar to'plami. Unga konverteringizni, yuklagichingizni va qisqa GPU ishini ishga tushiring; muvaffaqiyatsizlikka uchragan har qanday narsa arzon bo'lgan paytda topilgan infratuzilma xatosidir. NVIDIA buni keng miqyosda ham amalga oshiradi: GR00T N1.7 kartasi SimplerEnv, DROID va LIBERO dagi Bridge va Fractal uchun to'rtta o'qitishdan keyingi variantlarni sanab o'tadi.
C yo'li: o'zingiznikini qasddan yozib oling
O'ttizdan ellikgacha 76,000 yonida kichik tuyuladi, toki siznikilar qo'lingiz, kameralaringiz va stolingiz bilan yagona ekanligini eslamaguningizcha. LeRobot'ning standart sozlamalarida, 50 epizod 100 daqiqa umumiy vaqtni tashkil qiladi. Ko'ring: , va .

Ommaviy ma'lumotlardan ishlaydigan siyosatga erishishning ikki yo'li
All of this runs on your own machine plus a rented GPU. Knowing the manual path matters because when something breaks you will know which layer broke.
- 1Install LeRobot with the extras the scripts need
The record and train entry points each declare their own extra.
bashpip install 'lerobot[core_scripts]' # lerobot-record pip install 'lerobot[training]' # lerobot-train pip install gsutil tensorflow tensorflow-datasets - 2Get a small, known-good slice
100 DROID episodes, 2 GB.
bashgsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 3Convert to LeRobot form
Writes the unified 8-D state and 7-D action, annotating robot type and control frequency.
bashpython openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 4Check the version against your trainer
The converter README documents v3.0 output; the published IPEC-COMMUNITY datasets report v2.0. GR00T wants v2.0 or v2.1 and crashes on v3.0; Pi0.5, SmolVLA and ACT want v3.0. Mind the gap: the only conversion script on LeRobot main goes 2.1 to 3.0.
bashpython src/lerobot/scripts/convert_dataset_v21_to_v30.py \ --repo-id=you/droid100_lerobot - 5Record your own episodes
Defaults: 30 fps, 60 s per episode, 60 s reset, 50 episodes. The teleoperator type is so100_leader.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.cameras="{front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --dataset.repo_id=you/so100_pick_block \ --dataset.num_episodes=50 \ --dataset.single_task="Pick up the red block and put it in the bowl" - 6Fine-tune on your data only
Weights from public data, actions from your own. Do not mix the datasets.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=you/so100_pick_block \ --policy.device=cuda \ --batch_size=4 \ --steps=20000
Not in training; the GPU job is hours. The conversion, the version mismatch and the moment you find your dataset is v2.0 and your trainer wants v3.0 are days. Read dataset rejected as v3 first.
The platform removes the GPU and pipeline plumbing. It does not remove the embodiment mismatch: point the trainer at a converted DROID dataset and you get a policy trained on Franka actions, exactly as you would locally.
- 1Pick a policy, not a dataset
The five trainable policies, with parameter counts, GPU tiers and latencies, are at /policies.
- 2Record with the desktop client
It writes LeRobot-format datasets, episodes, camera streams and joint states, straight out of a teleop session. No conversion step to get wrong.
- 3Or bring a dataset you already have
The training form accepts one from /directory, a Hugging Face repo id, or your own machine. A repo id means a converted OXE dataset will load, and the mismatch loads with it.
- 4Train on a rented GPU
The backend rents a card on a spot market by required VRAM. SmolVLA or ACT on 24 GB: 2 to 5 hours, about 1 to 3 USD. GR00T or Pi0.5 on A100 or H100: 3 to 6 hours, about 4 to 12 USD. See /pricing.
- 5Serve it back to the arm
/api/inference/pod auto-provisions a GPU pod serving the policy; the local client talks to that endpoint. Pods carry an idle watchdog and destroy themselves, so nothing keeps billing silently.
Inference has to sit next to the servos for fast tasks. The control loop is 20 to 485 ms per action step depending on the model, and public-internet round trips turn a working policy into a hesitant one. Remote inference is fine for slow pick-and-place, not fast reactive motion.
The platform helps with the boring parts: the right format for the right arm at the right frame rate, and no babysitting a spot instance. It helps with nothing else in this article.

Har bir yo'lning narxi
| Yo'l | Xotira | Inson vaqti | GPU narxi | Qo'lingizni harakatga keltirish ehtimoli |
|---|---|---|---|---|
| Faqat konvertatsiya qilingan DROID | 392 GB | konvertatsiya kunlari | 4 to 12 USD | juda past, noto'g'ri harakat maydoni |
| DROID sizning epizodlaringiz bilan birlashtirilgan | both | validate_all_metadata tomonidan bloklangan | n/a | yo'q, u ishlamaydi |
| SmolVLA, 30 dan 50 gacha shaxsiy epizodlar | a few GB | 100 min recording | 1 to 3 USD | yuqori |
| GR00T N1.7, 50 ta shaxsiy epizod | a few GB | 100 min recording | 4 to 12 USD | yuqori |
| ACT noldan, 50 ta shaxsiy epizod | a few GB | 100 min recording | 1 to 3 USD | yuqori, 20 ms inference |
| DROID namunasi sinov moslamasi sifatida | 2 GB | bir kunning ikkinchi yarmi | one short run | yuqori, tasdiqlash sifatida |
Assimetriya asosiy nuqta: eng ko'p ma'lumot oladigan yo'l eng qimmat va qo'lingizni harakatga keltirish ehtimoli eng kam. Ikki soatdan kamroq vaqt ichida o'zingizning teleoperatsiya birovning Franka terabaytidan ustun turadi. Hali qo'lingiz yo'qmi? /live ro'yxatdan o'tmasdan jismoniy SO-100 ni translyatsiya qiladi. Keyin birinchi siyosatingizni o'rgating, va SmolVLA ni SO-100 da uchun maxsus qo'llanma.
2 GB DROID namunasini yuklab oling va uni o'z quvuringizni sinash uchun foydalaning. Qolgan 1.7 TBni e'tiborsiz qoldiring. Ruxsat etilgan kameralar bilan bitta vazifaning 50 ta epizodini yozib oling. Avval SmolVLAni nozik sozlang, chunki 24 GB kartada kamida 30 ta epizod bilan ishlash eng arzon hisoblanadi, keyin xuddi shu ma'lumotlar ustida GR00T N1.7ni sinab ko'ring. O'z vazifangiz bo'yicha solishtiring, benchmark bo'yicha emas.
Qo'lingizga mos keladigan ma'lumotlar to'plamlarini yozing
Ish stoli mijozi LeRobot-formatdagi ma'lumotlar to'plamlarini teleop sessiyasidan to'g'ridan-to'g'ri yozadi: to'g'ri qo'l, to'g'ri kadr tezligi, to'g'ri harakat maydoni. RLDS konvertatsiyasi yo'q, qayta xaritalash yo'q.
Ish stoli mijozini olingDROID'da siyosatni o'rgatib, uni SO-100'imda ishga tushira olamanmi?▾
To'g'ridan-to'g'ri emas. LeRobot tuzilmasida DROID harakatlari Franka Panda'da 15 fps tezlikda 7-D oxirgi effektorni boshqarish buyruqlari hisoblanadi; xom RLDS'da ular 6 ta bo'g'in tezligi va tutqich holatidir. SO-100 6 ta mutlaq bo'g'in holatini qabul qiladi. Sizga teskari kinematika qatlami kerak bo'ladi, va hatto shunda ham 5-DoF bilak ixtiyoriy 6-DoF pozitsiyalarini takrorlay olmaydi.
DROID yoki Bridge epizodlarini o'zimning SO-100 epizodlarim bilan aralashtira olamanmi?▾
Yo'q. validate_all_metadata bir xil fps, robot_type va feature schema talab qiladi va birinchi nomuvofiqlikda ValueError ko'taradi. Uchala ham farq qiladi: 15 yoki 5 fps 30 ga qarshi, franka yoki widowx sizning qo'lingizga qarshi, harakat shakllari 7 ga qarshi 6. Metama'lumotlarni tekshiruvdan o'tkazish uchun qayta yozish semantikani tuzatmaydi.
Unda Open X-Embodiment arzon qo'l uchun foydasizmi?▾
Yo'q, lekin uning qiymati sizga epizodlar orqali emas, balki oldindan o'rgatilgan og'irliklar orqali yetib boradi. OXE, Bridge v2 va DROID kabi ochiq manbali ma'lumotlar to'plamlari pi0'ning oldindan o'qitish aralashmasining 9.1 foizini tashkil qiladi va NVIDIA Bridge, Fractal, DROID va LIBERO'da keyinchalik o'qitilgan GR00T N1.7 variantlarini yetkazib beradi. Siz qila olmaydigan narsa – bu epizodlarni o'zingizning yozuvlaringizga qo'shish.
Qaysi siyosat ommaviy o'zaro-mujassamlash ma'lumotlaridan eng ko'p foyda oladi?▾
Pi0.5 va GR00T modellari eng ko'p o'zaro-mujassamlash oldindan o'qitishini olib boradi, ammo SmolVLA ko'pincha arzon qo'lda eng yaxshi ishlaydi: uning oldindan o'qitish to'plami 481 ta jamoat ma'lumotlar to'plami, 22.9K epizod va 10.6M kadr bo'lib, haqiqiy SO-100 va SO-101 qo'llarida baholangan. ACT buning aksi: asosiy model yo'q, har bir harakat bosqichi uchun 20 ms.
O'zimning nechta epizodim kerak bo'ladi?▾
SmolVLA uchun 30 ta, GR00T N1.7, GR00T N1.5, Pi0.5 va ACT uchun 50 ta. LeRobot'ning har bir epizod uchun 60 s va qayta tiklash uchun 60 s standart sozlamalarida, 50 epizod 100 daqiqa haqiqiy vaqtni tashkil qiladi. Olingan o'zaro-mujassamlash ma'lumotlari bu raqamlarni kamaytirmaydi.
Sources
- DROID: Katta miqyosdagi real sharoitdagi robot manipulyatsiyasi ma'lumotlar to'plami
- DROID hujjatlari: yuklab olish hajmlari va RLDS epizod sxemasi
- BridgeData V2: Katta miqyosda robot o'rganish uchun ma'lumotlar to'plami
- BridgeData V2 loyiha sahifasi: tarkibi va kamera qamrovi
- Open X-Embodiment: Robotik o'rganish ma'lumotlar to'plamlari va RT-X modellari
- Open X-Embodiment loyiha sahifasi
- google-deepmind/open_x_embodiment: ma'lumotlar to'plami ro'yxati va RT-1-X nazorat nuqtalari
- any4lerobot: openx2lerobot konverteri va uning yagona 8-D holati, 7-D harakati
- IPEC-COMMUNITY/droid_lerobot: meta/info.json va repo hajmi
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: 3 kadr/sekund tezlikdagi google_robot qismi
- huggingface/lerobot: SO kuzatuvchisi, kinematika protsessori, yig'ish va yozish konfiguratsiyalari
- openpi: DROID siyosat kiritishlari va pi05_droid nazorat nuqtasi
- pi0: Umumiy robot boshqaruvi uchun ko'rish-til-harakat oqim modeli
- SmolVLA: Arzon va samarali robototexnika uchun ko'rish-til-harakat modeli
Sources
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- DROID docs: download sizes and the RLDS episode schema
- BridgeData V2: A Dataset for Robot Learning at Scale
- BridgeData V2 project page: composition and camera coverage
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Open X-Embodiment project page
- google-deepmind/open_x_embodiment: dataset list and RT-1-X checkpoints
- any4lerobot: the openx2lerobot converter and its unified 8-D state, 7-D action
- IPEC-COMMUNITY/droid_lerobot: meta/info.json and repo size
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: the google_robot slice at 3 fps
- huggingface/lerobot: SO follower, kinematics processor, aggregate and record configs
- openpi: DROID policy inputs and the pi05_droid checkpoint
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started