
DROID, BridgeData V2 og Open X-Embodiment breytast í 7-D aðgerðir á endabúnaði á 6 og 7-DoF örmum. SO-100 tekur 6 liðstöður. Hvað flyst yfir, hvað ekki, hvað á að gera í staðinn.
Stutta útgáfan
- •LeRobot útfærslur allra þriggja deila einni hefð: 7-D aðgerð endabúnaðar [x, y, z, roll, pitch, yaw, gripper] og 8-D ástandi með púðarauf. SO-100 tekur sex algildar liðstöður.
- •Þessi 7-D vigur er afurð breytisins: eigið RLDS aðgerðarsvið DROID er 6 liðhraðar auk gripstöðu, með kartesísku sýninni í action_dict.
- •Fjórar klukkur: DROID 15 fps, BridgeData V2 5 fps, google_robot sneiðin 3 fps, SO-100 upptaka á 30 fps.
- •Þú getur ekki sameinað þau með eigin gögnum. validate_all_metadata vekur villu við fyrsta mismunandi fps, robot_type eða eiginleika, og öll þrjú eru mismunandi.
- •Það sem flyst eru forþjálfaðar þyngdir, ekki þættir. Opinn hugbúnaðargögn eru 9,1 prósent af forþjálfunarblöndu pi0.
- •Ódýrasta raunverulega notkun þeirra er prófunarbúnaður: þekkt og góð 2 GB, 100 þátta DROID sýnishorn sem sannar ferlið þitt áður en þú tekur upp um helgi.
Það er opinber gagnasafn með milljón ferlum á Google Cloud geymslu og SO-100 á skrifborðinu sem kostaði 110 til 150 EUR í hlutum. Hvers vegna getur sá fyrri ekki kennt þeim síðari? Það getur að hluta til, en næstum enginn flutningur á sér stað þar sem fólk býst við, og sá hluti sem virðist auðveldastur virkar alls ekki.
Hér á eftir: hvað er inni í DROID, BridgeData V2 og Open X-Embodiment, þar sem hvert þeirra rekst á ódýran 5-DoF arm, og hvað á að gera í staðinn. Hver tala hér að neðan kom úr greininni, gagnasafnskortinu eða frumskránni sem hún tilheyrir.
Hvað gagnasöfnin þrjú innihalda í raun
| DROID | BridgeData V2 | Open X-Embodiment | |
|---|---|---|---|
| Vélmenni | Franka Panda, 7 DoF, Robotiq 2F-85 | WidowX 250, 6 DoF, ~4,000 USD rig | 22 útfærslur, 60 gagnasöfn, 34 rannsóknarstofur |
| Stærð | 76k ferlar, 350 klukkustundir | 60,096 ferlar | 1M+ ferlar, 527 færni |
| Fjölbreytni | 564 senur, 84 verkefni, 50 safnarar | 24 umhverfi, 13 færni | 160,266 verkefni, 21 stofnun |
| Samsetning | allt fjarstýrt | 50,365 fjarstýrt, 9,731 skrifað | eftir upprunalegri rannsóknarstofu |
| Stýrihraði | 15 Hz | 5 Hz | breytilegt, 3 fps upp á við |
| Myndavélar | 2 x ZED 2 utanáliggjandi, 1 x ZED Mini úlnliðs | allt að 4, flestir þættir aðeins sú fasta | hvað sem rannsóknarstofan notaði |
| Hrá niðurhal | 1.7 TB RLDS, 8.7 TB hrátt steríó | JPEG skjalasöfn | TFDS fötur fyrir hvert gagnasafn |
Fáir hlaða enn niður 1,7 TB af RLDS TFRecords. Samfélagssamtökin IPEC-COMMUNITY hafa endurútgefið mest af Open X-Embodiment á LeRobot gagnasafns formi með AV1 myndbandi, þar sem DROID er 392 GB. Það er sú útgáfa sem þú munt vinna með, og meta/info.json hennar er það sem á að lesa fyrst.
DROID
Sá staðlaðasti af þremur. Einn búnaður alls staðar: Franka Panda með Robotiq 2F-85 gripara, tvær stillanlegar ZED 2 steríómyndavélar og úlnliðs ZED Mini, fjarstýrt með Meta Quest 2 stýripinnum, skráð í gegnum Polymetis á 15 Hz í bæði lið- og enda-búnaðar rými. Tungumálamerkingar komu síðar í gegnum tasq.ai, allt að þrjár á hverja þátt.
- 76k ferlar, 350 klukkustundir, 564 senur, 84 verkefni, 50 safnarar á þremur heimsálfum.
- Helsta niðurstaðan er samþjálfun, ekki sjálfstæð þjálfun: lotur blandaðar 50/50 með sýnikennslu innan léns slógu næstbestu aðferðina um 22 prósent algjöran árangur í dreifingu, 17 prósent utan hennar.
- IPEC-COMMUNITY/droid_lerobot: 92.233 þættir, 27.044.326 rammar, franka, 15 fps, codebase_version v2.0, þrjár AV1 straumar á 180x320, 392 GB.
- 2 GB, 100 þátta kembisýni er staðsett á gs://gresearch/robotics/droid_100. Byrjaðu þar.
BridgeData V2
Næst því að vera áhugamanna uppsetning: WidowX 250 6-DoF armur, 60.096 ferlar yfir 24 umhverfi og 13 færni á 5 Hz. Athugið samsetninguna: 50.365 sérfræðinga fjarstýrðar sýnikennslur auk 9.731 frá slembuðu skrifuðu pick-and-place stefnu, svo um 16 prósent er ekki mannleg sýnikennsla, sem skiptir máli fyrir eftirhermu nám gæði. Venjulega niðurhalið, IPEC-COMMUNITY/bridge_orig_lerobot, skýrir frá 53.192 þáttum og 1.893.026 römmum á 5 fps, robot_type widowx: færri en 60.096 í greininni, svo lestu fjöldann úr meta/info.json frekar en að vitna í annaðhvort.
Open X-Embodiment
Ekki gagnasafn í sama skilningi: 60 núverandi vélmennagagnasöfn frá 34 rannsóknarstofum sameinuð í eitt RLDS safn sem nær yfir 22 útfærslur og yfir milljón ferla. BridgeData V2 er inni í því sem bridge_orig; google_robot sneiðin, fractal20220817_data, breytist í 87.212 þætti á 3 fps.
Samruninn hefur í för með sér fyrirvara sem greinin tekur fram. Fyrir RT-X tilraunirnar breyta höfundarnir hverri uppsprettu í 7-DoF endabúnaðaraðgerð, en samræma ekki hnitakerfi milli gagnasafna, og leyfa aðgerðargildum að vera algildar eða hlutfallslegar stöður eða hraðar, samkvæmt upprunalegu stjórnkerfi hvers vélmennis. Niðurstaða þeirra: sami aðgerðarvigur getur valdið mjög mismunandi hreyfingum fyrir mismunandi vélmenni.

Ósamræmið, í fjórum hlutum
Ósamræmi í útfærslu er venjulega litið á sem eitt óljóst vandamál. Þau eru fjögur, þau bila á mismunandi hátt, og tvö þeirra eru ekki laganleg með skriftum.
1. Frelsisgráður
SO-100 er með fimm armliði auk gripara. Talið sem mótorar er það 6-DoF armur, og SmolVLA ritgerðin kallar það það; talið sem staðsetningarbúnaður er það 5-DoF, og LeRobot kallar það það í inverse-kinematics docstring sínum, sem lýsir mjúkri stefnu IK á 5-DOF SO-101 þar sem úlnliðurinn fylgist aðeins að hluta með stefnu. Franka er með sjö staðsetningarliði. Þetta bil ræður því hvaða stellingar eru til: 5-DoF armur getur almennt ekki náð handahófskenndri stöðu og stefnu í einu, svo lausnarinn skilar því næsta sem hann getur, annarri hreyfingu en þeirri sem sýnd var. Bakgrunnur: frelsisgráður.
# src/lerobot/robots/so_follower/so_follower.py
motors = {
"shoulder_pan": Motor(1, "sts3215", norm_mode_body),
"shoulder_lift": Motor(2, "sts3215", norm_mode_body),
"elbow_flex": Motor(3, "sts3215", norm_mode_body),
"wrist_flex": Motor(4, "sts3215", norm_mode_body),
"wrist_roll": Motor(5, "sts3215", norm_mode_body),
"gripper": Motor(6, "sts3215", MotorNormMode.RANGE_0_100),
}
# action keys are "<motor>.pos"; send_action sync_writes them to
# "Goal_Position" -> a 6-D ABSOLUTE JOINT POSITION command
# openpi/src/openpi/policies/droid_policy.py
def make_droid_example() -> dict:
return {
"observation/exterior_image_1_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/wrist_image_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/joint_position": np.random.rand(7), # seven Franka joints
"observation/gripper_position": np.random.rand(1),
"prompt": "do something",
}
# state = concat(joint_position, gripper_pos) -> 8-DÞannig að tilbúinn DROID gátpunktur er engin flýtileið. Physical Intelligence sendir pi05_droid á gs://openpi-assets/checkpoints/pi05_droid, og sama README skráin sem lofar breidd þess varar við því að þessir sérfræðigátpunktar gætu ekki alhæfst á þína uppsetningu. Ástand þess er átta Franka liðtölur og myndalyklar þess eru exterior_image_1_left og wrist_image_left. Enginn fáni breytir því í sex-mótora SO-100 skipun.
2. Hvað aðgerðarvigurinn raunverulega segir
Dýpra en vídd. Í LeRobot umbreytingunum segja allir þrír hvert gripurinn ætti að fara, í kartesísku rúmi. SO-100 segir hvert sex servóar ættu að fara. Til að umbreyta þarf hreyfilíkan og lausnara, ekki endurmótun.
| Eiginleiki | OXE, DROID og Bridge í LeRobot formi | SO-100 í LeRobot |
|---|---|---|
| Aðgerðarvigur | 7-D: x, y, z, velt, halli, snúningur, gripur | 6-D: ein markstaða á hvern mótor |
| Ástandsvigur | 8-D, með fyllingarrauf (google_robot notar kvaternjón) | 6-D, einn á hvern mótor |
| Rammi | Kartesískur, ójafnaður yfir gagnasöfn | liðrúm, kvörðun á hvern arm |
| Algjört eða hlutfallslegt | annaðhvort, ákveðið af upprunarannsóknarstofunni | algjörar markstöður |
| Einingar | staðlað á hvert gagnasafn, síðan sundurgreint | gráður sjálfgefið (use_degrees=True), annars -100 til 100 |
| Hljóðlaus bilun | delta lesið sem algjört | ókvörðuð armur |
openx2lerobot README skjalið lýsir sameinuðu 8-víddar ástandi og 7-víddar aðgerð fyrir hvert gagnasafn sem það umbreytir, en þaðan kemur pad raufin. Eigin RLDS skema DROID er frábrugðið: efsta stigs action þess er 7-víddar vigur af 6 liðhraða auk 1 gripstöðu, með cartesian_position, cartesian_velocity, joint_position og joint_velocity undir action_dict. openpi les liðrýmisútgáfuna, LeRobot útgáfan gefur þér Cartesian útgáfuna. Hvorki er sex algild servóhorn.
LeRobot sendir þó vantar hlutann: SO follower hefur hreyfifræðivinnslu með InverseKinematicsEEToJoints og ForwardKinematicsJointsToEE skrefum. Lyklar þess eru ee.x, ee.y, ee.z auk snúningsvigurs ee.wx, ee.wy, ee.wz og ee.gripper_pos, svo jafnvel stefnu kóðunin er frábrugðin roll-pitch-yaw í skrám. IK skrefið tekur orientation_weight, sjálfgefið 0.01, en skjöl þess segja að stilla 0.0 fyrir stöðu-eingöngu IK á vanvirkum örmum. Þú getur byggt brúna, en stefnuhelmingur hverrar lánaðrar aðgerðar helst nálgaður.
3. Stýrihraði
DROID er 15 Hz, BridgeData V2 5 Hz, google_robot sneiðin 3 fps; höfundar pi0 lýsa opna hluta blöndu sinnar sem lág-tíðni stýringu á milli 2 og 10 Hz. Sjálfgefnar stillingar LeRobot's DatasetRecordConfig eru fps 30, episode_time_s 60, reset_time_s 60, num_episodes 50. A þjálfuð á 5 Hz gögnum lærði að ein aðgerð nær yfir 200 ms. Spilaðu það aftur á 30 Hz og armurinn skríður; endursýna á einfaldan hátt og þú smyrir rammann þar sem gripurinn lokast. Það hefur einnig slæm áhrif á : 100-skrefa hluti er 20 sekúndur á 5 Hz, 3.3 á 30 Hz.
4. Myndavélar
BridgeData V2 slembivaldi tvær myndavélarstöður á 50 ferlum, og verkefnasíða þess tekur fram að mest af gögnunum innihalda hvort eð er aðeins fasta sýn. DROID notaði stillanleg ZED 2 festingar auk ZED Mini á úlnlið. Þú ert með tvær USB vefmyndavélar staðsettar eftir auga. Staða myndavélar er ekki óþægileg breyta fyrir ; það er mikið af því sem sjónkóðarinn byggði á, og ekkert í skráarsniðinu segir þér að stöðurnar séu ólíkar.
Hlutirnir passa nógu vel saman til að keyra. Gagnasafnið hleðst, þjálfun hefst, tapið minnkar, geymslupunktar birtast, engar villur. Síðan gerir stefnan ekkert þekkjanlegt á arminum og þú eyðir degi í að leita að villu í þjálfunarskriptunni þinni. Það er engin villa: líkanið lærði Cartesian aðgerðardreifingu fyrir vélmenni sem er ekki til í herberginu þínu. Byrjaðu á tapið minnkar, stefnan gerir ekkert, ekki á ofbreytunum þínum.
Hvað gerist ef þú reynir að sameina gögnin samt
Augljósa áætlunin er að tengja saman: nokkur þúsund DROID þætti auk þinna 50. LeRobot neitar, og neitunin nefnir þrjá hluti sem eru ólíkir.
- 1Sæktu 100 þátta sýnishornið, ekki allan 1.7 TB pakkann
2 GB er nóg til að sjá uppbygginguna.
bashpip install gsutil tensorflow tensorflow-datasets gsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 2Umbreyttu RLDS í LeRobot snið
openx2lerobot umlykur staðlaðar OXE umbreytingar og skráir gerð vélmennis og stjórntíðni. README skráin setur þetta í convert.sh.
bashgit clone https://github.com/Tavish9/any4lerobot.git cd any4lerobot/openx2lerobot python openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 3Lestu meta/info.json áður en nokkuð annað er gert
Þessi skrá ræður því hvort restin af deginum þínum virkar.
bashpython -c "import json;d=json.load(open('meta/info.json'));\ print(d['codebase_version'], d['robot_type'], d['fps']);\ print(d['features']['action']['shape'], d['features']['observation.state']['shape'])" - 4Reyndu að sameina og lestu villuna
merge hleður öllum gagnasöfnum, síðan athugar validate_all_metadata fps, robot_type og eiginleika miðað við það fyrsta á listanum og gefur villu við fyrsta ósamræmi.
bashlerobot-edit-dataset \ --new_repo_id you/mixed \ --operation.type merge \ --operation.repo_ids "['you/droid100_lerobot', 'you/my_so100_task']" # ValueError: Same fps is expected, but got fps=30 instead of 15.
Viðmiðunargildin koma frá því gagnasafni sem þú skráðir fyrst, þess vegna kvartar skilaboðin yfir 30 fps þínum frekar en 15 fps DROID. Lagaðu fps og þú lendir í robot_type athuguninni; lagaðu það og þú lendir í eiginleikaathuguninni, 7 á móti 6 fyrir aðgerðina. Engin röðun kemst í gegn, og sama vörnin keyrir við upptökutíma í gegnum sanity_check_dataset_robot_compatibility.
Á núverandi LeRobot aðalútgáfu eru so100_follower og so101_follower bæði skráð á eina sameiginlega SOFollowerRobotConfig, svo strengurinn úr raunverulegri upptöku er ekki endilega sá sem þú býst við. Lestu hann úr eigin meta/info.json, og líttu á athugun sem þú þurftir að slökkva á sem athugun sem var að segja þér eitthvað.
Hvað flyst í raun yfir?
Þyngdir, ekki þættir. Sérhver nútíma almenn stefna hefur tekið upp hluta af því í forþjálfun, og þegar þú frá útgefnu erfirðu það sem þegar hefur verið samræmt af fólki með reiknigetu til að gera það rétt. Grein pi0 er hreinskilin um hlutfallið: 9.1 prósent af forþjálfunarblöndu þess, talið í tímaskrefum, eru opinn hugbúnaðargögn, þar á meðal OXE, Bridge v2 og DROID. Sú tala er frá pi0; blanda hvers söluaðila er mismunandi.
- Sjón- og tungumálagrunnur: kóðarinn hefur séð þúsundir eldhúsa og krúsa og veit hvað „rauði kubburinn“ vísar til.
- Grunnur yfir meðhöndlunaruppbyggingu: nálgun, lokun, lyfting, flutningur, losun, óháð útfærslu jafnvel þótt tölurnar séu það ekki.
- Þekkt og gott gagnasafn til prófunar. Ef verkefnið þitt getur ekki ofþjálfað 100 DROID þætti, er vandamálið uppsetningin þín.
- Viðmiðunarpunktar: á litlum gagnasafnssvæðum náði RT-1-X 50 prósent hærri meðalárangurshlutfalli en upprunalega aðferðin eða RT-1, og RT-2-X sigraði RT-2 um það bil 3x á nýjum færniþáttum.
- Engin nothæf aðgerðarleiðbeining. 7-D Cartesian markmið er ekki 6-D liðstjórn.
- Engin flutningur á myndavélarstöðu, og ekkert í gögnunum segir þér að stöðurnar séu mismunandi.
- Engin tímasetningarflutningur: 3, 5 og 15 fps heimildir á móti 30 fps upptökutæki.
- Engin gripflutningur. Robotiq 2F-85 og prentaður kjálki á STS3215 eru mismunandi í krafti, slaglengd og gangverki.
- Stærðin ein og sér var ekki nóg, jafnvel fyrir höfunda þess: á stórum gagnasafnssvæðum sigraði RT-1-X ekki RT-1 sem þjálfað var á því gagnasafni einu saman.
- Engin minnkun á fjölda eigin þátta sem þú þarft.
| Lag líkansins | Flyst yfir? | Af hverju |
|---|---|---|
| Sjónkóðari | Yes, strongly | Hlutir og senur eru óháðar útfærslu |
| Tungumálagrunnur | Yes | Leiðbeiningar eru texti, ekki rúmfræði |
| Kross-módel samruni | Mostly | Tekur mið af hlutnum sem nefndur er í fyrirmælum |
| Skynjunarkóðari líkamsstöðu | No | Inntaksvídd og liðmerkingar eru mismunandi |
| Aðgerðarhaus | No | Þjálfað á 7-D Cartesian rými sem þú ert ekki í |
| Staðlaðar tölfræði | No, and dangerous | Erlendar tölfræði breyta hverri skipun |
Þetta er ástæðan fyrir því að SmolVLA hegðar sér öðruvísi á ódýrum armi. Grein þess velur 481 samfélagsgagnasafn frá Hugging Face, síað eftir gerð útfærslu, fjölda þátta, gæðum gagna og rammaumfjöllun: 22.9K þættir, 10.6M rammar, metið á raunverulegum SO-100 og SO-101 örmum. Lítið og samsvarað vinnur stórt og ósamsvarað. Berðu saman á ACT against SmolVLA.
Þrjár leiðir sem vert er að fara
Leið A: fínstilla frá geymslupunkti sem hefur þegar tekið inn gögnin
Flestir ættu að velja þessa. Þú snertir aldrei DROID eða Open X-Embodiment: veldu stefnu þar sem forþjálfun hefur þegar tekið inn gögn yfir mismunandi útfærslur, skráðu þína eigin þætti, fínstilltu.
| Stefna | Færibreytur | Lágmarksþættir | Gagnasafnsform | GPU flokkur | Ályktun | Grunnáfangi |
|---|---|---|---|---|---|---|
| GR00T N1.7 | ~3 B, ~40 M trained in fine-tuning | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 152 ms per step | nvidia/GR00T-N1.7-3B |
| GR00T N1.5 | ~3 B | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 165 ms | nvidia/GR00T-N1.5-3B |
| Pi0.5 | ~3 B, PaliGemma backbone | 50 | LeRobot v3.0 | A100 or H100 80 GB | 485 ms | lerobot/pi05_base |
| SmolVLA | ~450 M | 30 | LeRobot v3.0 | RTX 4090 or any 24 GB | 245 ms | lerobot/smolvla_base |
| ACT | ~80 M | 50 | LeRobot v3.0 | RTX 4090 or any 24 GB | 20 ms | none, from scratch |
ACT er heiðarlegt jaðartilfelli: ekkert grunnlíkan, svo engin af opinberu gögnunum ná nokkurn tíma til þess. Ekki sjálfkrafa ókostur, þar sem á 20 ms á hverju aðgerðarskrefi er það eina af fimm sem getur lokað hröðum lykkju, eins og ACT síðan, kemur fram. Veldu eftir verkefni með því að nota öll fimm borin saman, GR00T N1.7 á móti Pi0.5, og 332 viðmiðunarniðurstöður yfir 85 líkön í vettvanginum.
Leið B: notaðu DROID sem prófunarbúnað
100 þátta sýnishornið er bestu 2 GB sem þú munt hlaða niður í þessum mánuði, og ekki til þjálfunar. Þetta er gagnasafn sem þú veist að er rétt. Keyrðu umbreytirinn þinn, hleðslutækið og stutt GPU verkefni á því; allt sem bilar er innviðagalli sem fannst á meðan það var ódýrt. NVIDIA gerir það sama í stórum stíl: GR00T N1.7 kortið sýnir fjórar eftirþjálfaðar útgáfur, fyrir Bridge og Fractal í SimplerEnv, DROID og LIBERO.
Leið C: taka upp þín eigin, viljandi
Þrjátíu til fimmtíu hljómar lítið miðað við 76.000 þar til þú manst að þínir eru þeir einu með þinn arm, þínar myndavélar og þitt borð. Með sjálfgefnum stillingum LeRobot eru 50 þættir 100 mínútur af rauntíma. Sjáðu , og .

Tvær leiðir til að komast frá opinberum gögnum að virkri stefnu
All of this runs on your own machine plus a rented GPU. Knowing the manual path matters because when something breaks you will know which layer broke.
- 1Install LeRobot with the extras the scripts need
The record and train entry points each declare their own extra.
bashpip install 'lerobot[core_scripts]' # lerobot-record pip install 'lerobot[training]' # lerobot-train pip install gsutil tensorflow tensorflow-datasets - 2Get a small, known-good slice
100 DROID episodes, 2 GB.
bashgsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 3Convert to LeRobot form
Writes the unified 8-D state and 7-D action, annotating robot type and control frequency.
bashpython openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 4Check the version against your trainer
The converter README documents v3.0 output; the published IPEC-COMMUNITY datasets report v2.0. GR00T wants v2.0 or v2.1 and crashes on v3.0; Pi0.5, SmolVLA and ACT want v3.0. Mind the gap: the only conversion script on LeRobot main goes 2.1 to 3.0.
bashpython src/lerobot/scripts/convert_dataset_v21_to_v30.py \ --repo-id=you/droid100_lerobot - 5Record your own episodes
Defaults: 30 fps, 60 s per episode, 60 s reset, 50 episodes. The teleoperator type is so100_leader.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.cameras="{front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --dataset.repo_id=you/so100_pick_block \ --dataset.num_episodes=50 \ --dataset.single_task="Pick up the red block and put it in the bowl" - 6Fine-tune on your data only
Weights from public data, actions from your own. Do not mix the datasets.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=you/so100_pick_block \ --policy.device=cuda \ --batch_size=4 \ --steps=20000
Not in training; the GPU job is hours. The conversion, the version mismatch and the moment you find your dataset is v2.0 and your trainer wants v3.0 are days. Read dataset rejected as v3 first.
The platform removes the GPU and pipeline plumbing. It does not remove the embodiment mismatch: point the trainer at a converted DROID dataset and you get a policy trained on Franka actions, exactly as you would locally.
- 1Pick a policy, not a dataset
The five trainable policies, with parameter counts, GPU tiers and latencies, are at /policies.
- 2Record with the desktop client
It writes LeRobot-format datasets, episodes, camera streams and joint states, straight out of a teleop session. No conversion step to get wrong.
- 3Or bring a dataset you already have
The training form accepts one from /directory, a Hugging Face repo id, or your own machine. A repo id means a converted OXE dataset will load, and the mismatch loads with it.
- 4Train on a rented GPU
The backend rents a card on a spot market by required VRAM. SmolVLA or ACT on 24 GB: 2 to 5 hours, about 1 to 3 USD. GR00T or Pi0.5 on A100 or H100: 3 to 6 hours, about 4 to 12 USD. See /pricing.
- 5Serve it back to the arm
/api/inference/pod auto-provisions a GPU pod serving the policy; the local client talks to that endpoint. Pods carry an idle watchdog and destroy themselves, so nothing keeps billing silently.
Inference has to sit next to the servos for fast tasks. The control loop is 20 to 485 ms per action step depending on the model, and public-internet round trips turn a working policy into a hesitant one. Remote inference is fine for slow pick-and-place, not fast reactive motion.
The platform helps with the boring parts: the right format for the right arm at the right frame rate, and no babysitting a spot instance. It helps with nothing else in this article.

Hvað hver leið kostar
| Leið | Geymsla | Mannlegur tími | GPU kostnaður | Líkur á að það hreyfi handlegginn þinn |
|---|---|---|---|---|
| Umbreytt DROID eitt og sér | 392 GB | dagar í umbreytingu | 4 to 12 USD | mjög lágar, rangt aðgerðasvæði |
| DROID sameinað með þínum þáttum | bæði | blocked by validate_all_metadata | n/a | engar, það keyrir ekki |
| SmolVLA, 30 til 50 eigin þættir | a few GB | 100 mín upptaka | 1 to 3 USD | háar |
| GR00T N1.7, 50 eigin þættir | a few GB | 100 mín upptaka | 4 to 12 USD | háar |
| ACT frá grunni, 50 eigin þættir | a few GB | 100 mín upptaka | 1 to 3 USD | háar, 20 ms ályktun |
| DROID sýnishorn sem prófunarbúnaður | 2 GB | einn eftirmiðdagur | one short run | háar, sem staðfesting |
Ósamhverfan er kjarninn: leiðin sem fær flest gögn lánað er dýrust og ólíklegust til að hreyfa handlegginn þinn. Undir tveimur tímum af þinni eigin fjarstýringu er betra en terabæti af Franka einhvers annars. Enginn handleggur ennþá? /live streymir líkamlegum SO-100 án skráningar. Þjálfaðu síðan fyrstu stefnuna þína, og SmolVLA á SO-100 fyrir sérstaka leiðbeiningar.
Sæktu 2 GB DROID sýnishornið og notaðu það til að sanna leiðsluna þína. Hunsaðu hin 1,7 TB. Taktu upp 50 þætti af einu verkefni með föstum myndavélum. Fínstilltu SmolVLA fyrst, því með að lágmarki 30 þætti á 24 GB korti er ódýrast að endurtaka, reyndu síðan GR00T N1.7 á sömu gögnum. Berðu saman á þínu verkefni, ekki á viðmiðun.
Taktu upp gagnasöfn sem passa nú þegar við handlegginn þinn
Skjáborðsforritið skrifar LeRobot-sniðin gagnasöfn beint úr fjarstýringarlotu: réttur handleggur, réttur rammatíðni, réttur aðgerðarými. Engin RLDS umbreyting, engin endurkortun.
Sæktu skjáborðsforritiðGet ég þjálfað stefnu á DROID og keyrt hana á SO-100 mínum?▾
Ekki beint. Í LeRobot útgáfunni eru DROID aðgerðir 7-D endabúnaðar skipanir á Franka Panda við 15 fps; í hráu RLDS eru þær 6 liðhraðar auk gripstöðu. SO-100 tekur 6 algildar liðstöður. Þú þyrftir öfuga hreyfifræði lag, og jafnvel þá getur 5-DoF úlnliður ekki endurskapað handahófskenndar 6-DoF stellingar.
Get ég blandað DROID eða Bridge þáttum við mína eigin SO-100 þætti?▾
Nei. validate_all_metadata krefst eins fps, robot_type og eiginleikaskema og kastar ValueError við fyrsta ósamræmi. Allir þrír eru ólíkir: 15 eða 5 fps á móti 30, franka eða widowx á móti handleggnum þínum, aðgerðarform 7 á móti 6. Að endurskrifa lýsigögn til að standast athugun lagar ekki merkingarfræðina.
Er Open X-Embodiment þá gagnslaust fyrir ódýran handlegg?▾
Nei, en gildi þess nær til þín í gegnum forþjálfaðar þyngdir, ekki þætti. Opinn uppspretta gagnasöfn, þar á meðal OXE, Bridge v2 og DROID, eru 9,1 prósent af forþjálfunarblöndu pi0, og NVIDIA sendir GR00T N1.7 afbrigði sem eru eftirþjálfuð á Bridge, Fractal, DROID og LIBERO. Það sem þú getur ekki gert er að bæta þessum þáttum við þína eigin upptöku.
Hvaða stefna nýtur mest góðs af opinberum gögnum yfir líkamsgerðir?▾
Pi0.5 og GR00T módelin bera mestu forþjálfunina yfir líkamsgerðir, en SmolVLA hegðar sér oft best á ódýrum handlegg: forþjálfunarsettið þess er 481 samfélagsgagnasöfn, 22.9K þættir og 10.6M rammar, metið á raunverulegum SO-100 og SO-101 handleggjum. ACT er hið gagnstæða: ekkert grunnlíkan, 20 ms á hverja aðgerðarskref.
Hversu marga eigin þætti þarf ég í raun?▾
30 fyrir SmolVLA, 50 fyrir GR00T N1.7, GR00T N1.5, Pi0.5 og ACT. Með sjálfgefnum stillingum LeRobot um 60 s á hvern þátt og 60 s endurstillingu, eru 50 þættir 100 mínútur af rauntíma. Lánuð gögn yfir líkamsgerðir lækka ekki þessar tölur.
Sources
- DROID: Stórt gagnasafn um vélmennastjórnun í raunheimum
- DROID skjöl: niðurhalsstærðir og RLDS þáttaskema
- BridgeData V2: Gagnasafn fyrir vélmennanám í stórum stíl
- BridgeData V2 verkefnasíða: samsetning og myndavélarsvið
- Open X-Embodiment: Gagnasöfn fyrir vélmennanám og RT-X líkön
- Open X-Embodiment verkefnasíða
- google-deepmind/open_x_embodiment: gagnasafnslýsing og RT-1-X eftirlitsstöðvar
- any4lerobot: openx2lerobot breytirinn og sameinað 8-D ástand, 7-D aðgerð
- IPEC-COMMUNITY/droid_lerobot: meta/info.json og stærð geymslu
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: google_robot sneiðin á 3 ramma á sekúndu
- huggingface/lerobot: SO fylgjandi, hreyfifræðivinnsluaðili, samansafn og upptökustillingar
- openpi: DROID stefnuinntak og pi05_droid eftirlitsstöðin
- pi0: Sjón-mál-aðgerðarflæðislíkan fyrir almenna vélmennastýringu
- SmolVLA: Sjón-mál-aðgerðarlíkan fyrir hagkvæma og skilvirka vélmennafræði
Sources
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- DROID docs: download sizes and the RLDS episode schema
- BridgeData V2: A Dataset for Robot Learning at Scale
- BridgeData V2 project page: composition and camera coverage
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Open X-Embodiment project page
- google-deepmind/open_x_embodiment: dataset list and RT-1-X checkpoints
- any4lerobot: the openx2lerobot converter and its unified 8-D state, 7-D action
- IPEC-COMMUNITY/droid_lerobot: meta/info.json and repo size
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: the google_robot slice at 3 fps
- huggingface/lerobot: SO follower, kinematics processor, aggregate and record configs
- openpi: DROID policy inputs and the pi05_droid checkpoint
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started