
DROID, BridgeData V2 i Open X-Embodiment se konvertuju u 7-D akcije krajnjeg efektora na rukama sa 6 i 7 stepeni slobode. SO-100 prihvata 6 pozicija zglobova. Šta se prenosi, šta ne, i šta umesto toga učiniti.
Kratka verzija
- •LeRobot verzije sva tri dele jednu konvenciju: 7-D akcija krajnjeg efektora [x, y, z, roll, pitch, yaw, gripper] i 8-D stanje sa slotom za popunu. SO-100 uzima šest apsolutnih pozicija zglobova.
- •Taj 7-D vektor je artefakt konvertera: DROID-ovo sopstveno RLDS polje akcije je 6 brzina zglobova plus pozicija hvataljke, sa Kartezijanskim prikazom u action_dict.
- •Četiri takta: DROID 15 fps, BridgeData V2 5 fps, google_robot isečak 3 fps, SO-100 snimanje na 30 fps.
- •Ne možete ih spojiti sa sopstvenim podacima. validate_all_metadata javlja grešku na prvoj razlici u fps, robot_type ili features, a sve tri se razlikuju.
- •Ono što se prenosi su unapred obučene težine, a ne epizode. Podaci otvorenog koda čine 9.1 procenata pi0 mešavine za pre-trening.
- •Njihova najjeftinija stvarna upotreba je testni uređaj: poznati, ispravni DROID uzorak od 2 GB, 100 epizoda koji dokazuje vašu cevovodnu obradu pre nego što snimate tokom vikenda.
Postoji javni skup podataka od milion trajektorija na Google Cloud bucket-u i SO-100 na stolu koji je koštao 110 do 150 EUR u delovima. Zašto prvi ne može da nauči drugog? Delimično može, ali se skoro nijedan prenos ne dešava tamo gde ljudi očekuju, a deo koji izgleda najlakše uopšte ne funkcioniše.
Sledi: šta se nalazi unutar DROID, BridgeData V2 i Open X-Embodiment, gde se svaki sudara sa jeftinim 5-DoF robotom, i šta umesto toga učiniti. Svaki broj ispod potiče iz rada, kartice skupa podataka ili izvornog fajla kojem pripada.
Šta tri skupa podataka zapravo sadrže
| DROID | BridgeData V2 | Open X-Embodiment | |
|---|---|---|---|
| Robot | Franka Panda, 7 DoF, Robotiq 2F-85 | WidowX 250, 6 DoF, ~4,000 USD rig | 22 embodiments, 60 datasets, 34 labs |
| Skala | 76k trajectories, 350 hours | 60,096 trajectories | 1M+ trajectories, 527 skills |
| Raznovrsnost | 564 scenes, 84 tasks, 50 collectors | 24 environments, 13 skills | 160,266 tasks, 21 institutions |
| Kompozicija | all teleoperated | 50,365 teleoperated, 9,731 scripted | per source lab |
| Brzina kontrole | 15 Hz | 5 Hz | varies, 3 fps upwards |
| Kamere | 2 x ZED 2 exterior, 1 x ZED Mini wrist | up to 4, most episodes only the fixed one | whatever the lab used |
| Sirovo preuzimanje | 1.7 TB RLDS, 8.7 TB raw stereo | JPEG archives | per-dataset TFDS buckets |
Malo ljudi i dalje preuzima 1.7 TB RLDS TFRecords-a. Organizacija zajednice IPEC-COMMUNITY je ponovo objavila većinu Open X-Embodiment-a u obliku LeRobot skupa podataka sa AV1 videom, gde DROID zauzima 392 GB. To je verzija sa kojom ćete raditi, i njen meta/info.json je ono što treba prvo pročitati.
DROID
Najstandardizovaniji od tri. Jedan sistem svuda: Franka Panda sa Robotiq 2F-85 hvataljkom, dve podesive ZED 2 stereo kamere i ZED Mini kamera na zglobu, teleoperisan sa Meta Quest 2 kontrolerima, snimljen preko Polymetis-a na 15 Hz u prostoru zgloba i krajnjeg efektora prostoru. Jezičke oznake su došle kasnije preko tasq.ai, do tri po epizodi.
- 76k trajektorija, 350 sati, 564 scene, 84 zadatka, 50 sakupljača na tri kontinenta.
- Glavni rezultat je ko-trening, a ne samostalni trening: serije pomešane 50/50 sa demonstracijama unutar domena nadmašuju sledeću najbolju metodu za 22 procenta apsolutnog uspeha u distribuciji, 17 procenata van nje.
- IPEC-COMMUNITY/droid_lerobot: 92,233 epizoda, 27,044,326 frejmova, franka, 15 fps, codebase_version v2.0, tri AV1 strima na 180x320, 392 GB.
- Uzorak za otklanjanje grešaka od 2 GB, 100 epizoda, nalazi se na gs://gresearch/robotics/droid_100. Počnite tamo.
BridgeData V2
Najbliže hobi postavci: WidowX 250 6-DoF ruka, 60,096 trajektorija kroz 24 okruženja i 13 veština na 5 Hz. Obratite pažnju na sastav: 50,365 ekspertskih teleoperisanih demonstracija plus 9,731 iz randomizovane skriptovane politike 'uzmi i postavi', tako da oko 16 procenata nije ljudska demonstracija, što je važno za učenje imitacijom kvalitet. Uobičajeno preuzimanje, IPEC-COMMUNITY/bridge_orig_lerobot, izveštava o 53,192 epizode i 1,893,026 frejmova na 5 fps, robot_type widowx: manje od 60,096 iz rada, pa pročitajte broj iz meta/info.json umesto da citirate bilo koji.
Open X-Embodiment
Nije skup podataka u istom smislu: 60 postojećih skupova podataka robota iz 34 laboratorije objedinjeno je u jednu RLDS kolekciju koja pokriva 22 implementacije i preko milion trajektorija. BridgeData V2 se nalazi unutar nje kao bridge_orig; google_robot isečak, fractal20220817_data, konvertuje se u 87.212 epizoda pri 3 fps.
Objedinjavanje nosi upozorenje koje rad jasno navodi. Za RT-X eksperimente, autori konvertuju svaki izvor u akciju krajnjeg efektora sa 7 stepeni slobode (7-DoF), ali ne poravnavaju koordinatne sisteme između skupova podataka i dozvoljavaju da vrednosti akcija budu apsolutne ili relativne pozicije ili brzine, prema originalnoj kontrolnoj šemi svakog robota. Njihov zaključak: isti vektor akcije može izazvati veoma različite pokrete za različite robote.

Nepodudarnost, u četiri dela
Neusklađenost inkarnacije se obično tretira kao jedan nejasan problem. Postoje četiri, one se razlikuju po načinu neuspeha, a dve se ne mogu popraviti skriptovanjem.
1. Stepeni slobode
SO-100 ima pet zglobova ruke plus hvataljku. Računato kao motori, to je ruka sa 6 stepeni slobode (DoF), i SmolVLA rad je tako naziva; računato kao mehanizam za pozicioniranje, to je 5-DoF, i LeRobot je tako naziva u svom docstringu za inverznu kinematiku, koji opisuje IK meke orijentacije na 5-DOF SO-101 gde zglob prati orijentaciju samo delimično. Franka ima sedam zglobova za pozicioniranje. Taj jaz odlučuje koje poze postoje: ruka sa 5 stepeni slobode generalno ne može istovremeno dostići proizvoljnu poziciju i orijentaciju, tako da rešavač vraća najbliže što može, što je drugačiji pokret od demonstriranog. Pozadina: .
# src/lerobot/robots/so_follower/so_follower.py
motors = {
"shoulder_pan": Motor(1, "sts3215", norm_mode_body),
"shoulder_lift": Motor(2, "sts3215", norm_mode_body),
"elbow_flex": Motor(3, "sts3215", norm_mode_body),
"wrist_flex": Motor(4, "sts3215", norm_mode_body),
"wrist_roll": Motor(5, "sts3215", norm_mode_body),
"gripper": Motor(6, "sts3215", MotorNormMode.RANGE_0_100),
}
# action keys are "<motor>.pos"; send_action sync_writes them to
# "Goal_Position" -> a 6-D ABSOLUTE JOINT POSITION command
# openpi/src/openpi/policies/droid_policy.py
def make_droid_example() -> dict:
return {
"observation/exterior_image_1_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/wrist_image_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/joint_position": np.random.rand(7), # seven Franka joints
"observation/gripper_position": np.random.rand(1),
"prompt": "do something",
}
# state = concat(joint_position, gripper_pos) -> 8-DDakle, gotov DROID kontrolni punkt nije prečica. Physical Intelligence isporučuje pi05_droid na gs://openpi-assets/checkpoints/pi05_droid, a isti README koji hvali njegovu širinu upozorava da se ovi ekspertski kontrolni punktovi možda neće generalizovati na vašu postavku. Njegovo stanje je osam Franka brojeva zglobova, a njegovi ključevi slika su exterior_image_1_left i wrist_image_left. Nijedna zastavica to ne pretvara u komandu za SO-100 sa šest motora.
2. Šta akcioni vektor zapravo govori
Dublje od dimenzionalnosti. U LeRobot konverzijama, sva tri govore gde bi hvataljka trebalo da ide, u Kartezijanskom prostoru. SO-100 govori gde bi šest servoa trebalo da ide. Konverzija zahteva kinematički model i rešavač, a ne preoblikovanje.
| Svojstvo | OXE, DROID i Bridge u LeRobot formi | SO-100 u LeRobotu |
|---|---|---|
| Akcioni vektor | 7-D: x, y, z, roll, pitch, yaw, gripper | 6-D: jedna ciljna pozicija po motoru |
| Vektor stanja | 8-D, sa slotom za popunjavanje (google_robot koristi kvaternion) | 6-D, jedan po motoru |
| Okvir | Kartezijanski, neusklađen između skupova podataka | prostor zglobova, kalibracija po ruci |
| Apsolutno ili relativno | bilo koje, odlučuje izvorna laboratorija | apsolutne ciljne pozicije |
| Jedinice | normalizovano po skupu podataka, zatim diskretizovano | stepeni podrazumevano (use_degrees=True), inače -100 do 100 |
| Tihi neuspeh | delta očitana kao apsolutna | neka kalibrisana ruka |
openx2lerobot README dokumentuje objedinjeno 8-dimenzionalno stanje i 7-dimenzionalnu akciju za svaki skup podataka koji konvertuje, odakle potiče `pad` slot. DROID-ova sopstvena RLDS šema se razlikuje: njen `action` na najvišem nivou je 7-vektor od *6 brzina zglobova plus 1 pozicija hvataljke*, sa `cartesian_position`, `cartesian_velocity`, `joint_position` i `joint_velocity` pod `action_dict`. openpi čita prikaz u prostoru zglobova, dok vam LeRobot verzija daje Kartezijanski. Nijedno nije šest apsolutnih uglova servo motora.
LeRobot isporučuje deo koji nedostaje: SO pratilac ima procesor kinematike sa koracima InverseKinematicsEEToJoints i ForwardKinematicsJointsToEE. Njegovi ključevi su ee.x, ee.y, ee.z plus vektor rotacije ee.wx, ee.wy, ee.wz i ee.gripper_pos, tako da se čak i kodiranje orijentacije razlikuje od roll-pitch-yaw u datotekama. IK korak uzima orientation_weight, podrazumevano 0.01, čiji docstring kaže da se postavi 0.0 za IK samo po poziciji na nedovoljno aktuiranim rukama. Možete izgraditi most, ali orijentaciona polovina svake pozajmljene akcije ostaje aproksimirana.
3. Brzina kontrole
DROID je 15 Hz, BridgeData V2 5 Hz, google_robot isečak 3 fps; autori pi0 opisuju open-source deo svoje mešavine kao niskofrekventnu kontrolu između 2 i 10 Hz. LeRobot-ov DatasetRecordConfig podrazumevano postavlja fps 30, episode_time_s 60, reset_time_s 60, num_episodes 50. obučena na podacima od 5 Hz naučila je da jedna akcija pokriva 200 ms. Ponovite je na 30 Hz i ruka će puzati; naivno ponovno uzorkovanje će razmazati kadar gde se hvataljka zatvara. Takođe loše interaguje sa : chunk od 100 koraka je 20 sekundi na 5 Hz, 3.3 na 30 Hz.
4. Kamere
BridgeData V2 je randomizovao dve poze kamere na svakih 50 trajektorija, a na stranici projekta se navodi da većina podataka ionako sadrži samo fiksni prikaz. DROID je koristio podesive ZED 2 nosače plus ZED Mini na zglobu. Imate dve USB veb kamere postavljene odokativno. Položaj kamere nije smetnja za ; to je mnogo od onoga na šta se vizuelni enkoder fokusirao, i ništa u formatu datoteke vam ne govori da se poze razlikuju.
Delovi se dovoljno dobro uklapaju da bi sistem radio. Skup podataka se učitava, obuka počinje, gubitak opada, pojavljuju se kontrolne tačke, nema grešaka. Zatim politika ne radi ništa prepoznatljivo na ruci i provedete dan tražeći grešku u vašoj skripti za obuku. Nema greške: model je naučio distribuciju Kartezijanskih akcija za robota koji ne postoji u vašoj sobi. Počnite od gubitak opada, politika ne radi ništa, a ne od vaših hiperparametara.
Šta se dešava kada ipak pokušate da spojite podatke
Očigledan plan je spajanje: nekoliko hiljada DROID epizoda plus vaših 50. LeRobot odbija, a odbijanje navodi tri stvari koje se razlikuju.
- 1Preuzmite uzorak od 100 epizoda, ne punih 1.7 TB
2 GB je dovoljno da se vidi struktura.
bashpip install gsutil tensorflow tensorflow-datasets gsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 2Konvertujte RLDS u LeRobot format
openx2lerobot obuhvata standardne OXE transformacije i anotira tip robota i frekvenciju kontrole. README ovo stavlja u convert.sh.
bashgit clone https://github.com/Tavish9/any4lerobot.git cd any4lerobot/openx2lerobot python openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 3Pročitajte meta/info.json pre bilo čega drugog
Ovaj fajl odlučuje da li će ostatak vašeg dana funkcionisati.
bashpython -c "import json;d=json.load(open('meta/info.json'));\ print(d['codebase_version'], d['robot_type'], d['fps']);\ print(d['features']['action']['shape'], d['features']['observation.state']['shape'])" - 4Pokušajte spajanje i pročitajte grešku
merge učitava svaki skup podataka, zatim validate_all_metadata proverava fps, robot_type i features u odnosu na prvi na listi, podižući grešku pri prvom neslaganju.
bashlerobot-edit-dataset \ --new_repo_id you/mixed \ --operation.type merge \ --operation.repo_ids "['you/droid100_lerobot', 'you/my_so100_task']" # ValueError: Same fps is expected, but got fps=30 instead of 15.
Referentne vrednosti dolaze iz skupa podataka koji ste prvi naveli, zbog čega se poruka žali na vaših 30 fps umesto DROID-ovih 15. Popravite fps i naići ćete na proveru robot_type; popravite to i naići ćete na proveru features, 7 naspram 6 za akciju. Nijedan redosled ne prolazi, a ista provera se pokreće u vreme snimanja putem sanity_check_dataset_robot_compatibility.
Na trenutnom LeRobot main-u, so100_follower i so101_follower su oba registrovana na jednu zajedničku SOFollowerRobotConfig, tako da string iz stvarnog snimka nije nužno onaj koji očekujete. Pročitajte ga iz sopstvenog meta/info.json, i tretirajte proveru koju ste morali da onemogućite kao proveru koja vam je nešto govorila.
Šta se zapravo prenosi?
Težine, ne epizode. Svaka moderna generalistička politika je apsorbovala deo toga u pretreniranju, a kada sa objavljenog nasleđujete to već usklađeno od strane ljudi sa dovoljnom računarskom snagom da to urade ispravno. Rad pi0 je iskren u pogledu proporcije: 9.1 procenat njegove mešavine za pretreniranje, brojan u vremenskim koracima, su podaci otvorenog koda uključujući OXE, Bridge v2 i DROID. Ta cifra je pi0-ova; mešavina svakog dobavljača se razlikuje.
- Vizuelni i jezički priori: enkoder je video hiljade kuhinja i šolja i zna na šta se odnosi "crveni blok".
- Prior o strukturi manipulacije: prilaz, zatvaranje, podizanje, transport, otpuštanje, nezavisno od otelotvorenja čak i kada brojevi nisu.
- Poznat i dobar skup podataka za testiranje. Ako vaš posao ne može da preuči 100 DROID epizoda, problem je u vašoj postavci.
- Referentne tačke: na domenima skupova podataka malog obima RT-1-X je postigao 50 procenata višu prosečnu stopu uspeha od originalne metode ili RT-1, a RT-2-X je nadmašio RT-2 za oko 3x u pogledu novonastalih veština.
- Nema upotrebljivog nadzora akcija. 7-D Kartezijanski cilj nije 6-D komanda zgloba.
- Nema prenosa položaja kamere, i ništa u podacima vam ne govori da se položaji razlikuju.
- Nema prenosa vremena: izvori od 3, 5 i 15 fps naspram snimača od 30 fps.
- Nema prenosa hvataljke. Robotiq 2F-85 i štampana čeljust na STS3215 se razlikuju po sili, hodu i dinamici.
- Sama skala nije bila dovoljna čak ni za njene autore: u domenima velikih skupova podataka RT-1-X nije nadmašio RT-1 treniran samo na tom skupu podataka.
- Nema smanjenja broja sopstvenih epizoda koje su vam potrebne.
| Sloj modela | Prenosi se? | Zašto |
|---|---|---|
| Vision encoder | Da, snažno | Objekti i scene su nezavisni od otelotvorenja |
| Language grounding | Da | Uputstva su tekst, ne geometrija |
| Cross-modal fusion | Uglavnom | Obraća pažnju na objekat naveden u upitu |
| Proprioception encoder | Ne | Ulazna dimenzija i semantika zglobova se razlikuju |
| Action head | Ne | Trenirano na 7-D Kartezijanskom prostoru u kojem se ne nalazite |
| Normalisation statistics | Ne, i opasno | Strane statistike pomeraju svaku komandu |
Zato se SmolVLA ponaša drugačije na jeftinoj ruci. Njegov rad bira 481 skup podataka zajednice sa Hugging Face-a, filtriran po tipu otelotvorenja, broju epizoda, kvalitetu podataka i pokrivenosti kadrova: 22.9K epizoda, 10.6M kadrova, evaluirano na stvarnim SO-100 i SO-101 rukama. Malo i usklađeno pobeđuje veliko i neusklađeno. Uporedite na ACT u odnosu na SmolVLA.
Tri puta koja vredi slediti
Put A: fino podešavanje iz kontrolne tačke koja je već apsorbovala podatke
Većina ljudi bi trebalo da izabere ovaj. Nikada ne dirate DROID ili Open X-Embodiment: izaberite politiku čija je pretrenaža već apsorbovala podatke o unakrsnom otelotvorenju, snimite sopstvene epizode, fino podesite.
| Politika | Parametri | Min. epizoda | Format skupa podataka | GPU nivo | Inferencija | Osnovna kontrolna tačka |
|---|---|---|---|---|---|---|
| GR00T N1.7 | ~3 B, ~40 M trenirano u finom podešavanju | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 152 ms per step | nvidia/GR00T-N1.7-3B |
| GR00T N1.5 | ~3 B | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 165 ms | nvidia/GR00T-N1.5-3B |
| Pi0.5 | ~3 B, PaliGemma okosnica | 50 | LeRobot v3.0 | A100 or H100 80 GB | 485 ms | lerobot/pi05_base |
| SmolVLA | ~450 M | 30 | LeRobot v3.0 | RTX 4090 or any 24 GB | 245 ms | lerobot/smolvla_base |
| ACT | ~80 M | 50 | LeRobot v3.0 | RTX 4090 or any 24 GB | 20 ms | nijedan, od nule |
ACT je iskren granični slučaj: nema osnovnog modela, tako da nijedan javni podatak nikada ne stiže do njega. To nije automatski nedostatak, jer sa 20 ms po koraku akcije, to je jedini od pet koji može zatvoriti brzu petlju, kao što stranica ACT navodi. Izaberite po zadatku koristeći svih pet upoređenih, GR00T N1.7 protiv Pi0.5, i 332 rezultata benčmarka za 85 modela u areni.
Putanja B: koristite DROID kao testni uređaj
Uzorak od 100 epizoda je najboljih 2 GB koje ćete preuzeti ovog meseca, i to ne za obuku. To je skup podataka za koji znate da je ispravan. Pokrenite svoj konverter, učitavač i kratak GPU posao na njemu; sve što ne uspe je infrastrukturna greška pronađena dok je bila jeftina. NVIDIA radi isto u velikom obimu: kartica GR00T N1.7 navodi četiri post-trenirane varijante, za Bridge i Fractal u SimplerEnv, DROID i LIBERO.
Putanja C: snimite svoje, namerno
Trideset do pedeset zvuči malo pored 76.000 dok ne zapamtite da su vaše jedine sa vašom rukom, vašim kamerama i vašim stolom. Sa podrazumevanim postavkama LeRobota, 50 epizoda je 100 minuta realnog vremena. Pogledajte , i .

Dva načina da se od javnih podataka dođe do funkcionalne politike
All of this runs on your own machine plus a rented GPU. Knowing the manual path matters because when something breaks you will know which layer broke.
- 1Install LeRobot with the extras the scripts need
The record and train entry points each declare their own extra.
bashpip install 'lerobot[core_scripts]' # lerobot-record pip install 'lerobot[training]' # lerobot-train pip install gsutil tensorflow tensorflow-datasets - 2Get a small, known-good slice
100 DROID episodes, 2 GB.
bashgsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 3Convert to LeRobot form
Writes the unified 8-D state and 7-D action, annotating robot type and control frequency.
bashpython openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 4Check the version against your trainer
The converter README documents v3.0 output; the published IPEC-COMMUNITY datasets report v2.0. GR00T wants v2.0 or v2.1 and crashes on v3.0; Pi0.5, SmolVLA and ACT want v3.0. Mind the gap: the only conversion script on LeRobot main goes 2.1 to 3.0.
bashpython src/lerobot/scripts/convert_dataset_v21_to_v30.py \ --repo-id=you/droid100_lerobot - 5Record your own episodes
Defaults: 30 fps, 60 s per episode, 60 s reset, 50 episodes. The teleoperator type is so100_leader.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.cameras="{front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --dataset.repo_id=you/so100_pick_block \ --dataset.num_episodes=50 \ --dataset.single_task="Pick up the red block and put it in the bowl" - 6Fine-tune on your data only
Weights from public data, actions from your own. Do not mix the datasets.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=you/so100_pick_block \ --policy.device=cuda \ --batch_size=4 \ --steps=20000
Not in training; the GPU job is hours. The conversion, the version mismatch and the moment you find your dataset is v2.0 and your trainer wants v3.0 are days. Read dataset rejected as v3 first.
The platform removes the GPU and pipeline plumbing. It does not remove the embodiment mismatch: point the trainer at a converted DROID dataset and you get a policy trained on Franka actions, exactly as you would locally.
- 1Pick a policy, not a dataset
The five trainable policies, with parameter counts, GPU tiers and latencies, are at /policies.
- 2Record with the desktop client
It writes LeRobot-format datasets, episodes, camera streams and joint states, straight out of a teleop session. No conversion step to get wrong.
- 3Or bring a dataset you already have
The training form accepts one from /directory, a Hugging Face repo id, or your own machine. A repo id means a converted OXE dataset will load, and the mismatch loads with it.
- 4Train on a rented GPU
The backend rents a card on a spot market by required VRAM. SmolVLA or ACT on 24 GB: 2 to 5 hours, about 1 to 3 USD. GR00T or Pi0.5 on A100 or H100: 3 to 6 hours, about 4 to 12 USD. See /pricing.
- 5Serve it back to the arm
/api/inference/pod auto-provisions a GPU pod serving the policy; the local client talks to that endpoint. Pods carry an idle watchdog and destroy themselves, so nothing keeps billing silently.
Inference has to sit next to the servos for fast tasks. The control loop is 20 to 485 ms per action step depending on the model, and public-internet round trips turn a working policy into a hesitant one. Remote inference is fine for slow pick-and-place, not fast reactive motion.
The platform helps with the boring parts: the right format for the right arm at the right frame rate, and no babysitting a spot instance. It helps with nothing else in this article.

Šta košta svaka putanja
| Putanja | Skladištenje | Ljudsko vreme | GPU trošak | Šansa da pomeri vašu ruku |
|---|---|---|---|---|
| Konvertovani DROID sam | 392 GB | dana konverzije | 4 do 12 USD | veoma niska, pogrešan akcioni prostor |
| DROID spojen sa vašim epizodama | oba | blokirano od strane validate_all_metadata | n/a | nema, ne pokreće se |
| SmolVLA, 30 do 50 sopstvenih epizoda | nekoliko GB | 100 min snimanja | 1 do 3 USD | visoka |
| GR00T N1.7, 50 sopstvenih epizoda | nekoliko GB | 100 min snimanja | 4 do 12 USD | visoka |
| ACT od nule, 50 sopstvenih epizoda | nekoliko GB | 100 min snimanja | 1 do 3 USD | visoka, 20 ms inferencija |
| DROID uzorak kao testni uređaj | 2 GB | jedno popodne | jedno kratko pokretanje | visoka, kao validacija |
Asimetrija je poenta: putanja koja pozajmljuje najviše podataka je najskuplja i najmanje verovatno će pomeriti vašu ruku. Manje od dva sata vaše sopstvene teleoperacije pobeđuje terabajt tuđe Franke. Još uvek nemate ruku? /live strimuje fizički SO-100 bez prijave. Zatim obučite svoju prvu politiku, i SmolVLA na SO-100 za specifičan vodič.
Preuzmite uzorak DROID-a od 2 GB i koristite ga da dokažete svoj pajplajn. Ignorišite ostalih 1.7 TB. Snimite 50 epizoda jednog zadatka sa fiksnim kamerama. Fine-tune SmolVLA prvo, jer je sa minimalno 30 epizoda na kartici od 24 GB najjeftinije za iteraciju, zatim pokušajte GR00T N1.7 na istim podacima. Uporedite na svom zadatku, ne na benčmarku.
Snimite skupove podataka koji već odgovaraju vašoj ruci
Desktop klijent piše LeRobot-formatirane skupove podataka direktno iz teleop sesije: prava ruka, prava brzina kadrova, pravi akcioni prostor. Bez RLDS konverzije, bez premapiranja.
Preuzmite desktop klijentMogu li da treniram politiku na DROID-u i pokrenem je na svom SO-100?▾
Ne direktno. U LeRobot verziji, DROID akcije su 7-D komande krajnjeg efektora na Franka Panda robotu pri 15 fps; u sirovom RLDS-u to su 6 brzina zglobova plus pozicija hvataljke. SO-100 prihvata 6 apsolutnih pozicija zglobova. Trebao bi vam sloj inverzne kinematike, a čak i tada zglob sa 5 stepeni slobode ne može reprodukovati proizvoljne poze sa 6 stepeni slobode.
Mogu li da mešam DROID ili Bridge epizode sa svojim SO-100 epizodama?▾
Ne. validate_all_metadata zahteva identične fps, robot_type i feature schema i podiže ValueError pri prvom neslaganju. Sve tri se razlikuju: 15 ili 5 fps naspram 30, franka ili widowx naspram vaše ruke, oblici akcija od 7 naspram 6. Prepisivanje metapodataka da bi se prošla provera ne rešava semantiku.
Da li je Open X-Embodiment onda beskoristan za jeftinu ruku?▾
Ne, ali njegova vrednost vam dolazi kroz unapred trenirane težine, a ne kroz epizode. Skupovi podataka otvorenog koda uključujući OXE, Bridge v2 i DROID čine 9.1 procenata pi0 mešavine za pre-trening, a NVIDIA isporučuje GR00T N1.7 varijante post-trenirane na Bridge, Fractal, DROID i LIBERO. Ono što ne možete je dodati te epizode sopstvenom snimku.
Koja politika najviše koristi od javnih podataka o unakrsnom otelotvorenju?▾
Pi0.5 i GR00T modeli nose najviše pre-treninga za unakrsno otelotvorenje, ali SmolVLA se često najbolje ponaša na jeftinoj ruci: njegov skup za pre-trening je 481 skup podataka zajednice, 22.9K epizoda i 10.6M kadrova, evaluiran na stvarnim SO-100 i SO-101 rukama. ACT je suprotno: nema osnovnog modela, 20 ms po koraku akcije.
Koliko mi je zapravo potrebno sopstvenih epizoda?▾
30 za SmolVLA, 50 za GR00T N1.7, GR00T N1.5, Pi0.5 i ACT. Sa LeRobot podrazumevanim vrednostima od 60 s po epizodi i 60 s resetovanja, 50 epizoda je 100 minuta stvarnog vremena. Pozajmljeni podaci o unakrsnom otelotvorenju ne smanjuju te brojeve.
Sources
- DROID: Veliki skup podataka za manipulaciju robotima u stvarnom okruženju
- DROID dokumentacija: veličine za preuzimanje i RLDS šema epizoda
- BridgeData V2: Skup podataka za učenje robota u velikom obimu
- BridgeData V2 stranica projekta: sastav i pokrivenost kamere
- Open X-Embodiment: Skupovi podataka za učenje robotike i RT-X modeli
- Open X-Embodiment stranica projekta
- google-deepmind/open_x_embodiment: lista skupova podataka i RT-1-X kontrolne tačke
- any4lerobot: openx2lerobot konverter i njegovo unificirano 8-D stanje, 7-D akcija
- IPEC-COMMUNITY/droid_lerobot: meta/info.json i veličina repozitorijuma
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: google_robot isečak pri 3 fps
- huggingface/lerobot: SO pratilac, procesor kinematike, konfiguracije za agregaciju i snimanje
- openpi: DROID ulazi politike i pi05_droid kontrolna tačka
- pi0: Model toka vizije-jezika-akcije za opštu kontrolu robota
- SmolVLA: Model vizije-jezika-akcije za pristupačnu i efikasnu robotiku
Sources
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- DROID docs: download sizes and the RLDS episode schema
- BridgeData V2: A Dataset for Robot Learning at Scale
- BridgeData V2 project page: composition and camera coverage
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Open X-Embodiment project page
- google-deepmind/open_x_embodiment: dataset list and RT-1-X checkpoints
- any4lerobot: the openx2lerobot converter and its unified 8-D state, 7-D action
- IPEC-COMMUNITY/droid_lerobot: meta/info.json and repo size
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: the google_robot slice at 3 fps
- huggingface/lerobot: SO follower, kinematics processor, aggregate and record configs
- openpi: DROID policy inputs and the pi05_droid checkpoint
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started