
DROID, BridgeData V2 a Open X-Embodiment se převádějí na 7D akce koncového efektoru na 6 a 7-stupňových ramenech. SO-100 přijímá 6 kloubových pozic. Co se přenáší, co ne a co dělat místo toho.
Stručná verze
- •Sestavení LeRobot všech tří sdílí jednu konvenci: 7D akci koncového efektoru [x, y, z, roll, pitch, yaw, gripper] a 8D stav s výplňovým slotem. SO-100 přijímá šest absolutních pozic kloubů.
- •Tento 7D vektor je artefaktem konvertoru: vlastní akční pole RLDS DROIDu je 6 rychlostí kloubů plus pozice chapadla, s kartézským pohledem v action_dict.
- •Čtvery hodiny: DROID 15 fps, BridgeData V2 5 fps, výřez google_robot 3 fps, nahrávání SO-100 při 30 fps.
- •Nemůžete je sloučit s vlastními daty. validate_all_metadata vyvolá chybu při prvním rozdílu v fps, robot_type nebo features, a všechny tři se liší.
- •Přenositelné jsou předtrénované váhy, nikoli epizody. Open-source data tvoří 9.1 procenta směsi pro předtrénování pi0.
- •Jejich nejlevnější skutečné použití je testovací přípravek: známý dobrý 2 GB, 100-epizodní vzorek DROID, který prokáže funkčnost vašeho pipeline, než budete nahrávat celý víkend.
Na Google Cloud bucketu je veřejný dataset s milionem trajektorií a na stole, který stál 110 až 150 EUR v dílech. Proč první nemůže učit druhého? Částečně může, ale téměř žádný přenos se neděje tam, kde lidé očekávají, a část, která vypadá nejsnadněji, nefunguje vůbec.
Následuje: co je uvnitř , a , kde se každý střetává s nízkonákladovým 5-DoF ramenem, a co dělat místo toho. Každé číslo níže pochází z příslušného článku, karty datasetu nebo zdrojového souboru.
Co tyto tři datasety skutečně obsahují
| DROID | BridgeData V2 | Open X-Embodiment | |
|---|---|---|---|
| Robot | Franka Panda, 7 DoF, Robotiq 2F-85 | WidowX 250, 6 DoF, souprava za ~4 000 USD | 22 provedení, 60 datových sad, 34 laboratoří |
| Měřítko | 76 tisíc trajektorií, 350 hodin | 60 096 trajektorií | 1M+ trajektorií, 527 dovedností |
| Rozmanitost | 564 scén, 84 úloh, 50 sběračů | 24 prostředí, 13 dovedností | 160 266 úloh, 21 institucí |
| Složení | vše teleoperováno | 50 365 teleoperovaných, 9 731 skriptovaných | dle zdrojové laboratoře |
| Frekvence řízení | 15 Hz | 5 Hz | liší se, od 3 snímků za sekundu výše |
| Kamery | 2 x ZED 2 externí, 1 x ZED Mini na zápěstí | až 4, většina epizod pouze s pevnou kamerou | cokoli laboratoř použila |
| Surové stažení | 1.7 TB RLDS, 8.7 TB surového sterea | archivy JPEG | TFDS buckety pro každou datovou sadu |
Málokdo si stále stahuje 1.7 TB RLDS TFRecords. Komunitní organizace IPEC-COMMUNITY znovu publikovala většinu Open X-Embodiment ve formátu LeRobot dataset s AV1 videem, kde DROID zabírá 392 GB. To je verze, se kterou budete pracovat, a její meta/info.json je to, co si přečtěte jako první.
DROID
Nejstandardizovanější ze tří. Jedna souprava všude: Franka Panda s chapadlem Robotiq 2F-85, dvě nastavitelné stereo kamery ZED 2 a ZED Mini na zápěstí, teleoperováno s ovladači Meta Quest 2, nahráváno přes Polymetis na 15 Hz v kloubovém i koncovém efektoru prostoru. Jazykové štítky přišly později přes tasq.ai, až tři na epizodu.
- 76k trajektorií, 350 hodin, 564 scén, 84 úloh, 50 sběračů na třech kontinentech.
- Hlavním výsledkem je ko-trénink, nikoli samostatný trénink: dávky smíchané 50/50 s ukázkami z domény překonaly další nejlepší metodu o 22 procent absolutního úspěchu v distribuci a 17 procent mimo ni.
- IPEC-COMMUNITY/droid_lerobot: 92,233 episodes, 27,044,326 frames, franka, 15 fps, codebase_version v2.0, three AV1 streams at 180x320, 392 GB.
- 2 GB, 100-epizodní vzorek pro ladění se nachází na gs://gresearch/robotics/droid_100. Začněte tam.
BridgeData V2
Nejblíže k hobby sestavě: rameno WidowX 250 se 6 stupni volnosti, 60 096 trajektorií napříč 24 prostředími a 13 dovednostmi při 5 Hz. Všimněte si složení: 50 365 expertních teleoperovaných demonstrací plus 9 731 z randomizované skriptované politiky pick-and-place, takže asi 16 procent není lidská demonstrace, což je důležité pro učení napodobováním kvalitu. Běžné stažení, IPEC-COMMUNITY/bridge_orig_lerobot, uvádí 53 192 epizod a 1 893 026 snímků při 5 fps, robot_type widowx: méně než 60 096 uvedených v článku, takže čtěte počet z meta/info.json namísto citování jednoho z nich.
Open X-Embodiment
Nejedná se o datovou sadu v obvyklém smyslu: 60 existujících robotických datových sad ze 34 laboratoří bylo sloučeno do jedné kolekce RLDS pokrývající 22 provedení a přes milion trajektorií. BridgeData V2 je v ní obsažena jako bridge_orig; výřez google_robot, fractal20220817_data, se převádí na 87 212 epizod při 3 fps.
Sloučení s sebou nese výhradu, kterou článek výslovně uvádí. Pro experimenty RT-X autoři převádějí každý zdroj na akci koncového efektoru se 7 stupni volnosti (7-DoF), ale nesrovnávají souřadnicové systémy napříč datovými sadami a umožňují, aby hodnoty akcí byly absolutní nebo relativní pozice či rychlosti, podle původního řídicího schématu každého robota. Jejich závěr: stejný vektor akce může vyvolat velmi odlišné pohyby u různých robotů.

Nesoulad, ve čtyřech částech
Neshoda ztělesnění je obvykle považována za jeden vágní problém. Jsou to čtyři, selhávají různě a dva nelze opravit skriptováním.
1. Stupně volnosti
SO-100 má pět kloubů ramene plus chapadlo. Počítáno jako motory je to 6-DoF rameno, a článek SmolVLA to tak nazývá; počítáno jako polohovací mechanismus je to 5-DoF, a LeRobot to tak nazývá ve svém docstringu inverzní kinematiky, který popisuje IK s měkkou orientací na 5-DOF SO-101, kde zápěstí sleduje orientaci pouze částečně. Franka má sedm polohovacích kloubů. Tato mezera rozhoduje o tom, jaké pózy existují: 5-DoF rameno nemůže obecně dosáhnout libovolné pozice a orientace najednou, takže řešitel vrátí nejbližší možnou, což je jiný pohyb než ten demonstrovaný. Pozadí: stupně volnosti.
# src/lerobot/robots/so_follower/so_follower.py
motors = {
"shoulder_pan": Motor(1, "sts3215", norm_mode_body),
"shoulder_lift": Motor(2, "sts3215", norm_mode_body),
"elbow_flex": Motor(3, "sts3215", norm_mode_body),
"wrist_flex": Motor(4, "sts3215", norm_mode_body),
"wrist_roll": Motor(5, "sts3215", norm_mode_body),
"gripper": Motor(6, "sts3215", MotorNormMode.RANGE_0_100),
}
# action keys are "<motor>.pos"; send_action sync_writes them to
# "Goal_Position" -> a 6-D ABSOLUTE JOINT POSITION command
# openpi/src/openpi/policies/droid_policy.py
def make_droid_example() -> dict:
return {
"observation/exterior_image_1_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/wrist_image_left": np.random.randint(256, size=(224, 224, 3), dtype=np.uint8),
"observation/joint_position": np.random.rand(7), # seven Franka joints
"observation/gripper_position": np.random.rand(1),
"prompt": "do something",
}
# state = concat(joint_position, gripper_pos) -> 8-DHotový DROID checkpoint tedy není zkratkou. Physical Intelligence dodává pi05_droid na gs://openpi-assets/checkpoints/pi05_droid a stejný README, který chválí jeho šíři, varuje, že tyto expertní checkpointy se nemusí zobecnit na vaše nastavení. Jeho stav je osm čísel kloubů Franka a jeho klíče obrázků jsou exterior_image_1_left a wrist_image_left. Žádný flag to nepřemění na šestipohybový příkaz SO-100.
2. Co akční vektor skutečně říká
Hlouběji než dimenzionalita. V konverzích LeRobot všechny tři říkají, kam by měl jít chapadlo, v kartézském prostoru. SO-100 říká, kam by mělo jít šest servomotorů. Převod vyžaduje kinematický model a řešič, nikoli změnu tvaru.
| Vlastnost | OXE, DROID a Bridge ve formě LeRobot | SO-100 v LeRobot |
|---|---|---|
| Akční vektor | 7-D: x, y, z, roll, pitch, yaw, gripper | 6-D: jedna cílová pozice na motor |
| Stavový vektor | 8-D, s výplňovým slotem (google_robot používá kvaternion) | 6-D, jedna na motor |
| Rámec | Kartézský, nezarovnaný napříč datovými sadami | prostor kloubů, kalibrace na rameno |
| Absolutní nebo relativní | buď, rozhodnuto zdrojovou laboratoří | absolutní cílové pozice |
| Jednotky | normalizováno na datovou sadu, poté diskretizováno | stupně ve výchozím nastavení (use_degrees=True), jinak -100 až 100 |
| Tiché selhání | delta čtená jako absolutní | nezkalibrované rameno |
Soubor README projektu openx2lerobot dokumentuje jednotný 8-dim stav a 7-dim akci pro každý datový soubor, který konvertuje, což je původ slotu pad. Vlastní schéma RLDS projektu DROID se liší: jeho top-level action je 7-vektor 6 kloubových rychlostí plus 1 pozice chapadla, s cartesian_position, cartesian_velocity, joint_position a joint_velocity pod action_dict. openpi čte pohled v kloubovém prostoru, sestavení LeRobot vám předá kartézský. Ani jedno není šest absolutních úhlů serva.
LeRobot dodává chybějící díl: SO follower má kinematický procesor s kroky InverseKinematicsEEToJoints a ForwardKinematicsJointsToEE. Jeho klíče jsou ee.x, ee.y, ee.z plus rotační vektor ee.wx, ee.wy, ee.wz a ee.gripper_pos, takže i kódování orientace se liší od roll-pitch-yaw v souborech. Krok IK přijímá orientation_weight, výchozí hodnota 0.01, jehož docstring říká, že pro IK pouze na pozici u nedostatečně ovládaných ramen se má nastavit 0.0. Můžete postavit most, ale orientační polovina každé vypůjčené akce zůstává aproximována.
3. Řídicí frekvence
DROID je 15 Hz, BridgeData V2 5 Hz, výřez google_robot 3 fps; autoři pi0 popisují open-source část své směsi jako nízkofrekvenční řízení mezi 2 a 10 Hz. DatasetRecordConfig LeRobotu má výchozí hodnoty fps 30, episode_time_s 60, reset_time_s 60, num_episodes 50. Politika trénovaná na datech s frekvencí 5 Hz se naučila, že jedna akce pokrývá 200 ms. Přehrání při 30 Hz způsobí, že se rameno plazí; naivní převzorkování rozmaže snímek, kde se chapadlo zavírá. Špatně také interaguje s rozdělováním akcí na bloky: 100-krokový blok je 20 sekund při 5 Hz, 3.3 při 30 Hz.
4. Kamery
BridgeData V2 randomizovala dvě pozice kamer každých 50 trajektorií a její projektová stránka uvádí, že většina dat stejně obsahuje pouze pevný pohled. DROID používal nastavitelné držáky ZED 2 plus ZED Mini na zápěstí. Máte dvě USB webkamery umístěné od oka. Pozice kamery není rušivá proměnná pro ; je to velká část toho, na co se vizuální kodér zaměřil, a nic ve formátu souboru vám neřekne, že se pozice liší.
Díly do sebe zapadají dostatečně dobře, aby to fungovalo. Dataset se načte, trénink začne, ztráta klesá, objevují se checkpointy, nic nehlásí chybu. Pak politika nedělá na rameni nic rozpoznatelného a vy strávíte den hledáním chyby ve svém tréninkovém skriptu. Žádná chyba tam není: model se naučil kartézskou distribuci akcí pro robota, který ve vašem pokoji neexistuje. Začněte u ztráta klesá, politika nic nedělá, ne u svých hyperparametrů.
Co se stane, když se data přesto pokusíte sloučit
Zřejmý plán je zřetězit: několik tisíc epizod DROID plus vašich 50. LeRobot to odmítá a odmítnutí jmenuje tři věci, které se liší.
- 1Stáhněte 100-epizodní vzorek, nikoli plných 1,7 TB
2 GB stačí k zobrazení struktury.
bashpip install gsutil tensorflow tensorflow-datasets gsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 2Převeďte RLDS do formátu LeRobot
openx2lerobot obaluje standardní transformace OXE a anotuje typ robota a řídicí frekvenci. Soubor README to uvádí v convert.sh.
bashgit clone https://github.com/Tavish9/any4lerobot.git cd any4lerobot/openx2lerobot python openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 3Před čímkoli jiným si přečtěte meta/info.json
Tento soubor rozhoduje, zda zbytek vašeho dne bude fungovat.
bashpython -c "import json;d=json.load(open('meta/info.json'));\ print(d['codebase_version'], d['robot_type'], d['fps']);\ print(d['features']['action']['shape'], d['features']['observation.state']['shape'])" - 4Vyzkoušejte sloučení a přečtěte si chybu
merge načte každou datovou sadu, poté validate_all_metadata zkontroluje fps, robot_type a features proti první v seznamu a vyvolá chybu při první neshodě.
bashlerobot-edit-dataset \ --new_repo_id you/mixed \ --operation.type merge \ --operation.repo_ids "['you/droid100_lerobot', 'you/my_so100_task']" # ValueError: Same fps is expected, but got fps=30 instead of 15.
Referenční hodnoty pocházejí z datové sady, kterou jste uvedli jako první, proto si zpráva stěžuje na vašich 30 fps namísto DROIDových 15. Opravte fps a narazíte na kontrolu robot_type; opravte to a narazíte na kontrolu features, 7 proti 6 pro akci. Žádné pořadí neprojde a stejná ochrana se spouští v době záznamu prostřednictvím sanity_check_dataset_robot_compatibility.
Na aktuální hlavní verzi LeRobot jsou so100_follower a so101_follower oba registrovány na jednu sdílenou SOFollowerRobotConfig, takže řetězec ze skutečného záznamu nemusí být nutně ten, který očekáváte. Přečtěte si jej z vlastního meta/info.json a kontrolu, kterou jste museli zakázat, považujte za kontrolu, která vám něco říkala.
Co se tedy skutečně přenáší?
Váhy, nikoli epizody. Každá moderní generalistická politika absorbovala část z toho v předtréninku, a když doladíte z vydaného kontrolního bodu zdědíte to již sladěné lidmi s výpočetním výkonem, aby to udělali správně. Článek pi0 je upřímný ohledně podílu: 9.1 procenta jeho předtréninkové směsi, počítáno v časových krocích, jsou open-source data včetně OXE, Bridge v2 a DROID. Toto číslo je pi0; směs každého dodavatele se liší.
- Vizuální a jazykové priority: kodér viděl tisíce kuchyní a hrnků a ví, na co se odkazuje "červený blok".
- Priorita nad manipulační strukturou: přiblížení, zavření, zvednutí, transport, uvolnění, nezávislé na ztělesnění, i když čísla nejsou.
- Známá dobrá datová sada pro testování. Pokud vaše úloha nedokáže přetrénovat 100 DROID epizod, problém je ve vašem nastavení.
- Referenční body: v doménách s malými datovými sadami dosáhl RT-1-X o 50 procent vyšší průměrné úspěšnosti než původní metoda nebo RT-1, a RT-2-X překonal RT-2 přibližně 3x v emergentních dovednostech.
- Žádná použitelná supervize akcí. 7D kartézský cíl není 6D kloubový příkaz.
- Žádný přenos pozice kamery a nic v datech vám neřekne, že se pozice liší.
- Žádný přenos časování: zdroje 3, 5 a 15 fps proti záznamníku 30 fps.
- Žádný přenos chapadla. Robotiq 2F-85 a tištěná čelist na STS3215 se liší silou, zdvihem a dynamikou.
- Samotná škála nestačila ani pro její autory: v doménách s velkými datovými sadami RT-1-X nepřekonal RT-1 trénovaný pouze na této datové sadě.
- Žádné snížení počtu vlastních epizod, které potřebujete.
| Vrstva modelu | Přenáší se? | Proč |
|---|---|---|
| Vizuální kodér | Ano, silně | Objekty a scény jsou nezávislé na ztělesnění |
| Jazykové uzemnění | Ano | Instrukce jsou text, nikoli geometrie |
| Křížově-modální fúze | Většinou | Věnuje pozornost objektu pojmenovanému ve výzvě |
| Proprioceptivní kodér | Ne | Vstupní dimenze a sémantika kloubů se liší |
| Akční hlava | Ne | Trénováno na 7D kartézském prostoru, ve kterém se nenacházíte |
| Normalizační statistiky | Ne, a nebezpečné | Cizí statistiky posouvají každý příkaz |
Proto SmolVLA se chová jinak na nízkonákladovém rameni. Jeho článek vybírá 481 komunitních datových sad z Hugging Face, filtrovaných podle typu ztělesnění, počtu epizod, kvality dat a pokrytí snímků: 22.9K epizod, 10.6M snímků, vyhodnoceno na skutečných ramenech SO-100 a SO-101. Malé a sladěné poráží velké a nesladěné. Porovnejte na ACT proti SmolVLA.
Tři cesty, které stojí za to se vydat
Cesta A: jemné doladění z kontrolního bodu, který již data absorboval
Většina lidí by měla zvolit tuto. Nikdy se nedotýkáte DROID ani Open X-Embodiment: vyberte politiku, jejíž předtrénování již absorbovalo data napříč ztělesněními, nahrajte si vlastní epizody, jemně dolaďte.
| Politika | Parametry | Min. epizody | Formát datové sady | Úroveň GPU | Inference | Základní kontrolní bod |
|---|---|---|---|---|---|---|
| GR00T N1.7 | ~3 B, ~40 M trained in fine-tuning | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 152 ms per step | nvidia/GR00T-N1.7-3B |
| GR00T N1.5 | ~3 B | 50 | LeRobot v2.0 or v2.1 | A100 or H100 80 GB | 165 ms | nvidia/GR00T-N1.5-3B |
| Pi0.5 | ~3 B, PaliGemma backbone | 50 | LeRobot v3.0 | A100 or H100 80 GB | 485 ms | lerobot/pi05_base |
| SmolVLA | ~450 M | 30 | LeRobot v3.0 | RTX 4090 or any 24 GB | 245 ms | lerobot/smolvla_base |
| ACT | ~80 M | 50 | LeRobot v3.0 | RTX 4090 or any 24 GB | 20 ms | none, from scratch |
ACT je upřímný okrajový případ: žádný základní model, takže se k němu nikdy nedostanou žádná veřejná data. To není automaticky nevýhoda, protože s 20 ms na akční krok je jediným z pěti, který dokáže uzavřít rychlou smyčku, jak stránka ACT uvádí. Vyberte podle úkolu pomocí všech pět porovnáno, GR00T N1.7 proti Pi0.5, a 332 výsledků benchmarků napříč 85 modely v aréně.
Cesta B: použijte DROID jako testovací zařízení
Vzorek 100 epizod je nejlepších 2 GB, které si tento měsíc stáhnete, a to ne pro trénink. Je to datová sada, o které víte, že je správná. Spusťte na ní svůj konvertor, zavaděč a krátkou úlohu na GPU; cokoli, co selže, je chyba infrastruktury nalezená, když to bylo levné. NVIDIA dělá totéž ve velkém: karta GR00T N1.7 uvádí čtyři varianty po tréninku, pro Bridge a Fractal v SimplerEnv, DROID a LIBERO.
Cesta C: zaznamenejte si vlastní, záměrně
Třicet až padesát zní málo vedle 76 000, dokud si nevzpomenete, že vaše jsou jediné s vaší paží, vašimi kamerami a vaším stolem. Při výchozím nastavení LeRobot je 50 epizod 100 minut reálného času. Viz , a .

Dva způsoby, jak se dostat od veřejných dat k funkční politice
All of this runs on your own machine plus a rented GPU. Knowing the manual path matters because when something breaks you will know which layer broke.
- 1Install LeRobot with the extras the scripts need
The record and train entry points each declare their own extra.
bashpip install 'lerobot[core_scripts]' # lerobot-record pip install 'lerobot[training]' # lerobot-train pip install gsutil tensorflow tensorflow-datasets - 2Get a small, known-good slice
100 DROID episodes, 2 GB.
bashgsutil -m cp -r gs://gresearch/robotics/droid_100 ~/tensorflow_datasets/ - 3Convert to LeRobot form
Writes the unified 8-D state and 7-D action, annotating robot type and control frequency.
bashpython openx_rlds.py \ --raw-dir ~/tensorflow_datasets/droid_100/1.0.0 \ --local-dir ~/lerobot_droid100 \ --repo-id you/droid100_lerobot \ --use-videos - 4Check the version against your trainer
The converter README documents v3.0 output; the published IPEC-COMMUNITY datasets report v2.0. GR00T wants v2.0 or v2.1 and crashes on v3.0; Pi0.5, SmolVLA and ACT want v3.0. Mind the gap: the only conversion script on LeRobot main goes 2.1 to 3.0.
bashpython src/lerobot/scripts/convert_dataset_v21_to_v30.py \ --repo-id=you/droid100_lerobot - 5Record your own episodes
Defaults: 30 fps, 60 s per episode, 60 s reset, 50 episodes. The teleoperator type is so100_leader.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.cameras="{front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --dataset.repo_id=you/so100_pick_block \ --dataset.num_episodes=50 \ --dataset.single_task="Pick up the red block and put it in the bowl" - 6Fine-tune on your data only
Weights from public data, actions from your own. Do not mix the datasets.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=you/so100_pick_block \ --policy.device=cuda \ --batch_size=4 \ --steps=20000
Not in training; the GPU job is hours. The conversion, the version mismatch and the moment you find your dataset is v2.0 and your trainer wants v3.0 are days. Read dataset rejected as v3 first.
The platform removes the GPU and pipeline plumbing. It does not remove the embodiment mismatch: point the trainer at a converted DROID dataset and you get a policy trained on Franka actions, exactly as you would locally.
- 1Pick a policy, not a dataset
The five trainable policies, with parameter counts, GPU tiers and latencies, are at /policies.
- 2Record with the desktop client
It writes LeRobot-format datasets, episodes, camera streams and joint states, straight out of a teleop session. No conversion step to get wrong.
- 3Or bring a dataset you already have
The training form accepts one from /directory, a Hugging Face repo id, or your own machine. A repo id means a converted OXE dataset will load, and the mismatch loads with it.
- 4Train on a rented GPU
The backend rents a card on a spot market by required VRAM. SmolVLA or ACT on 24 GB: 2 to 5 hours, about 1 to 3 USD. GR00T or Pi0.5 on A100 or H100: 3 to 6 hours, about 4 to 12 USD. See /pricing.
- 5Serve it back to the arm
/api/inference/pod auto-provisions a GPU pod serving the policy; the local client talks to that endpoint. Pods carry an idle watchdog and destroy themselves, so nothing keeps billing silently.
Inference has to sit next to the servos for fast tasks. The control loop is 20 to 485 ms per action step depending on the model, and public-internet round trips turn a working policy into a hesitant one. Remote inference is fine for slow pick-and-place, not fast reactive motion.
The platform helps with the boring parts: the right format for the right arm at the right frame rate, and no babysitting a spot instance. It helps with nothing else in this article.

Co stojí každá cesta
| Cesta | Úložiště | Lidský čas | Náklady na GPU | Šance, že pohne vaší paží |
|---|---|---|---|---|
| Samostatný konvertovaný DROID | 392 GB | dny konverze | 4 to 12 USD | velmi nízká, špatný akční prostor |
| DROID sloučený s vašimi epizodami | obojí | blocked by validate_all_metadata | n/a | žádná, nespustí se |
| SmolVLA, 30 až 50 vlastních epizod | několik GB | 100 min nahrávání | 1 to 3 USD | vysoká |
| GR00T N1.7, 50 vlastních epizod | několik GB | 100 min nahrávání | 4 to 12 USD | vysoká |
| ACT od začátku, 50 vlastních epizod | několik GB | 100 min nahrávání | 1 to 3 USD | vysoká, 20 ms inference |
| Vzorek DROID jako testovací přípravek | 2 GB | jedno odpoledne | jeden krátký běh | vysoká, jako validace |
Asymetrie je klíčová: cesta, která si vypůjčuje nejvíce dat, je nejdražší a nejméně pravděpodobné, že pohne vaší paží. Méně než dvě hodiny vaší vlastní teleoperace porazí terabajt cizí Franky. Ještě nemáte rameno? /live streamuje fyzický SO-100 bez registrace. Poté natrénujte svou první politiku, a SmolVLA na SO-100 pro konkrétního průvodce.
Stáhněte si 2 GB vzorek DROID a použijte jej k ověření vašeho pipeline. Ignorujte zbývajících 1.7 TB. Nahrajte 50 epizod jednoho úkolu s pevnými kamerami. Nejprve dolaďte SmolVLA, protože s minimálně 30 epizodami na 24 GB kartě je nejlevnější pro iteraci, poté vyzkoušejte GR00T N1.7 na stejných datech. Porovnejte na svém úkolu, ne na benchmarku.
Nahrávejte datasety, které již odpovídají vašemu rameni
Desktopový klient zapisuje datasety ve formátu LeRobot přímo z teleoperační relace: správné rameno, správná snímková frekvence, správný akční prostor. Žádná konverze RLDS, žádné přemapování.
Získejte desktopového klientaMohu trénovat politiku na DROID a spustit ji na svém SO-100?▾
Ne přímo. V sestavení LeRobot jsou akce DROID 7D příkazy koncového efektoru na Franka Panda při 15 fps; v surovém RLDS jsou to 6 kloubových rychlostí plus pozice chapadla. SO-100 přijímá 6 absolutních kloubových pozic. Potřebovali byste vrstvu inverzní kinematiky, a i tak 5-DoF zápěstí nemůže reprodukovat libovolné 6-DoF pózy.
Mohu míchat epizody DROID nebo Bridge s vlastními epizodami SO-100?▾
Ne. validate_all_metadata vyžaduje identické fps, robot_type a schéma funkcí a vyvolá ValueError při první neshodě. Všechny tři se liší: 15 nebo 5 fps proti 30, franka nebo widowx proti vašemu rameni, tvary akcí 7 proti 6. Přepsání metadat pro projití kontroly neopraví sémantiku.
Je pak Open X-Embodiment k ničemu pro nízkonákladové rameno?▾
Ne, ale jeho hodnota se k vám dostává prostřednictvím předtrénovaných vah, nikoli epizod. Open-source datasety včetně OXE, Bridge v2 a DROID tvoří 9.1 procenta pi0's pre-training směsi, a NVIDIA dodává varianty GR00T N1.7 post-trénované na Bridge, Fractal, DROID a LIBERO. Co nemůžete udělat, je připojit tyto epizody k vašemu vlastnímu záznamu.
Která politika nejvíce těží z veřejných dat napříč těly?▾
Pi0.5 a modely GR00T nesou nejvíce předtrénování napříč těly, ale SmolVLA se často chová nejlépe na nízkonákladovém rameni: jeho předtrénovací sada obsahuje 481 komunitních datasetů, 22.9K epizod a 10.6M snímků, vyhodnocených na skutečných ramenech SO-100 a SO-101. ACT je opak: žádný základní model, 20 ms na akční krok.
Kolik vlastních epizod skutečně potřebuji?▾
30 pro SmolVLA, 50 pro GR00T N1.7, GR00T N1.5, Pi0.5 a ACT. Při výchozích nastaveních LeRobot 60 s na epizodu a 60 s reset, je 50 epizod 100 minut reálného času. Vypůjčená data napříč těly tato čísla nesnižují.
Sources
- DROID: Rozsáhlý dataset pro manipulaci s roboty v reálném prostředí
- Dokumentace DROID: velikosti ke stažení a schéma epizod RLDS
- BridgeData V2: Dataset pro robotické učení ve velkém měřítku
- Projektová stránka BridgeData V2: složení a pokrytí kamerami
- Open X-Embodiment: Datasety pro robotické učení a modely RT-X
- Projektová stránka Open X-Embodiment
- google-deepmind/open_x_embodiment: seznam datasetů a kontrolní body RT-1-X
- any4lerobot: konvertor openx2lerobot a jeho jednotný 8D stav, 7D akce
- IPEC-COMMUNITY/droid_lerobot: meta/info.json a velikost repozitáře
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: výřez google_robot při 3 fps
- huggingface/lerobot: SO follower, kinematický procesor, agregované a záznamové konfigurace
- openpi: vstupy politiky DROID a kontrolní bod pi05_droid
- pi0: Model toku vize-jazyk-akce pro obecné řízení robotů
- SmolVLA: Model vize-jazyk-akce pro cenově dostupnou a efektivní robotiku
Sources
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- DROID docs: download sizes and the RLDS episode schema
- BridgeData V2: A Dataset for Robot Learning at Scale
- BridgeData V2 project page: composition and camera coverage
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Open X-Embodiment project page
- google-deepmind/open_x_embodiment: dataset list and RT-1-X checkpoints
- any4lerobot: the openx2lerobot converter and its unified 8-D state, 7-D action
- IPEC-COMMUNITY/droid_lerobot: meta/info.json and repo size
- IPEC-COMMUNITY/bridge_orig_lerobot: meta/info.json
- IPEC-COMMUNITY/fractal20220817_data_lerobot: the google_robot slice at 3 fps
- huggingface/lerobot: SO follower, kinematics processor, aggregate and record configs
- openpi: DROID policy inputs and the pi05_droid checkpoint
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started