
GR00T N1.7, Pi0.5, SmolVLA, ACT of GR00T N1.5? 'n Besluitstabel wat by werklike situasies pas, met die gepubliseerde maatstafgetalle, latensie, koste per lopie en lisensies agter elke keuse.
Vyf beleide is vandag opleibaar op 'n SO-100 klas arm. Hulle verskil met 'n faktor van 24 in inferensie-latensie, 37 in parameter telling en 12 in wat 'n lopie kos, en in of jy die resultaat mag verskeep. Vyf modelkaarte sal dit nie oplos nie: geeneen beantwoord die vraag wat jy het nie, watter een moet ek eerste loop?
Elke nommer hieronder is in Augustus 2026 uit die referate, repos en kaarte gelees. Platformnommers kom van die AY-Robots beleidskatalogus; waar die twee verskil, word beide getoon.
Die kort weergawe
- •Lei ACT eerste op as jy jou datastel betwyfel: 1 tot 3 USD per lopie, niks vooraf-opgelei om slegte data te verbloem nie.
- •GR00T N1.7 en Pi0.5 lê binne 'n halwe punt op LIBERO, 97.0 teenoor 96.85 tot 97.5. Dit is nie 'n rede om enigeen te kies nie.
- •Pi0.5 is die veralgemeningspel, nie die akkuraatheidspel nie, en die stadigste teen 485 ms.
- •SmolVLA, teen 450 M parameters, is die enigste VLA hier wat op een 24 GB kaart fyninstel.
- •ACT teen 20 ms is die enigste opsie vir vinnige reaktiewe beweging. Lisensies besluit die res.
Die besluitstabel
| Jou situasie | Lei dit op | Hoekom |
|---|---|---|
| Datastelkwaliteit onbewese | ACT | Niks vooraf-opgeleide verberg 'n gebroke datastel nie, en mislukking kos 1 tot 3 USD. |
| Kontakryk, multi-stap, taal-gekondisioneer | GR00T N1.7 | 97.0% oor vier LIBERO-suites, plus 'n relatiewe eindeffektor-aksiespasie. |
| Vinnige reaktiewe beweging, inferensie by die servos | ACT | 20 ms. Die volgende vinnigste is 7.6 keer stadiger. |
| Nuwe objekte, nuwe toneel, oopwêreld | Pi0.5 | Gebou vir buite-verspreiding gedrag, oor tot 104 liggings. |
| Een 24 GB kaart, wil steeds taal hê | SmolVLA | 450 M parameters, 'n 30 episode vloer, loop plaaslik. |
| Reproduseer 'n lopie opgeneem in 2025 | GR00T N1.5 | Slegs as jy moet: LeRobot verwerp dit nou, gewigte nie-kommersieel. |
| Dit sal as 'n produk verskeep word | N1.7, SmolVLA of ACT | N1.5 is nie-kommersieel, Pi0.5 dra Gemma-bepalings, SmolVLA se kaart meld geen. |
Die vyf kandidate
Al vyf is beleide: kamera rame, gewrigsposisies en, vir vier van hulle, 'n taalinstruksie, gekarteer na 'n stuk toekomstige gewrigsteikens. Wat hulle skei, is hoeveel geleer is voordat jy aangekom het.
| Beleid | Parameters | Latensie | GPU-vlak | Plaaslik? | Min episodes | Formaat | Koste |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB kaart | ja | 50 | v3.0 | 1 tot 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB kaart | ja | 30 | v3.0 | 1 tot 3 USD |
| GR00T N1.7 | ~3 B, ~40 M ingestel | 152 ms | A100/H100 80 GB | nee | 50 | v2.0/v2.1 | 4 tot 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | nee | 50 | v2.0/v2.1 | 4 tot 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | nee | 50 | v3.0 | 4 tot 12 USD |
GR00T N1.7
NVIDIA se huidige visie-taal-aksie-model, ongeveer 3 B parameters, rofweg 40 M opgelei tydens fyninstelling. Die repo lys die deltas van N1.6: ruggraat van 'n verskafferde Eagle-model na Cosmos-Reason2-2B op Qwen3-VL, diffusielae 32 na 16, toestand- en aksiedimensies 29 na 132, aksiehorison 16 na 40.
Wat saak maak op 'n klein arm is die relatiewe eindeffektor-aksieruimte: N1.7 voorspel deltas vanaf die huidige posisie, wat dit moontlik maak dat 20K ure se EgoScale menslike video na 'n robotbeleid oorgedra word. Spesifikasie op die N1.7-bladsy, prosedure in die N1.7 op SO-100 gids.
Die Isaac-GR00T README verklaar N1.7 'n Algemene Beskikbaarheid vrystelling, met volledige maatstawwe en ondersteuning. Sy Hugging Face kaart het nog nie bygekom nie: die Model Version veld lees steeds GR00T N1.7 EA. Die repo is die nuwer dokument.
GR00T N1.5
Dieselfde 3 B skaal, Eagle 2 ruggraat, SigLip2 en T5, vloeipas-DiT-kop. Dit bestaan om 'n wat jy reeds het, uit te brei. Twee dinge maak dit 'n swak verstek: die gewigte dra NVIDIA's one-way non-commercial licence, en huidige LeRobot-vrystellings het N1.5-ondersteuning verwyder. Sien .
Pi0.5
Physical Intelligence se VLA, beleidstipe pi05. Die referaat gee 'n 2 B VLM geïnisialiseer vanaf PaliGemma plus 'n 300 M aksie-ekspert, wat die robot teen 50 Hz aandryf; LeRobot se pi05 config verstek na 'n 50-stap-stuk, een sekonde teen daardie tempo. Die verkoopspunt is ongesiene plekke: ongeveer 400 hours of mobile manipulation in real homes, en 'n skaalstudie oor 3, 12, 22, 53, 82 en 104 liggings, waar die 104-ligging-model ooreenstem met 'n beheer wat op die testhuise self opgelei is.
Een beperking, vermeld op die lerobot/pi05_base kaart: die poort dra slegs die vloeipasende action head. Subtaakvoorspelling, aksietokenisering en RL is nie stroomop vrygestel nie, en openpi sê dieselfde van sy eie bewaarplek. Die Pi0.5-bladsy en die Pi0.5 op SO-100 gids het die res.
Pi0.5 benodig die geslote google/paligemma-3b-pt-224 tokeniseerder (gated: manual, alhoewel Google sê versoeke word onmiddellik verwerk). Sonder om dit te aanvaar en hf auth login in die opleidingsomgewing uit te voer, begin die taak, laai 'n rukkie af, en sterf dan aan 'n magtigingsfout wat soos 'n netwerkfout lees. nvidia/GR00T-N1.7-3B is nie gesluit nie, maar sy nvidia/Cosmos-Reason2-2B ruggraat is wel (gated: auto). Maak albei skoon voordat jy in die tou plaas; as 'n lopie ledig sit, lys die vasgevang-tou-bladsy wat om na te gaan.
SmolVLA
450 M parameters, ongeveer 100 M in die aksie-ekspert, op SmolVLM-2 met die VLM gevries en slegs sy eerste 16 taalmodel-lae gebruik. Vooropleiding was gemeenskapsdata: 481 datastelle, 10.6 M rame, van dieselfde goedkoop arms wat jy gebruik. Die enigste VLA hier wat op een 24 GB kaart pas, en die enigste 30 episode vloer. Sien die SmolVLA-bladsy.
ACT
Nie 'n grondslagmodel nie. Die Action Chunking Transformer van ALOHA is ongeveer 80 M parameters wat opgelei is van nuuts af per taak, op 50 demonstrasies teen 50 Hz. Die referaat rapporteer ses regte bimanuële take van ongeveer tien minute se demonstrasies elk, teen 80 tot 90 persent op die voorbeelde wat dit uitlig. Die idee daarvan, aksie-chunking, is in elke model op hierdie bladsy, en die ablasie meet steeds die effek die beste: oor twee gesimuleerde take met tydelike ensemblering afgeskakel, styg sukses van 1 persent by k=1 tot 44 persent by k=100. Die ACT-bladsy het die res.
Wat die maatstawwe werklik sê
LIBERO is die een maatstaf waaroor drie van hierdie vyf rapporteer: taal-gekondisioneerde take op 'n gesimuleerde Franka Panda, verdeel in die vier suites hieronder met tien take elk. NVIDIA het 200 proewe per suite uitgevoer.
| Model | Ruimtelik | Voorwerp | Doel | 10 (Lank) | Gemiddeld |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 teen 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot poort | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (vraestel) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (vraestel) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Elke syfer kom van 'n ander harnas en begroting. GR00T het 20K stappe teen globale bondel 640 geloop; die openpi-syfer is 'n 30K kontrolepunt; die LeRobot-poort het 6K stappe by 'n LIBERO-basismodel gevoeg. SmolVLA is 'n verdere wanpassing: sy vraestel lei daardie ry op LIBERO van nuuts af op, sonder VLA-vooropleiding, terwyl die drie bo dit vooraf-opgeleide kontrolepunte fyninstel. Behandel 96.85 tot 97.5 as een groep, en die gaping tot 87.3% as werklik maar gekoop met 6.7x die parameters.
SimplerEnv toon die verspreiding, wat LIBERO nie doen nie. NVIDIA vergelyk N1.7 teen N1.6, die naaste publieke ding aan 'n generasionele delta.
| SimplerEnv suite | N1.6 gemiddeld | N1.7 gemiddeld | Beste swaai | Slegste swaai |
|---|---|---|---|---|
| Bridge (WidowX), 7 take | 56.6% | 62.3% | stack_cube 5.0 tot 48.0 | put_eggplant_in_basket 89.0 tot 53.0 |
| Fractal (Google Robot), 6 take | 52.0% | 72.5% | open_drawer 0.0 tot 65.0 | geen, elke taak het verbeter |
Die Bridge-ry is die nuttige een: gemiddeld 5.7 punte behaal terwyl put_eggplant_in_basket 36 verloor het en put_eggplant_in_sink van 33 na 2 gedaal het. 'n Nuwe generasie verskuif die verspreiding eerder as om dit op te lig, so as jou taak sit waar N1.7 teruggeval het, sê die gemiddelde niks.

Van die vyf, rapporteer slegs die SmolVLA-referaat oor 'n SO-100 klas arm: 78.3 persent vir SmolVLA en 61.7 vir Pi0 oor drie take, beide multi-taak, teenoor 48.3 vir ACT wat enkel-taak opgelei is, wat nie vergelykbaar is nie. Die skoon paring is beide enkel-taak op SO-101 optel-en-plaas: 90 teenoor 70 in verspreiding, 50 teenoor 40 daarbuite. Vergelyk op ACT teen SmolVLA en Pi0.5 teen SmolVLA, of blaai deur die arena.
Latensie en koste bepaal ontplooiing
Afleidingslatensie is die beperking wat mense laaste ontdek en eerste spyt. 'n Beleid vyf punte beter op 'n maatstaf, maar 'n halwe sekonde per aksiestap lyk slegter op jou lessenaar: kontakdinamika wag nie.
Een voorbehoud: die GR00T-syfer stem nie ooreen met NVIDIA se kaart nie, wat 4 denoiseringstappe en een kamera op 85.8 ms op 'n H100 in gretige modus, 48.6 ms met torch.compile, 27.9 ms deur volle TensorRT meet. Die 152 ms hier is 'n hele-stapel-syfer met bedieningsbokoste en meer as een kamera, nie 'n vorentoe-pas nie.
Die 20 tot 485 ms lus is die model s'n, en openbare-internet heen-en-weer reise dra daartoe by. Afgeleë afleiding is lewensvatbaar vir stadige optel-en-plaas, nie vir vinnige reaktiewe beweging nie. As jou taak spoed benodig, sit afleiding langs die servos: ACT of SmolVLA, plaaslik. Verwante: beleid vries in die middel van beweging.
Een manier om tyd te wen sonder om die model te verander: die SmolVLA-artikel meet sinchroniese uitvoering, waar die beleid 'n stuk voltooi voordat die volgende voorspel word, teenoor asinchroon, waar voorspelling uitvoering oorvleuel. Sukses is soortgelyk, 78.3 teenoor 73.3, maar dieselfde optel-en-plaas neem 9.7 sekondes in plaas van 13.75, en in 'n vaste venster bestuur die robot 19 siklusse in plaas van 9.
Lisensies, nagegaan omdat niemand dit nagaan nie
| Model | Gewigte lisensie | Kode lisensie | Kommersiële gebruik |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kaart laat kommersiële gebruik toe | Apache 2.0 | ja |
| GR00T N1.5 | NVIDIA eenrigting nie-kommersiële lisensie | Apache 2.0 | nee |
| Pi0.5 | pi05_base kaart metadata lees lisensie: gemma | Apache 2.0 (openpi, LeRobot docs) | lees albei, hulle stem nie saam nie |
| SmolVLA | geen lisensieveld op die smolvla_base kaart nie | Apache 2.0 (LeRobot) | kode ja, gewigte onvermeld |
| ACT | geen basisgewigte bestaan nie | Apache 2.0 (LeRobot) | ja |
Die Pi0.5 ry benodig aandag. Die LeRobot pi05 dokumentasie meld Apache 2.0, konsekwent met openpi, terwyl die Hub-kaart vir lerobot/pi05_base dra license: gemma. Albei is aktief. GR00T N1.7 het 'n sagter weergawe: die Isaac-GR00T README meld terloops dat N1.7 ten volle kommersieel lisensieerbaar is onder Apache 2.0, terwyl sy eie lisensie-afdeling en die modelkaart slegs die kode onder Apache 2.0 en die gewigte onder die NVIDIA Open Model License.
Die verstekke wat jy werklik sal uitvoer
Elke opleier-vorm verskaf 'n verstek, en dit is nie arbitrêr nie. ACT se is LeRobot s'n: batch 8, lr 1e-5, 100000 opleidingstappe, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. Een kolom hieronder is 'n strik.
| Beleid | Bondel | LR | Maksimum stappe | Grad akkum | Van toepassing? | Ekstra knoppe |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | ja | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | ja | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | nee (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | nee | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | nee | chunkSize, nActionSteps, seed, logFreq |
GR00T se fyninstelling-toegangspunt (launch_finetune.py, 'n tyro CLI) het geen saadveld in sy konfigurasie-dataklas nie, dus is lopies nie bit-vir-bit reproduseerbaar nie. Die repo waarsku ook teen 5 tot 6 persent variasie tussen lopies as gevolg van nie-deterministiese beeld-augmentasies, wat groter is as die meeste maatstafverskille waaroor aanlyn gedebatteer word. LeRobot se versteksaad is 1000. Die grad-akkum kolom beskryf lerobot 0.5.1; stroomop 0.6.2 stel dit bloot as --accelerator.gradient_accumulation.steps.
Die knop wat meer saak maak as die modelkeuse
Dit is die aksie-stuk. Langer stukke gee gladder beweging en minder saamgestelde foute, maar die beleid is vasgelê terwyl die blok uitvoer, so dit reageer laat op enigiets wat beweeg: selfversekerd op 'n statiese kubus, hopeloos op 'n rollende een. As dit oorskiet, is die verkorting van die uitgevoerde gedeelte beter as heropleiding en is gratis. 'n Gewrig wat te vroeg stop is 'n ander probleem; sien .
- ACT: ACTConfig verstek na
chunk_size 100enn_action_steps 100. Tydelike ensemblering is af en vereisn_action_steps 1. - GR00T N1.7: interne horison het van 16 na 40 gegaan, tog loop LeRobot se SO-101 voorbeeld steeds
--policy.chunk_size=16 --policy.n_action_steps=16. Die uitrol-vlag is hernoem na--execution-horizon. - Pi0.5: 'n 50-stap stuk, waarvan LeRobot se LIBERO-resep 10 uitvoer via
--policy.n_action_steps=10; met--policy.pretrained_pathval dit terug na 50 as jy die vlag weglaat. - SmolVLA: 50-aksie stukke, beide knoppe blootgestel.
Hoe om al vyf in een middag te skerm
Die goedkoopste antwoord is nie meer lees nie. Spandeer ongeveer 15 USD en laat die arm jou vertel: neem een keer op, lei eers die goedkoop model op, eskaleer sodra dit bewys het dat die data gesond is. Struktuur klop volume, die punt van en die .
- 1Neem 50 episodes een keer op
Vyftig maak die weg oop vir GR00T, Pi0.5 en ACT, en SmolVLA se 30. Herhaal elke variasie eerder as om dit te versprei: 50 episodes oor 5 kubusposisies opgelei waar 25 nie was nie. Sien neem jou eerste datastel op.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Lei ACT eers op, want dit kan nie vir jou lieg nie
Geen vooraf-opgeleide gewigte nie, so as dit enigsins die taak verrig, bevat jou datastel die taak. As ACT platval, herstel die data. 1 tot 3 USD, 2 tot 5 uur op 'n 24 GB kaart.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Loop SmolVLA op dieselfde datastel, onveranderd
Dieselfde data, dieselfde arm, 450 M parameters in plaas van 80 M, plus taal-kondisionering. LeRobot skat 'n 20K stap-lopie op ongeveer 4 uur op een A100. Dit is wat jou vertel of vooraf-opleiding enigiets bydra.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Skakel af na v2.1 voordat jy GR00T aanraak
GR00T lees 'n variant van die LeRobot v2-formaat plus 'n ekstra
meta/modality.jsonwat karteer hoe saamgevoegde toestand- en aksie-skikkings in benoemde velde verdeel. 'n v3.0-datastel laat daardie laaier ineenstort, omdat v3.0 baie episodes in gedeelde lêers pak waar v2 een per episode geskryf het. Isaac-GR00T lewer die afgraderingshulpmiddel asscripts/lerobot_conversion/convert_v3_to_v2.py; die v3-verwerpingsbladsy is die vinnige pad.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Eskaleer na GR00T N1.7 slegs as die eerste twee iets op die tafel gelaat het
Deur NVIDIA se CLI, hier getoon, of LeRobot se
grootbeleidstipe. NVIDIA beveel 40 GB of meer VRAM aan vir fyninstelling, 16 GB vir inferensie. By 'n OOM, sien die OOM-bladsy.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Twee maniere om daardie siftingspas te loop
Drie omgewings, want die gereedskapskettings bestaan nie saam nie. LeRobot op hoof is 0.6.2 en benodig Python 3.12 of nuwer; Isaac-GR00T en openpi is aparte uv-bestuurde repos.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T pen
torchcodec0.8.0 vas as sy enigste video-agterkant, wat FFmpeg 4 tot 7 benodig. FFmpeg 8 word nie ondersteun nie, AV1 nie gewaarborg nie. - openpi geheue-vloere: inferensie bo 8 GB, LoRA bo 22.5 GB, volle fyninstelling bo 70 GB. Daardie laaste een is hoekom Pi0.5 'n A100-taak is.
- Huur die GPU self, vernietig dit daarna, versoen drie stelle kontrolepuntpaaie met die hand.
Dieselfde vyf modelle, een vorm. Kies model, datastel en hiperparameters; die agterkant huur 'n GPU wat volgens benodigde VRAM grootte is, loop die opleier en skryf kontrolepunte na objekberging.
- Die opleidingsmatriks is vyf modelle by vier arms, elke sel 'n gids: SmolVLA op SO-100, ACT op SO-101.
- Inferensie-pods word outomaties voorsien deur
/api/inference/podmet 'n ledige waghond, sodat 'n vergete pod nie stilweg faktureer nie. - Basis-kontrolepunte is die verskaffers se eie:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT het geen. - Dieselfde bewerkings vanaf die CLI en vanaf KI-agente via die MCP-bediener.
- Geen hardeware? Die lewendige arm stroom 'n fisiese SO-100 sonder registrasie; die probeer-bladsy wys die maniere om in te kom.
Grondslagmodel of van nuuts af
Die ware tweespalt is nie watter 3 B-model om te kies nie. Dit is of 'n vooraf-opgeleide VLA hoegenaamd gebruik moet word, gegewe dat ACT ses werklike bimanuële take geleer het uit ongeveer tien minute se demonstrasies elk, met 80 M parameters en niks vooraf-opgeleid nie.
- Taalkondisionering. ACT het geen; een ACT-kontrolepunt doen een taak.
- Beter op objekte wat afwesig is in jou demonstrasies: op SO-101, 50% teenoor ACT se 40% buite verspreiding.
- Hoegenaamd multi-taak: SmolVLA bereik 78.3% oor drie SO-100 take met een kontrolepunt; ACT is slegs enkel-taak uitgevoer.
- 7.6x tot 24x die latensie: 152 tot 485 ms per aksiestap teenoor ACT se 20 ms.
- 4 tot 12 USD per lopie in plaas van 1 tot 3, en 'n A100-vlak in plaas van enige 24 GB-kaart.
- Lisensieblootstelling, plus 'n geslote-repo-foutmodus wat nie van nuuts af bestaan nie.
- 'n Vooraf-opgeleide gewigte kan 'n slegte datastel masker. 'n Fyninstelling wat halfpad werk op gebroke data kos 'n week voordat jy na die data kyk.
Die geval van die reproduksie van 'n ou lopie
Om 'n 2025-kontrolepunt na te jaag, maak die modelkeuse vir jou en verander die probleem in weergawevaspenning: huidige LeRobot verwerp N1.5, so jy pen lerobot==0.5.1. Met geen saadveld en 5 tot 6 persent variansie tussen lopies, is die reproduksie by konstruksie benaderd. en het die platformkant.

Af na twee? ACT teen GR00T N1.7 en GR00T N1.7 teen SmolVLA. Rou rye sit in die arena inskrywings: GR00T N1.7, Pi0.5, SmolVLA en ACT.
Waar hierdie platform jou nie help nie
- Dit kan nie afgeleë inferensie vinnig maak nie. Die 20 tot 485 ms lus behoort aan die model; internet heen-en-weer reise voeg daarby.
- Dit kan nie GR00T of Pi0.5 op jou eie hardeware fyninstel nie. Beide is hier slegs wolk-gebaseerd; slegs SmolVLA en ACT loop plaaslik.
- Dit kan nie 'n datastel regmaak nie. Verlies daal maar die beleid doen niks is 'n dataprodukprobleem, 'n beleid wat slegs in een opstelling werk is 'n dekkingprobleem.
- Dit kan nie GR00T lopies reproduseerbaar maak nie: die stroomop konfigurasie het geen saadveld nie.
85 modelle, 332 maatstafresultate, elke nommer gekoppel aan sy bron
Die sorteerbare weergawe van die tabelle op hierdie bladsy: 85 visie-taal-aksie modelle, 332 maatstafresultate, elk teruggekoppel na sy referaat of modelkaart.
Maak die arena oopEen kies en aanbeweeg
Een verstek: neem 50 episodes op, oefen ACT vir 1 tot 3 USD om die datastel te bewys, dan SmolVLA op dieselfde data. Onder 6 USD saam, en hulle beantwoord die vraag wat saak maak: of vooropleiding hier help, of of die knelpunt die data is. Eskaleer na GR00T N1.7 vir kontakryke multi-stap take, na Pi0.5 wanneer die toneel verander.
Platform deurloop: oefen jou eerste beleid, dan voer jou eerste beleid uit. Die opleidingsdokumente en datasteldokumente dek vorm en formaat; die SO-100 bladsy en die volledige SO-100 gids dek bou en kalibrasie. Agtergrond: die VLA oorsig en die Pi0 vloeipas-artikel. Die een wat jou sukseskoers sal verhoog, is die datakwaliteitgids.
Watter VLA-beleid moet ek eerste op 'n SO-100 oplei?▾
ACT, dan SmolVLA. ACT lei van nuuts af op, so dit kan nie 'n slegte datastel verbloem nie, en 'n lopie kos 1 tot 3 USD op 'n 24 GB-kaart. As ACT hoegenaamd die taak verrig, is die 4 tot 12 USD vir 'n GR00T N1.7- of Pi0.5-lopie nie vermors nie.
Is GR00T N1.7 werklik beter as Pi0.5?▾
Op LIBERO is hulle binne geraas: 97.0% oor vier suites vir GR00T N1.7, 96.85% vir Pi0.5 teen 30k stappe in openpi, 97.5% vir die LeRobot-poort, alles van verskillende harnasse. Die werklike verskille is 152 ms per aksiestap teenoor 485 ms, v2.1-datastelle teenoor v3.0, en maatstafakkuraatheid teenoor oopwêreldveralgemening.
Kan ek enige hiervan op 'n enkele RTX 4090 fyninstel?▾
SmolVLA en ACT, ja; albei word gelys vir 'n RTX 4090 of enige 24 GB-kaart en loop plaaslik. GR00T N1.7, N1.5 en Pi0.5 benodig 'n A100 of H100 80 GB en is hier slegs wolkgebaseerd. NVIDIA beveel 40 GB of meer aan vir GR00T-fyninstelling; openpi se minimum is bo 70 GB vir 'n volle Pi0.5-fyninstelling, 22.5 GB vir LoRA.
Watter van hierdie vyf kan ek kommersieel gebruik?▾
GR00T N1.7-gewigte is onder die NVIDIA Open Model License Agreement, wat volgens die kaart kommersiële gebruik dek. N1.5-gewigte is nie-kommersieel. SmolVLA se kode is Apache 2.0 in LeRobot, maar die lerobot/smolvla_base-kaart bevat geen lisensieveld nie, so die gewigte is ongespesifiseer. ACT het geen basisgewigte om te lisensieer nie. Pi0.5 is dubbelsinnig: LeRobot se dokumente sê Apache 2.0, sy kaartmetadata lees license: gemma.
Sources
- NVIDIA Isaac-GR00T-bewaarplek: GA-status, N1.6 na N1.7-veranderinge, hardewarevereistes, torchcodec- en FFmpeg-beperkings, launch_finetune.py, lopie-tot-lopie-variansie
- nvidia/GR00T-N1.7-3B-modelkaart: Cosmos-Reason2-2B-ruggraat, 3 B parameters, inferensie-tydtabl, NVIDIA Open Model License, Model Version-veld
- nvidia/GR00T-N1.5-3B-modelkaart: Eagle 2-verwysing, SigLip2 en T5, vloeipas DiT, eenrigting nie-kommersiële lisensie
- Isaac-GR00T LIBERO-voorbeeld: sukseskoerse per suite teen 20K stappe en bondelgrootte 640, 200 proewe per suite
- Isaac-GR00T SimplerEnv-voorbeeld: sukseskoerse per taak vir Bridge en Fractal, GR00T N1.6 teenoor N1.7
- pi0.5: 'n Visie-Taal-Aksie Model met Oopwêreldveralgemening (2 B VLM plus 300 M aksie-kenner, 50 Hz beheer, ongeveer 400 uur mobiele manipulasie, skaalstudie oor 3 tot 104 liggings)
- openpi-bewaarplek: GPU-geheue-vloere, slegs-vloeipas-kop-omvang, en die Pi0.5 LIBERO-resultate in examples/libero
- lerobot/pi05_base-modelkaart: omvang van die LeRobot-poort, license: gemma-metadata, lerobot-train-gebruik
- LeRobot pi0.5-dokumentasie: omheinde PaliGemma-tokeniseerder, LIBERO-reproduksietabel, n_action_steps-terugvalval, Apache 2.0-verklaring
- SmolVLA: 'n Visie-Taal-Aksie Model vir Bekostigbare en Doeltreffende Robotika (450 M parameters, LIBERO- en Meta-World-tabelle, SO-100- en SO-101-resultate, asynchrone inferensie)
- LeRobot SmolVLA-dokumentasie: 50 episodes oor 5 posisies teenoor 25, 20k stappe in ongeveer 4 uur op 'n A100
- Leer van Fynkorrelige Bimanuële Manipulasie met Laekoste Hardeware (ACT en ALOHA): 6 take teen 80-90 persent, brokkiegrootte-ablasie van k=1 tot k=100
- LeRobot 0.6.2: ACTConfig- en SmolVLAConfig-verstekwaardes, versteksaad 1000, --accelerator.gradient_accumulation.steps, Python 3.12-vereiste, Apache 2.0
- LeRobot GR00T-dokumentasie: beleidstipe groot, N1.5-ondersteuning verwyder, pin lerobot==0.5.1, SO-101 brokkiegrootte-voorbeeld
- lerobot/smolvla_base-modelkaart: die SmolVLA-basis-kontrolepunt wat deur --policy.path gebruik word, en sy kaartmetadata, wat geen lisensieveld bevat nie
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started