
GR00T N1.7, Pi0.5, SmolVLA, ACT alebo GR00T N1.5? Rozhodovacia tabuľka prispôsobená reálnym situáciám, s publikovanými benchmarkovými číslami, latenciou, nákladmi na spustenie a licenciami za každou voľbou.
Päť politík je dnes trénovateľných na ramene triedy SO-100. Líšia sa faktorom 24 v inferenčnej latencii, 37 v počte parametrov a 12 v nákladoch na spustenie, a v tom, či môžete výsledok distribuovať. Päť modelových kariet to nevyrieši: žiadna neodpovedá na otázku, ktorú máte, ktorú mám spustiť ako prvú?
Každé číslo nižšie bolo prečítané z článkov, repozitárov a kariet v auguste 2026. Čísla platformy pochádzajú z katalógu politík AY-Robots; kde sa tieto dve líšia, sú zobrazené obe.
Stručná verzia
- •Trénujte ACT ako prvý, ak pochybujete o svojom datasete: 1 až 3 USD za spustenie, nič predtrénované na zakrytie zlých dát.
- •GR00T N1.7 a Pi0.5 sa nachádzajú v rozmedzí pol bodu na LIBERO, 97.0 oproti 96.85 až 97.5. To nie je dôvod vybrať si ani jeden.
- •Pi0.5 je zameraný na generalizáciu, nie na presnosť, a je najpomalší s 485 ms.
- •SmolVLA, s 450 M parametrami, je jediný VLA tu, ktorý sa doladí na jednej 24 GB karte.
- •ACT s 20 ms je jedinou možnosťou pre rýchly reaktívny pohyb. Licencie rozhodujú o zvyšku.
Rozhodovacia tabuľka
| Vaša situácia | Trénujte toto | Prečo |
|---|---|---|
| Kvalita dátovej sady nepreukázaná | ACT | Žiadny predtrenovaný model neskryje chybnú dátovú sadu a zlyhanie stojí 1 až 3 USD. |
| Bohatý na kontakt, viacstupňový, podmienený jazykom | GR00T N1.7 | 97.0% cez štyri sady LIBERO, plus relatívny akčný priestor koncového efektora. |
| Rýchly reaktívny pohyb, inferencia pri servách | ACT | 20 ms. Ďalší najrýchlejší je 7.6-krát pomalší. |
| Nové objekty, nová scéna, otvorený svet | Pi0.5 | Navrhnuté pre správanie mimo distribúcie, naprieč až 104 miestami. |
| Jedna 24 GB karta, stále chcete jazyk | SmolVLA | 450 M parametrov, minimálne 30 epizód, beží lokálne. |
| Reprodukcia behu zaznamenaného v roku 2025 | GR00T N1.5 | Len ak musíte: LeRobot to teraz odmieta, váhy sú nekomerčné. |
| Toto sa bude dodávať ako produkt | N1.7, SmolVLA or ACT | N1.5 je nekomerčný, Pi0.5 obsahuje podmienky Gemma, karta SmolVLA neuvádza žiadne. |
Päť kandidátov
Všetkých päť sú politiky: snímky kamery, polohy kĺbov a, pre štyri z nich, jazyková inštrukcia, mapovaná na časť budúcich cieľov kĺbov. To, čo ich odlišuje, je, koľko bolo naučené predtým, ako ste prišli.
| Politika | Parametre | Latencia | Úroveň GPU | Lokálne? | Min. epizód | Formát | Cena |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | áno | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | áno | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | nie | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | nie | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | nie | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Aktuálny vizuálno-jazykovo-akčný model spoločnosti NVIDIA, približne 3 miliardy parametrov, zhruba 40 miliónov trénovaných počas jemného doladenia. Repozitár uvádza rozdiely oproti N1.6: chrbtová kosť z modelu Eagle od dodávateľa na Cosmos-Reason2-2B na Qwen3-VL, difúzne vrstvy 32 na 16, rozmery stavu a akcie 29 na 132, akčný horizont 16 na 40.
Na malom ramene záleží na relatívnom akčnom priestore koncového efektora: N1.7 predpovedá delty z aktuálnej pozície, čo umožňuje prenos 20 tisíc hodín ľudského videa EgoScale do robotickej politiky. Špecifikácia na stránke N1.7, postup v príručke N1.7 na SO-100.
Súbor README Isaac-GR00T deklaruje N1.7 ako vydanie s všeobecnou dostupnosťou, s kompletnými benchmarkmi a podporou. Jeho karta na Hugging Face sa ešte neaktualizovala: pole Model Version stále uvádza GR00T N1.7 EA. Repozitár je novší dokument.
GR00T N1.5
Rovnaká škála 3 B, chrbtová kosť Eagle 2, SigLip2 a T5, hlava DiT s prispôsobením toku. Existuje na rozšírenie ktorý už máte. Dve veci z neho robia zlú predvolenú voľbu: váhy nesú jednosmernú nekomerčnú licenciu spoločnosti NVIDIA a aktuálne vydania LeRobot odstránili podporu N1.5. Pozrite si .
Pi0.5
VLA spoločnosti Physical Intelligence s , typ politiky pi05. Práca uvádza 2 B VLM inicializovaný z PaliGemma plus 300 M akčný expert, ktorý riadi robota pri 50 Hz; konfigurácia pi05 LeRobotu predvolene používa 50-krokový blok, jednu sekundu pri tejto rýchlosti. Predajným argumentom sú nepoznané miesta: približne 400 hodín mobilnej manipulácie v reálnych domácnostiach a štúdia škálovania pre 3, 12, 22, 53, 82 a 104 miest, kde model so 104 miestami zodpovedal kontrole trénovanej na samotných testovacích domácnostiach.
Jedno obmedzenie, uvedené na lerobot/pi05_base karte: port prenáša iba flow-matching akčnú hlavu. Predikcia podúloh, tokenizácia akcií a RL neboli vydané upstream, a openpi hovorí to isté o svojom vlastnom repozitári. Stránka Pi0.5 a sprievodca Pi0.5 na SO-100 majú zvyšok.
Pi0.5 potrebuje gated google/paligemma-3b-pt-224 tokenizér (gated: manual, hoci Google hovorí, že požiadavky sú spracované okamžite). Bez jeho prijatia a spustenia hf auth login v tréningovom prostredí sa úloha spustí, chvíľu sťahuje, potom zomrie na chybu autorizácie, ktorá vyzerá ako chyba siete. nvidia/GR00T-N1.7-3B nie je gated, ale jeho nvidia/Cosmos-Reason2-2B chrbtica je (gated: auto). Vymažte obidva pred zaradením do fronty; ak beh zostane nečinný, stránka so zaseknutou frontou uvádza, čo skontrolovať.
SmolVLA
450 M parametrov, asi 100 M v akčnom expertovi, na SmolVLM-2 s VLM zmrazeným a použitých iba jeho prvých 16 vrstiev jazykového modelu. Predtréning boli komunitné dáta: 481 datasetov, 10.6 M snímok, z rovnakých lacných ramien, ktoré používate. Jediný VLA tu, ktorý sa zmestí na jednu 24 GB kartu, a jediný 30 epizóda podlažie. Pozri stránku SmolVLA.
ACT
Nie je to základný model. Action Chunking Transformer z ALOHA má približne 80 M parametrov trénovaných od začiatku pre každú úlohu, na 50 demonštráciách pri 50 Hz. Práca uvádza šesť skutočných obojručných úloh z približne desiatich minút demonštrácií pre každú, s úspešnosťou 80 až 90 percent na príkladoch, ktoré zdôrazňuje. Jeho myšlienka, rozdelenie akcií na časti, je v každom modeli na tejto stránke a jeho ablácia stále meria účinok najlepšie: pri dvoch simulovaných úlohách s vypnutým časovým ensemblovaním sa úspešnosť zvyšuje z 1 percenta pri k=1 na 44 percent pri k=100. Stránka ACT obsahuje zvyšok.
Čo skutočne hovoria benchmarky
LIBERO je jeden benchmark, o ktorom informujú tri z týchto piatich: jazykovo podmienené úlohy na simulovanom Franka Panda, rozdelené do štyroch sád nižšie, po desiatich úlohách v každej. NVIDIA spustila 200 pokusov na sadu.
| Model | Priestorové | Objektové | Cieľové | 10 (Dlhé) | Priemer |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Každé číslo pochádza z iného testovacieho prostredia a rozpočtu. GR00T bežal 20K krokov s globálnou dávkou 640; údaj openpi je kontrolný bod 30K; port LeRobot pridal 6K krokov k základnému modelu LIBERO. SmolVLA je ďalšia nezhoda: jeho článok trénuje tento riadok na LIBERO od začiatku, bez predtrénovania VLA, zatiaľ čo tri nad ním dolaďujú predtrénované kontrolné body. Považujte 96.85 až 97.5 za jeden klaster a rozdiel k 87.3% za reálny, ale získaný s 6.7-násobkom parametrov.
SimplerEnv ukazuje rozptyl, čo LIBERO nerobí. NVIDIA porovnáva N1.7 s N1.6, čo je najbližšia verejná vec k „generačnej delte“.
| Sada SimplerEnv | Priemer N1.6 | Priemer N1.7 | Najlepší výkyv | Najhorší výkyv |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
Riadok Bridge je ten užitočný: v priemere sa získalo 5.7 bodov, zatiaľ čo put_eggplant_in_basket stratilo 36 a put_eggplant_in_sink kleslo z 33 na 2. Nová generácia posúva distribúciu namiesto toho, aby ju zdvíhala, takže ak vaša úloha spadá tam, kde N1.7 regresovalo, priemer nič nehovorí.

Z piatich, iba článok SmolVLA uvádza výsledky pre rameno triedy SO-100: 78.3 percent pre SmolVLA a 61.7 pre Pi0 naprieč tromi úlohami, obe viacúlohové, oproti 48.3 pre ACT trénované na jednu úlohu, čo nie je porovnateľné. Čisté porovnanie je pre obe modely na jednu úlohu na SO-101 pick-and-place: 90 proti 70 v distribúcii, 50 proti 40 mimo nej. Porovnajte na ACT proti SmolVLA a Pi0.5 proti SmolVLA, alebo si prezrite arénu.
Latencia a náklady rozhodujú o nasadení
Latencia inferencie je obmedzenie, ktoré ľudia objavia ako posledné a ľutujú ako prvé. Politika o päť bodov lepšia na benchmarku, ale s pol sekundou na krok akcie, vyzerá na vašom stole horšie: kontaktná dynamika nečaká.
Jedna výhrada: údaj GR00T nesúhlasí s kartou NVIDIA, ktorá meria 4 kroky odšumenia a jednu kameru pri 85.8 ms na H100 v eager móde, 48.6 ms s torch.compile, 27.9 ms cez plný TensorRT. Tu uvedených 152 ms je údaj pre celý stack s réžiou obsluhy a viac ako jednou kamerou, nie len pre forward pass.
Slučka 20 až 485 ms patrí modelu a pridávajú sa k nej aj okružné cesty cez verejný internet. Vzdialená inferencia je životaschopná pre pomalé úlohy typu pick-and-place, nie pre rýchly reaktívny pohyb. Ak vaša úloha vyžaduje rýchlosť, inferencia sa nachádza vedľa servomotorov: ACT alebo SmolVLA, lokálne. Súvisiace: politika zamrzne uprostred pohybu.
Jeden spôsob, ako získať čas bez zmeny modelu: článok SmolVLA meria synchrónne vykonávanie, kde politika dokončí jeden blok pred predpovedaním ďalšieho, oproti asynchrónnemu, kde sa predikcia prekrýva s vykonávaním. Úspešnosť je podobná, 78.3 oproti 73.3, ale rovnaká úloha pick-and-place trvá 9.7 sekúnd namiesto 13.75, a v pevnom okne robot zvládne 19 cyklov namiesto 9.
Licencie, skontrolované, pretože ich nikto nekontroluje
| Model | Licencia závaží | Licencia kódu | Komerčné použitie |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; karta umožňuje komerčné použitie | Apache 2.0 | áno |
| GR00T N1.5 | NVIDIA jednosmerná nekomerčná licencia | Apache 2.0 | nie |
| Pi0.5 | metadáta karty pi05_base uvádzajú licenciu: gemma | Apache 2.0 (openpi, dokumentácia LeRobot) | prečítajte si obe, nesúhlasia |
| SmolVLA | žiadne pole licencie na karte smolvla_base | Apache 2.0 (LeRobot) | kód áno, závažia neuvedené |
| ACT | žiadne základné závažia neexistujú | Apache 2.0 (LeRobot) | áno |
Riadok Pi0.5 si vyžaduje pozornosť. Dokumentácia LeRobot pi05 uvádza Apache 2.0 v súlade s openpi, zatiaľ čo karta Hub pre lerobot/pi05_base obsahuje license: gemma. Obe sú aktívne. GR00T N1.7 má miernejšiu verziu: README Isaac-GR00T mimochodom uvádza, že N1.7 je plne komerčne licencovateľný pod Apache 2.0, zatiaľ čo jeho vlastná sekcia licencie a karta modelu umiestňujú kód iba pod Apache 2.0 a závažia pod NVIDIA Open Model License.
Predvolené hodnoty, ktoré skutočne spustíte
Každá forma trénera dodáva predvolené nastavenie a tie nie sú ľubovoľné. ACT sú vlastné LeRobotu: dávka 8, lr 1e-5, 100000 tréningové kroky, veľkosť bloku 100, zodpovedajúce ACTConfig upstream a k=100 z ACT článku. Jeden stĺpec nižšie je pasca.
| Politika | Dávka | LR | Max kroky | Grad akum. | Platí? | Extra nastavenia |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | áno | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | áno | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | nie (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | nie | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | nie | chunkSize, nActionSteps, seed, logFreq |
Vstupný bod pre jemné ladenie GR00T (launch_finetune.py, tyro CLI) nemá žiadne pole seed vo svojej konfiguračnej dátovej triede, takže spustenia nie sú bitovo reprodukovateľné. Repozitár tiež varuje pred 5 až 6 percentnou varianciou medzi spusteniami z nedeterministických augmentácií obrázkov, čo je viac ako väčšina rozdielov v benchmarkoch, o ktorých sa diskutuje online. Predvolený seed LeRobotu je 1000. Stĺpec grad-accum popisuje lerobot 0.5.1; upstream 0.6.2 ho sprístupňuje ako --accelerator.gradient_accumulation.steps.
Nastavenie, ktoré je dôležitejšie ako výber modelu
Je to akčný blok. Dlhšie bloky poskytujú plynulejší pohyb a menej kumulatívnych chýb, ale politika je záväzná počas vykonávania bloku, takže reaguje neskoro na čokoľvek, čo sa pohybuje: sebavedomá na statickej kocke, beznádejná na kotúľajúcej sa. Ak prejde príliš ďaleko, skrátenie vykonanej časti je lepšie ako preškolenie a je zadarmo. Kĺb, ktorý sa zastaví príliš skoro, je iný problém; pozri .
- ACT: ACTConfig predvolene používa
chunk_size 100an_action_steps 100. Časové zoskupovanie je vypnuté a vyžadujen_action_steps 1. - GR00T N1.7: interný horizont sa zmenil z 16 na 40, no príklad SO-101 od LeRobot stále spúšťa
--policy.chunk_size=16 --policy.n_action_steps=16. Príznak rollout bol premenovaný na--execution-horizon. - Pi0.5: 50-krokový blok, z ktorého recept LIBERO od LeRobot vykonáva 10 prostredníctvom
--policy.n_action_steps=10; s--policy.pretrained_pathsa vráti na 50, ak príznak vynecháte. - SmolVLA: 50-akčné bloky, oba ovládače sú prístupné.
Ako preveriť všetkých päť za jedno popoludnie
Najlacnejšou odpoveďou nie je viac čítania. Minúť asi 15 USD a nechať rameno, aby vám to povedalo: zaznamenajte raz, najprv trénujte lacný model, eskalujte, keď sa preukáže, že dáta sú spoľahlivé. Štruktúra prekonáva objem, čo je zmyslom a .
- 1Zaznamenajte 50 epizód naraz
Päťdesiat uvoľňuje priestor pre GR00T, Pi0.5 a ACT, a SmolVLA 30. Opakujte každú variáciu namiesto rozširovania: 50 epizód naprieč 5 pozíciami kocky trénovaných tam, kde 25 nebolo. Pozrite si zaznamenajte si svoj prvý dataset.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Najprv trénujte ACT, pretože vám nemôže klamať
Žiadne predtrénované váhy, takže ak úlohu vôbec vykoná, váš dataset obsahuje úlohu. Ak ACT stagnuje, opravte dáta. 1 až 3 USD, 2 až 5 hodín na 24 GB karte.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Spustite SmolVLA na rovnakom datasete, nezmenenom
Rovnaké dáta, rovnaké rameno, 450 M parametrov namiesto 80 M, plus jazykové podmienky. LeRobot odhaduje 20K krokov behu na približne 4 hodiny na jednom A100. Toto vám povie, či predtrénovanie niečo prináša.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Preveďte na v2.1 predtým, ako sa dotknete GR00T
GR00T číta variant formátu LeRobot v2 plus dodatočný
meta/modality.json, ktorý mapuje, ako sa spojené polia stavu a akcie rozdelia na pomenované polia. Dataset v3.0 spôsobí pád tohto načítavača, pretože v3.0 balí mnoho epizód do zdieľaných súborov, zatiaľ čo v2 zapisoval jednu na epizódu. Isaac-GR00T dodáva pomocníka na downgrade akoscripts/lerobot_conversion/convert_v3_to_v2.py; stránka o odmietnutí v3 je rýchla cesta.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Prejdite na GR00T N1.7 len vtedy, ak prvé dva niečo zanechali
Cez CLI spoločnosti NVIDIA, zobrazené tu, alebo typ politiky
grootLeRobotu. NVIDIA odporúča 40 GB alebo viac VRAM pre jemné doladenie, 16 GB pre inferenciu. Pri OOM pozrite stránku OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dva spôsoby, ako spustiť tento skríningový prechod
Tri prostredia, pretože sady nástrojov neexistujú spoločne. LeRobot na main je 0.6.2 a potrebuje Python 3.12 alebo novší; Isaac-GR00T a openpi sú samostatné repozitáre spravované uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fixuje
torchcodec0.8.0 ako svoj jediný video backend, vyžadujúci FFmpeg 4 až 7. FFmpeg 8 nie je podporovaný, AV1 nie je zaručený. - Minimálne požiadavky na pamäť openpi: inferencia nad 8 GB, LoRA nad 22.5 GB, plné jemné doladenie nad 70 GB. Ten posledný je dôvod, prečo je Pi0.5 úlohou pre A100.
- Prenajmite si GPU sami, potom ju zničte, ručne zosúlaďte tri sady ciest k checkpointom.
Rovnakých päť modelov, jeden formulár. Vyberte model, dataset a hyperparametre; backend prenajme GPU dimenzovanú podľa požadovanej VRAM, spustí tréner a zapíše checkpoints do objektového úložiska.
- Tréningová matica je päť modelov pre štyri ramená, každá bunka je sprievodca: SmolVLA na SO-100, ACT na SO-101.
- Inferenčné pody sú automaticky zriadené pomocou
/api/inference/pods nečinným strážnym psom, takže zabudnutý pod nebude ticho účtovať. - Základné checkpointy sú vlastné dodávateľom:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT žiadne nemá. - Rovnaké operácie z CLI a od AI agentov cez server MCP.
- Žiadny hardvér? Živé rameno streamuje fyzický SO-100 bez registrácie; stránka vyskúšania ukazuje spôsoby vstupu.
Základný model alebo od nuly
Skutočná dilema nie je, ktorý 3 B model si vybrať. Ide o to, či vôbec použiť predtrénovaný VLA, vzhľadom na to, že ACT sa naučil šesť skutočných bimanálnych úloh z približne desiatich minút demonštrácií pre každú, s 80 M parametrami a ničím predtrénovaným.
- Jazykové podmieňovanie. ACT žiadne nemá; jeden checkpoint ACT vykonáva jednu úlohu.
- Lepšie na objektoch chýbajúcich vo vašich demonštráciách: na SO-101, 50% oproti 40% ACT mimo distribúcie.
- Vôbec multi-task: SmolVLA dosahuje 78,3% naprieč tromi úlohami SO-100 s jedným checkpointom; ACT bol spustený iba pre jednu úlohu.
- 7,6x až 24x vyššia latencia: 152 až 485 ms na krok akcie oproti 20 ms u ACT.
- 4 až 12 USD za spustenie namiesto 1 až 3, a úroveň A100 namiesto akejkoľvek 24 GB karty.
- Riziko licencie, plus režim zlyhania s obmedzeným prístupom k repozitáru, ktorý neexistuje pri trénovaní od začiatku.
- Predtrénované váhy môžu maskovať zlý dataset. Jemné doladenie, ktoré funguje len čiastočne na poškodených dátach, stojí týždeň, kým sa pozriete na dáta.
Prípad reprodukcie starého spustenia
Naháňanie checkpointu z roku 2025 robí výber modelu za vás a mení problém na pripnutie verzie: aktuálny LeRobot odmieta N1.5, takže pripnete lerobot==0.5.1. Bez poľa pre seed a s 5 až 6 percentnou varianciou medzi spusteniami je reprodukcia konštrukčne približná. a majú stranu platformy.

Zostali dva? ACT proti GR00T N1.7 a GR00T N1.7 proti SmolVLA. Nespracované riadky sú v záznamoch arény: GR00T N1.7, Pi0.5, SmolVLA a ACT.
Kde vám táto platforma nepomôže
85 modelov, 332 výsledkov benchmarkov, každé číslo odkazuje na svoj zdroj
Triediteľná verzia tabuliek na tejto stránke: 85 modelov vízie, jazyka a akcie, 332 výsledkov benchmarkov, každý s odkazom na svoj článok alebo modelovú kartu.
Otvoriť arénuVýber jedného a pokračovanie
Jeden predvolený postup: zaznamenajte 50 epizód, trénujte ACT za 1 až 3 USD na overenie dátovej sady, potom SmolVLA na rovnakých dátach. Spolu pod 6 USD a odpovedia na dôležitú otázku: či tu pomáha predtrenovanie, alebo či je úzkym hrdlom dátová sada. Eskalujte na GR00T N1.7 pre viacstupňové úlohy s bohatým kontaktom, na Pi0.5, keď sa scéna zmení.
Prehliadka platformy: natrénujte svoju prvú politiku, potom spustite svoju prvú politiku. Dokumentácia k trénovaniu a dokumentácia k dátovým sadám pokrývajú formu a formát; stránka SO-100 a kompletný sprievodca SO-100 pokrývajú zostavenie a kalibráciu. Pozadie: prehľad VLA a článok o Pi0 flow-matching. Ten, ktorý posunie vašu úspešnosť, je sprievodca kvalitou dát.
Ktorú VLA politiku by som mal trénovať ako prvú na SO-100?▾
ACT, potom SmolVLA. ACT trénuje od začiatku, takže nemôže maskovať zlý dataset, a jedno spustenie stojí 1 až 3 USD na 24 GB karte. Ak ACT úlohu vôbec zvládne, 4 až 12 USD za spustenie GR00T N1.7 alebo Pi0.5 nie je zbytočných.
Je GR00T N1.7 skutočne lepší ako Pi0.5?▾
Na LIBERO sú v rámci šumu: 97.0% naprieč štyrmi sadami pre GR00T N1.7, 96.85% pre Pi0.5 pri 30k krokoch v openpi, 97.5% pre port LeRobot, všetko z rôznych testovacích prostredí. Skutočné rozdiely sú 152 ms na akčný krok oproti 485 ms, datasety v2.1 oproti v3.0 a presnosť benchmarku oproti generalizácii v otvorenom svete.
Môžem niektorý z nich doladiť na jednej RTX 4090?▾
SmolVLA a ACT, áno; oba sú uvedené pre RTX 4090 alebo akúkoľvek 24 GB kartu a bežia lokálne. GR00T N1.7, N1.5 a Pi0.5 potrebujú A100 alebo H100 80 GB a sú tu len cloudové. NVIDIA odporúča 40 GB alebo viac pre doladenie GR00T; spodná hranica openpi je nad 70 GB pre úplné doladenie Pi0.5, 22.5 GB pre LoRA.
Ktorý z týchto piatich môžem použiť komerčne?▾
Váhy GR00T N1.7 sú pod licenciou NVIDIA Open Model License Agreement, ktorá podľa karty pokrýva komerčné použitie. Váhy N1.5 sú nekomerčné. Kód SmolVLA je Apache 2.0 v LeRobot, ale karta lerobot/smolvla_base neobsahuje pole licencie, takže váhy sú neuvedené. ACT nemá žiadne základné váhy na licencovanie. Pi0.5 je nejednoznačný: dokumentácia LeRobot uvádza Apache 2.0, jeho metadáta karty uvádzajú license: gemma.
Sources
- Repozitár NVIDIA Isaac-GR00T: stav GA, zmeny z N1.6 na N1.7, hardvérové požiadavky, obmedzenia torchcodec a FFmpeg, launch_finetune.py, variancia medzi spusteniami
- Karta modelu nvidia/GR00T-N1.7-3B: chrbtová kosť Cosmos-Reason2-2B, 3 B parametrov, tabuľka časovania inferencie, licencia NVIDIA Open Model License, pole Model Version
- Karta modelu nvidia/GR00T-N1.5-3B: referencia Eagle 2, SigLip2 a T5, flow matching DiT, jednosmerná nekomerčná licencia
- Príklad Isaac-GR00T LIBERO: miery úspešnosti pre jednotlivé sady pri 20K krokoch a veľkosti dávky 640, 200 pokusov na sadu
- Príklad Isaac-GR00T SimplerEnv: miery úspešnosti Bridge a Fractal pre jednotlivé úlohy, GR00T N1.6 proti N1.7
- pi0.5: model Vision-Language-Action s generalizáciou v otvorenom svete (2 B VLM plus 300 M akčný expert, 50 Hz riadenie, približne 400 hodín mobilnej manipulácie, štúdia škálovania pre 3 až 104 miest)
- Repozitár openpi: minimálne požiadavky na pamäť GPU, rozsah len pre flow-matching-head a výsledky Pi0.5 LIBERO v examples/libero
- Karta modelu lerobot/pi05_base: rozsah portu LeRobot, metadáta license: gemma, použitie lerobot-train
- Dokumentácia LeRobot pi0.5: gated PaliGemma tokenizer, tabuľka reprodukcie LIBERO, n_action_steps fallback trap, vyhlásenie Apache 2.0
- SmolVLA: model Vision-Language-Action pre cenovo dostupnú a efektívnu robotiku (450 M parametrov, tabuľky LIBERO a Meta-World, výsledky SO-100 a SO-101, asynchrónna inferencia)
- Dokumentácia LeRobot SmolVLA: 50 epizód naprieč 5 pozíciami oproti 25, 20k krokov za približne 4 hodiny na A100
- Učenie jemnej bimanálnej manipulácie s nízkokladovým hardvérom (ACT a ALOHA): 6 úloh s 80-90 percentnou úspešnosťou, ablácia veľkosti bloku od k=1 do k=100
- LeRobot 0.6.2: predvolené hodnoty ACTConfig a SmolVLAConfig, predvolený seed 1000, --accelerator.gradient_accumulation.steps, požiadavka Python 3.12, Apache 2.0
- Dokumentácia LeRobot GR00T: typ politiky groot, podpora N1.5 odstránená, pin lerobot==0.5.1, príklad veľkosti bloku SO-101
- Karta modelu lerobot/smolvla_base: základný checkpoint SmolVLA používaný --policy.path a jeho metadáta karty, ktoré neobsahujú pole licencie
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started