
GR00T N1.7, Pi0.5, SmolVLA, ACT of GR00T N1.5? Een beslissingstabel afgestemd op reële situaties, met de gepubliceerde benchmarkcijfers, latentie, kosten per uitvoering en licenties achter elke keuze.
Vijf beleidsregels zijn vandaag trainbaar op een SO-100 klasse arm. Ze verschillen met een factor 24 in inferentie latentie, 37 in parameteraantal en 12 in wat een run kost, en in de vraag of u het resultaat mag verzenden. Vijf modelkaarten zullen het niet oplossen: geen enkele beantwoordt de vraag die u heeft, welke moet ik als eerste uitvoeren?
Elk onderstaand getal is gelezen uit de papers, repositories en kaarten in augustus 2026. Platformnummers komen van de AY-Robots beleidscatalogus; waar de twee verschillen, worden beide getoond.
De korte versie
- •Train ACT eerst als u twijfelt aan uw dataset: 1 to 3 USD a run, niets voorgegetraind om slechte data te verdoezelen.
- •GR00T N1.7 and Pi0.5 liggen binnen een half punt op LIBERO, 97.0 against 96.85 to 97.5. Dat is geen reden om een van beide te kiezen.
- •Pi0.5 speelt in op generalisatie, niet op nauwkeurigheid, en de langzaamste met 485 ms.
- •SmolVLA, met 450 M parameters, is de enige VLA hier die fine-tuned op één 24 GB kaart.
- •ACT met 20 ms is de enige optie voor snelle reactieve beweging. Licenties bepalen de rest.
De beslissingstabel
| Uw situatie | Train dit | Waarom |
|---|---|---|
| Kwaliteit dataset onbewezen | ACT | Niets voorgegetraind verbergt een kapotte dataset, en falen kost 1 tot 3 USD. |
| Contactrijk, meerstaps, taalgestuurd | GR00T N1.7 | 97,0% over vier LIBERO suites, plus een relatieve actieruimte voor de eindeffector. |
| Snelle reactieve beweging, inferentie bij de servo's | ACT | 20 ms. De volgende snelste is 7,6 keer langzamer. |
| Nieuwe objecten, nieuwe scène, open wereld | Pi0.5 | Gebouwd voor out-of-distribution gedrag, over maximaal 104 locaties. |
| Eén 24 GB kaart, nog steeds taal gewenst | SmolVLA | 450 M parameters, een basis van 30 afleveringen, draait lokaal. |
| Een run opgenomen in 2025 reproduceren | GR00T N1.5 | Alleen als het moet: LeRobot wijst het nu af, gewichten niet-commercieel. |
| Dit wordt als product geleverd | N1.7, SmolVLA or ACT | N1.5 is niet-commercieel, Pi0.5 hanteert Gemma-voorwaarden, de kaart van SmolVLA vermeldt niets. |
De vijf kandidaten
Alle vijf zijn beleidsregels: cameraframes, gewrichtsposities en, voor vier ervan, een taalinstructie, toegewezen aan een reeks toekomstige gewrichtsdoelen. Wat hen onderscheidt, is hoeveel er werd geleerd voordat u arriveerde.
| Beleid | Parameters | Latentie | GPU-klasse | Lokaal? | Min. afleveringen | Formaat | Kosten |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | ja | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | ja | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | nee | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | nee | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | nee | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA's huidige visie-taal-actiemodel, ongeveer 3 miljard parameters, ruwweg 40 miljoen getraind tijdens fine-tuning. De repository vermeldt de verschillen ten opzichte van N1.6: backbone van een ingekocht Eagle-model naar Cosmos-Reason2-2B op Qwen3-VL, diffusielagen 32 naar 16, status- en actiedimensies 29 naar 132, actiehorizon 16 naar 40.
Wat belangrijk is bij een kleine arm, is de relatieve actieruimte van de eindeffector: N1.7 voorspelt delta's van de huidige pose, wat ervoor zorgt dat 20K uur aan EgoScale menselijke video kan worden overgedragen naar een robotbeleid. Specificaties op de N1.7-pagina, procedure in de N1.7 op SO-100 handleiding.
De Isaac-GR00T README verklaart N1.7 een Algemene Beschikbaarheid release, met volledige benchmarks en ondersteuning. De Hugging Face-kaart is nog niet bijgewerkt: het Model Version veld leest nog steeds GR00T N1.7 EA. De repository is het nieuwere document.
GR00T N1.5
Dezelfde 3 B schaal, Eagle 2 backbone, SigLip2 en T5, flow-matching DiT head. Het bestaat om een dat je al hebt uit te breiden. Twee dingen maken het een slechte standaard: de gewichten dragen NVIDIA's eenrichtings niet-commerciële licentie, en huidige LeRobot releases hebben N1.5 ondersteuning verwijderd. Zie .
Pi0.5
Physical Intelligence's VLA, beleidstype pi05. Het artikel beschrijft een 2 B VLM geïnitialiseerd vanuit PaliGemma plus een 300 M actie-expert, die de robot aanstuurt met 50 Hz; LeRobot's pi05 configuratie gebruikt standaard een 50-staps chunk, één seconde met die snelheid. Het verkoopargument zijn ongeziene plaatsen: ongeveer 400 uur mobiele manipulatie in echte huizen, en een schaalstudie over 3, 12, 22, 53, 82 en 104 locaties, waarbij het 104-locatie model overeenkwam met een controle getraind op de testhuizen zelf.
Eén beperking, vermeld op de lerobot/pi05_base kaart: de poort draagt alleen de flow-matching actiehoofd. Subtaakvoorspelling, actietokenisatie en RL zijn niet upstream vrijgegeven, en openpi zegt hetzelfde over zijn eigen repository. De Pi0.5 pagina en de Pi0.5 op SO-100 gids hebben de rest.
Pi0.5 heeft de gated google/paligemma-3b-pt-224 tokenizer (gated: manual, hoewel Google zegt dat verzoeken onmiddellijk worden verwerkt) nodig. Zonder dit te accepteren en hf auth login uit te voeren in de trainingsomgeving, start de taak, downloadt een tijdje, en sterft dan aan een autorisatiefout die klinkt als een netwerkfout. nvidia/GR00T-N1.7-3B is niet gated, maar zijn nvidia/Cosmos-Reason2-2B backbone is (gated: auto). Wis beide voordat je in de wachtrij plaatst; als een run inactief blijft, de pagina voor vastgelopen wachtrijen vermeldt wat te controleren.
SmolVLA
450 M parameters, ongeveer 100 M in de actie-expert, op SmolVLM-2 met de VLM bevroren en alleen de eerste 16 taalmodel-lagen gebruikt. Pretraining was gemeenschapsdata: 481 datasets, 10.6 M frames, van dezelfde goedkope armen die je gebruikt. De enige VLA hier die op één 24 GB kaart past, en de enige met een 30 episode vloer. Zie de SmolVLA pagina.
ACT
Geen fundamenteel model. De Action Chunking Transformer van ALOHA heeft ongeveer 80 M parameters, getraind vanaf nul per taak, op 50 demonstraties met 50 Hz. Het artikel rapporteert zes echte bimanuele taken van ongeveer tien minuten demonstraties elk, met 80 tot 90 procent op de voorbeelden die het belicht. Het idee ervan, actie-chunking, zit in elk model op deze pagina, en de ablatie ervan meet nog steeds het effect het beste: over twee gesimuleerde taken met uitgeschakelde temporele ensembling, stijgt het succes van 1 procent bij k=1 naar 44 procent bij k=100. De ACT-pagina heeft de rest.
Wat de benchmarks werkelijk zeggen
LIBERO is de enige benchmark waar drie van deze vijf over rapporteren: taal-geconditioneerde taken op een gesimuleerde Franka Panda, verdeeld in de vier onderstaande suites met elk tien taken. NVIDIA voerde 200 proeven per suite.
| Model | Ruimtelijk | Object | Doel | 10 (Lang) | Gemiddelde |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Elk getal komt van een verschillende testopstelling en budget. GR00T draaide 20K stappen met een globale batch van 640; het openpi-cijfer is een 30K checkpoint; de LeRobot-poort voegde 6K stappen toe aan een LIBERO-basismodel. SmolVLA is een verdere mismatch: de paper traint die rij op LIBERO vanaf nul, zonder VLA-voortraining, terwijl de drie erboven voortgetrainde checkpoints finetunen. Beschouw 96.85 tot 97.5 als één cluster, en het verschil tot 87.3% als reëel, maar verkregen met 6.7x de parameters.
SimplerEnv toont de spreiding, wat LIBERO niet doet. NVIDIA vergelijkt N1.7 met N1.6, het dichtstbijzijnde publieke equivalent van een "generational delta."
| SimplerEnv suite | N1.6 gemiddelde | N1.7 gemiddelde | Beste uitslag | Slechtste uitslag |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | geen, elke taak verbeterde |
De Bridge-rij is de nuttige: gemiddeld 5,7 punten gewonnen terwijl put_eggplant_in_basket 36 verloor en put_eggplant_in_sink van 33 naar 2 daalde. Een nieuwe generatie verschuift de distributie in plaats van deze op te tillen, dus als uw taak zich bevindt waar N1.7 achteruitging, zegt het gemiddelde niets.

Van de vijf rapporteert alleen het SmolVLA-paper over een SO-100 klasse arm: 78,3 procent voor SmolVLA en 61,7 voor Pi0 over drie taken, beide multi-task, tegen 48,3 voor ACT getraind single-task, wat geen gelijke vergelijking is. De zuivere koppeling is beide single-task op SO-101 pick-and-place: 90 tegen 70 in distributie, 50 tegen 40 daarbuiten. Vergelijk op ACT tegen SmolVLA en Pi0.5 tegen SmolVLA, of blader door de arena.
Latentie en kosten bepalen de implementatie
Inferentielatentie is de beperking die mensen het laatst ontdekken en het eerst betreuren. Een beleid dat vijf punten beter scoort op een benchmark, maar een halve seconde per actiestap duurt, ziet er slechter uit op je bureau: contactdynamica wachten niet.
Eén kanttekening: het GR00T-cijfer komt niet overeen met de kaart van NVIDIA, die 4 denoising-stappen en één camera meet op 85,8 ms op een H100 in eager mode, 48,6 ms met torch.compile, 27,9 ms via volledige TensorRT. De 152 ms hier is een cijfer voor de hele stack met serving overhead en meer dan één camera, geen forward pass.
De lus van 20 tot 485 ms is van het model, en round trips via het openbare internet dragen daaraan bij. Inferentie op afstand is haalbaar voor langzame pick-and-place, niet voor snelle reactieve beweging. Als je taak snelheid vereist, bevindt inferentie zich naast de servo's: ACT of SmolVLA, lokaal. Gerelateerd: beleid bevriest midden in de beweging.
Eén manier om tijd te winnen zonder het model te veranderen: het SmolVLA-artikel meet synchrone uitvoering, waarbij het beleid een 'chunk' voltooit voordat het de volgende voorspelt, versus asynchrone uitvoering, waarbij voorspelling de uitvoering overlapt. Het succes is vergelijkbaar, 78,3 tegen 73,3, maar dezelfde pick-and-place duurt 9,7 seconden in plaats van 13,75, en in een vast venster beheert de robot 19 cycli in plaats van 9.
Licenties, gecontroleerd omdat niemand ze controleert
| Model | Licentie gewichten | Licentie code | Commercieel gebruik |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kaart staat commercieel gebruik toe | Apache 2.0 | ja |
| GR00T N1.5 | NVIDIA eenzijdige niet-commerciële licentie | Apache 2.0 | nee |
| Pi0.5 | pi05_base kaart metadata vermeldt licentie: gemma | Apache 2.0 (openpi, LeRobot docs) | lees beide, ze spreken elkaar tegen |
| SmolVLA | geen licentieveld op de smolvla_base kaart | Apache 2.0 (LeRobot) | code ja, gewichten onvermeld |
| ACT | geen basisgewichten aanwezig | Apache 2.0 (LeRobot) | ja |
De Pi0.5 rij vereist aandacht. De LeRobot pi05 documentatie vermeldt Apache 2.0, consistent met openpi, terwijl de Hub-kaart voor lerobot/pi05_base vermeldt license: gemma. Beide zijn actief. GR00T N1.7 heeft een mildere versie: de Isaac-GR00T README vermeldt terloops dat N1.7 volledig commercieel licentieerbaar is onder Apache 2.0, terwijl de eigen licentiesectie en de modelkaart alleen de code onder Apache 2.0 plaatsen en de gewichten onder de NVIDIA Open Model License.
De standaardinstellingen die u daadwerkelijk zult uitvoeren
Elke trainerformulier wordt geleverd met een standaardinstelling, en deze zijn niet willekeurig. Die van ACT zijn van LeRobot zelf: batch 8, lr 1e-5, 100000 trainingsstappen, chunkgrootte 100, overeenkomend met ACTConfig upstream en k=100 uit het ACT-artikel. Eén kolom hieronder is een valstrik.
| Beleid | Batch | LR | Max stappen | Grad accum | Van toepassing? | Extra instellingen |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Het fine-tuning instappunt van GR00T (launch_finetune.py, een tyro CLI) heeft geen seed-veld in zijn config dataclass, waardoor runs niet bit-voor-bit reproduceerbaar zijn. De repository waarschuwt ook voor 5 tot 6 procent variantie tussen runs door niet-deterministische beeldaugmentaties, wat groter is dan de meeste benchmarkverschillen waar online over wordt gediscussieerd. De standaard seed van LeRobot is 1000. De grad-accum kolom beschrijft lerobot 0.5.1; upstream 0.6.2 exposeert het als --accelerator.gradient_accumulation.steps.
De instelling die meer telt dan de modelkeuze
Het is de actiechunk. Langere chunks zorgen voor vloeiendere beweging en minder cumulatieve fouten, maar het beleid wordt vastgelegd terwijl het blok wordt uitgevoerd, dus het reageert laat op alles wat beweegt: zelfverzekerd op een statische kubus, hopeloos op een rollende. Als het doorschiet, is het inkorten van het uitgevoerde gedeelte beter dan hertraining en is gratis. Een gewricht dat te vroeg stopt, is een ander probleem; zie .
- ACT: ACTConfig defaults to
chunk_size 100andn_action_steps 100. Temporele ensembling is uitgeschakeld en vereistn_action_steps 1. - GR00T N1.7: de interne horizon ging van 16 naar 40, toch draait LeRobot's SO-101 voorbeeld nog steeds
--policy.chunk_size=16 --policy.n_action_steps=16. De rollout-vlag is hernoemd naar--execution-horizon. - Pi0.5: een chunk van 50 stappen, waarvan LeRobot's LIBERO recept er 10 uitvoert via
--policy.n_action_steps=10; met--policy.pretrained_pathvalt het terug op 50 als je de vlag weglaat. - SmolVLA: chunks van 50 acties, beide knoppen blootgelegd.
Hoe alle vijf in één middag te screenen
Het goedkoopste antwoord is niet meer lezen. Geef ongeveer 15 USD uit en laat de arm het je vertellen: neem één keer op, train eerst het goedkope model, schaal op zodra het de data als valide heeft bewezen. Structuur verslaat volume, het punt van en het .
- 1Neem eenmalig 50 afleveringen op
Vijftig maakt de weg vrij voor GR00T, Pi0.5 en ACT, en SmolVLA's 30. Herhaal elke variatie in plaats van te verspreiden: 50 afleveringen over 5 getrainde kubusposities waar 25 dat niet deden. Zie neem uw eerste dataset op.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Train ACT eerst, want het kan niet tegen u liegen
Geen vooraf getrainde gewichten, dus als het de taak überhaupt uitvoert, bevat uw dataset de taak. Als ACT stagneert, corrigeer de gegevens. 1 tot 3 USD, 2 tot 5 uur op een 24 GB kaart.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Voer SmolVLA uit op dezelfde dataset, ongewijzigd
Dezelfde gegevens, dezelfde arm, 450 M parameters in plaats van 80 M, plus taalconditionering. LeRobot schat een run van 20K stappen op ongeveer 4 uur op één A100. Dit vertelt u of voor-training iets oplevert.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Converteer naar v2.1 voordat u GR00T aanraakt
GR00T leest een variant van het LeRobot v2-formaat plus een extra
meta/modality.jsondie aangeeft hoe samengevoegde status- en actie-arrays worden opgesplitst in benoemde velden. Een v3.0-dataset laat die lader crashen, omdat v3.0 veel afleveringen in gedeelde bestanden verpakt waar v2 er één per aflevering schreef. Isaac-GR00T levert de downgrade-helper alsscripts/lerobot_conversion/convert_v3_to_v2.py; de v3-afwijzingspagina is de snelle weg.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Schaal alleen op naar GR00T N1.7 als de eerste twee iets te wensen overlieten
Via NVIDIA's CLI, hier getoond, of LeRobot's
grootbeleidstype. NVIDIA beveelt 40 GB of meer VRAM aan voor fine-tuning, 16 GB voor inferentie. Bij een OOM, zie de OOM-pagina.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Twee manieren om die screening uit te voeren
Drie omgevingen, omdat de toolchains niet naast elkaar bestaan. LeRobot op main is 0.6.2 en heeft Python 3.12 of nieuwer nodig; Isaac-GR00T en openpi zijn afzonderlijke uv-beheerde repositories.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T koppelt
torchcodec0.8.0 als zijn enige video-backend, en heeft FFmpeg 4 tot 7 nodig. FFmpeg 8 wordt niet ondersteund, AV1 is niet gegarandeerd. - openpi geheugenvereisten: inferentie boven 8 GB, LoRA boven 22.5 GB, volledige fine-tuning boven 70 GB. Dat laatste is waarom Pi0.5 een A100-taak is.
- Huur zelf de GPU, vernietig deze daarna, en stem drie sets checkpoint-paden handmatig af.
Dezelfde vijf modellen, één formulier. Kies model, dataset en hyperparameters; de backend huurt een GPU op maat van het benodigde VRAM, draait de trainer en schrijft naar objectopslag.
- De trainingsmatrix bestaat uit vijf modellen per vier armen, elke cel een gids: SmolVLA op SO-100, ACT op SO-101.
- Inferentie-pods worden automatisch geprovisioneerd door
/api/inference/podmet een idle watchdog, zodat een vergeten pod niet stilzwijgend wordt gefactureerd. - Basis-checkpoints zijn die van de leveranciers zelf:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT heeft er geen. - Dezelfde bewerkingen vanaf de CLI en van AI-agenten via de MCP-server.
- Geen hardware? De live arm streamt een fysieke SO-100 zonder aanmelding; de probeerpagina toont de manieren om binnen te komen.
Fundamentmodel of vanaf nul
De echte afweging is niet welk 3 B-model te kiezen. Het is of je überhaupt een voorgegetrainde VLA moet gebruiken, gezien dat ACT zes echte bimanuele taken leerde van elk ongeveer tien minuten aan demonstraties, met 80 M parameters en niets voorgegetraind.
- Taalconditionering. ACT heeft dit niet; één ACT checkpoint voert één taak uit.
- Beter op objecten die ontbreken in je demonstraties: op SO-101, 50% tegenover ACT's 40% buiten de distributie.
- Multi-tasking überhaupt: SmolVLA bereikt 78,3% over drie SO-100 taken met één checkpoint; ACT werd alleen single-task uitgevoerd.
- 7,6x tot 24x de latentie: 152 tot 485 ms per actiestap tegenover ACT's 20 ms.
- 4 tot 12 USD per run in plaats van 1 tot 3, en een A100-tier in plaats van elke 24 GB kaart.
- Licentieblootstelling, plus een 'gated-repo' faalmodus die niet bestaat bij een 'from scratch' aanpak.
- Voorgegetrainde gewichten kunnen een slechte dataset maskeren. Een finetune die half werkt op kapotte data kost een week voordat je naar de data kijkt.
Het geval van het reproduceren van een oude run
Het najagen van een 2025 checkpoint bepaalt de modelkeuze voor jou en verandert het probleem in versiepinning: huidige LeRobot accepteert N1.5 niet, dus je pint lerobot==0.5.1. Zonder seed-veld en 5 tot 6 procent variantie tussen runs, is de reproductie bij constructie bij benadering. en hebben de platformkant.

Nog twee over? ACT tegen GR00T N1.7 en GR00T N1.7 tegen SmolVLA. Ruwe rijen staan in de arena-vermeldingen: GR00T N1.7, Pi0.5, SmolVLA en ACT.
Waar dit platform u niet helpt
- Het kan externe inferentie niet versnellen. De lus van 20 tot 485 ms behoort tot het model; internet round trips voegen daaraan toe.
- Het kan GR00T of Pi0.5 niet fine-tunen op uw eigen hardware. Beide zijn hier alleen in de cloud beschikbaar; alleen SmolVLA en ACT draaien lokaal.
- Het kan een dataset niet repareren. Verlies daalt, maar het beleid doet niets is een dataprobbleem, een beleid dat alleen werkt in één opstelling is een dekkingsprobleem.
- Het kan GR00T-runs niet reproduceerbaar maken: de upstream-configuratie heeft geen seed-veld.
85 modellen, 332 benchmarkresultaten, elk getal gekoppeld aan de bron
De sorteerbare versie van de tabellen op deze pagina: 85 visie-taal-actie modellen, 332 benchmarkresultaten, elk gekoppeld aan het bijbehorende paper of modelkaart.
Open de arenaEén kiezen en verdergaan
Eén standaard: neem 50 afleveringen op, train ACT voor 1 tot 3 USD om de dataset te bewijzen, dan SmolVLA op de zelfde data. Samen minder dan 6 USD, en ze beantwoorden de vraag die ertoe doet: of pretraining hier helpt, of de bottleneck de data is. Escaleer naar GR00T N1.7 voor contactrijke meerstaps taken, naar Pi0.5 wanneer de scène verandert.
Platformoverzicht: train je eerste beleid, dan voer je eerste beleid uit. De trainingsdocumentatie en datasetdocumentatie behandelen vorm en formaat; de SO-100 pagina en de complete SO-100 gids behandelen bouw en kalibratie. Achtergrond: het VLA-overzicht en het Pi0 flow-matching artikel. Degene die je slagingspercentage zal verhogen is de datakwaliteitsgids.
Welk VLA-beleid moet ik eerst trainen op een SO-100?▾
ACT, daarna SmolVLA. ACT traint vanaf nul, dus het kan een slechte dataset niet maskeren, en een run kost 1 tot 3 USD op een 24 GB kaart. Als ACT de taak überhaupt uitvoert, zijn de 4 tot 12 USD voor een GR00T N1.7 of Pi0.5 run niet verspild.
Is GR00T N1.7 daadwerkelijk beter dan Pi0.5?▾
Op LIBERO vallen ze binnen de ruis: 97.0% over vier suites voor GR00T N1.7, 96.85% voor Pi0.5 bij 30k stappen in openpi, 97.5% voor de LeRobot-poort, allemaal van verschillende testomgevingen. De echte verschillen zijn 152 ms per actiestap tegen 485 ms, v2.1 datasets tegen v3.0, en benchmarknauwkeurigheid tegen generalisatie in een open wereld.
Kan ik een van deze fine-tunen op een enkele RTX 4090?▾
SmolVLA en ACT, ja; beide staan vermeld voor een RTX 4090 of elke 24 GB kaart en draaien lokaal. GR00T N1.7, N1.5 en Pi0.5 hebben een A100 of H100 80 GB nodig en zijn hier alleen via de cloud beschikbaar. NVIDIA raadt 40 GB of meer aan voor GR00T fine-tuning; de ondergrens van openpi ligt boven 70 GB voor een volledige Pi0.5 fine-tune, 22.5 GB voor LoRA.
Welke van deze vijf kan ik commercieel gebruiken?▾
GR00T N1.7 gewichten vallen onder de NVIDIA Open Model License Agreement, die volgens de kaart commercieel gebruik dekt. N1.5 gewichten zijn niet-commercieel. De code van SmolVLA is Apache 2.0 in LeRobot, maar de lerobot/smolvla_base kaart bevat geen licentieveld, dus de gewichten zijn onvermeld. ACT heeft geen basisgewichten om te licentiëren. Pi0.5 is ambigu: de documentatie van LeRobot zegt Apache 2.0, de metadata van de kaart vermeldt license: gemma.
Sources
- NVIDIA Isaac-GR00T repository: GA-status, N1.6 naar N1.7 wijzigingen, hardwarevereisten, torchcodec en FFmpeg beperkingen, launch_finetune.py, run-to-run variantie
- nvidia/GR00T-N1.7-3B modelkaart: Cosmos-Reason2-2B backbone, 3 B parameters, inferentie timing tabel, NVIDIA Open Model License, Model Version veld
- nvidia/GR00T-N1.5-3B modelkaart: Eagle 2 referentie, SigLip2 en T5, flow matching DiT, eenzijdige niet-commerciële licentie
- Isaac-GR00T LIBERO voorbeeld: succespercentages per suite bij 20K stappen en batchgrootte 640, 200 trials per suite
- Isaac-GR00T SimplerEnv voorbeeld: succespercentages per taak Bridge en Fractal, GR00T N1.6 tegen N1.7
- pi0.5: een Vision-Language-Action Model met Open-World Generalisatie (2 B VLM plus 300 M actie-expert, 50 Hz besturing, ongeveer 400 uur mobiele manipulatie, schaalstudie over 3 tot 104 locaties)
- openpi repository: GPU geheugenlimieten, flow-matching-head-only scope, en de Pi0.5 LIBERO resultaten in examples/libero
- lerobot/pi05_base modelkaart: scope van de LeRobot poort, license: gemma metadata, lerobot-train gebruik
- LeRobot pi0.5 documentatie: gated PaliGemma tokenizer, LIBERO reproductietabel, n_action_steps fallback valkuil, Apache 2.0 verklaring
- SmolVLA: Een Vision-Language-Action Model voor Betaalbare en Efficiënte Robotica (450 M parameters, LIBERO en Meta-World tabellen, SO-100 en SO-101 resultaten, asynchrone inferentie)
- LeRobot SmolVLA documentatie: 50 afleveringen over 5 posities tegen 25, 20k stappen in ongeveer 4 uur op een A100
- Leren van Fijne Bimanuele Manipulatie met Goedkope Hardware (ACT en ALOHA): 6 taken met 80-90 procent, chunk size ablatie van k=1 tot k=100
- LeRobot 0.6.2: ACTConfig en SmolVLAConfig defaults, standaard seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 vereiste, Apache 2.0
- LeRobot GR00T documentatie: policy type groot, N1.5 ondersteuning verwijderd, pin lerobot==0.5.1, SO-101 chunk size voorbeeld
- lerobot/smolvla_base modelkaart: het SmolVLA basis checkpoint gebruikt door --policy.path, en de metadata van de kaart, die geen licentieveld bevat
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started