De AY-Robots beleidsvergelijkingstabel die GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA en ACT naast elkaar toont met parametertellingen, GPU-tier, inferentielatentie en minimale episodetellingen
vla-modellenbeleidstrainingmodelselectielerobotso-100

Welk VLA-beleid moet u trainen in 2026?

AY-Robots ResearchAugust 23, 202618 min leestijd

GR00T N1.7, Pi0.5, SmolVLA, ACT of GR00T N1.5? Een beslissingstabel afgestemd op reële situaties, met de gepubliceerde benchmarkcijfers, latentie, kosten per uitvoering en licenties achter elke keuze.

Vijf beleidsregels zijn vandaag trainbaar op een SO-100 klasse arm. Ze verschillen met een factor 24 in inferentie latentie, 37 in parameteraantal en 12 in wat een run kost, en in de vraag of u het resultaat mag verzenden. Vijf modelkaarten zullen het niet oplossen: geen enkele beantwoordt de vraag die u heeft, welke moet ik als eerste uitvoeren?

Elk onderstaand getal is gelezen uit de papers, repositories en kaarten in augustus 2026. Platformnummers komen van de AY-Robots beleidscatalogus; waar de twee verschillen, worden beide getoond.

De korte versie

  • Train ACT eerst als u twijfelt aan uw dataset: 1 to 3 USD a run, niets voorgegetraind om slechte data te verdoezelen.
  • GR00T N1.7 and Pi0.5 liggen binnen een half punt op LIBERO, 97.0 against 96.85 to 97.5. Dat is geen reden om een van beide te kiezen.
  • Pi0.5 speelt in op generalisatie, niet op nauwkeurigheid, en de langzaamste met 485 ms.
  • SmolVLA, met 450 M parameters, is de enige VLA hier die fine-tuned op één 24 GB kaart.
  • ACT met 20 ms is de enige optie voor snelle reactieve beweging. Licenties bepalen de rest.

De beslissingstabel

Uw situatieTrain ditWaarom
Kwaliteit dataset onbewezenACTNiets voorgegetraind verbergt een kapotte dataset, en falen kost 1 tot 3 USD.
Contactrijk, meerstaps, taalgestuurdGR00T N1.797,0% over vier LIBERO suites, plus een relatieve actieruimte voor de eindeffector.
Snelle reactieve beweging, inferentie bij de servo'sACT20 ms. De volgende snelste is 7,6 keer langzamer.
Nieuwe objecten, nieuwe scène, open wereldPi0.5Gebouwd voor out-of-distribution gedrag, over maximaal 104 locaties.
Eén 24 GB kaart, nog steeds taal gewenstSmolVLA450 M parameters, een basis van 30 afleveringen, draait lokaal.
Een run opgenomen in 2025 reproducerenGR00T N1.5Alleen als het moet: LeRobot wijst het nu af, gewichten niet-commercieel.
Dit wordt als product geleverdN1.7, SmolVLA or ACTN1.5 is niet-commercieel, Pi0.5 hanteert Gemma-voorwaarden, de kaart van SmolVLA vermeldt niets.

De vijf kandidaten

Alle vijf zijn beleidsregels: cameraframes, gewrichtsposities en, voor vier ervan, een taalinstructie, toegewezen aan een reeks toekomstige gewrichtsdoelen. Wat hen onderscheidt, is hoeveel er werd geleerd voordat u arriveerde.

BeleidParametersLatentieGPU-klasseLokaal?Min. afleveringenFormaatKosten
ACT~80 M20 ms24 GB cardja50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardja30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBnee50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBnee50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBnee50v3.04 to 12 USD

GR00T N1.7

NVIDIA's huidige visie-taal-actiemodel, ongeveer 3 miljard parameters, ruwweg 40 miljoen getraind tijdens fine-tuning. De repository vermeldt de verschillen ten opzichte van N1.6: backbone van een ingekocht Eagle-model naar Cosmos-Reason2-2B op Qwen3-VL, diffusielagen 32 naar 16, status- en actiedimensies 29 naar 132, actiehorizon 16 naar 40.

Wat belangrijk is bij een kleine arm, is de relatieve actieruimte van de eindeffector: N1.7 voorspelt delta's van de huidige pose, wat ervoor zorgt dat 20K uur aan EgoScale menselijke video kan worden overgedragen naar een robotbeleid. Specificaties op de N1.7-pagina, procedure in de N1.7 op SO-100 handleiding.

GA in de repo, EA op de modelkaart

De Isaac-GR00T README verklaart N1.7 een Algemene Beschikbaarheid release, met volledige benchmarks en ondersteuning. De Hugging Face-kaart is nog niet bijgewerkt: het Model Version veld leest nog steeds GR00T N1.7 EA. De repository is het nieuwere document.

GR00T N1.5

Dezelfde 3 B schaal, Eagle 2 backbone, SigLip2 en T5, flow-matching DiT head. Het bestaat om een dat je al hebt uit te breiden. Twee dingen maken het een slechte standaard: de gewichten dragen NVIDIA's eenrichtings niet-commerciële licentie, en huidige LeRobot releases hebben N1.5 ondersteuning verwijderd. Zie .

Pi0.5

Physical Intelligence's VLA, beleidstype pi05. Het artikel beschrijft een 2 B VLM geïnitialiseerd vanuit PaliGemma plus een 300 M actie-expert, die de robot aanstuurt met 50 Hz; LeRobot's pi05 configuratie gebruikt standaard een 50-staps chunk, één seconde met die snelheid. Het verkoopargument zijn ongeziene plaatsen: ongeveer 400 uur mobiele manipulatie in echte huizen, en een schaalstudie over 3, 12, 22, 53, 82 en 104 locaties, waarbij het 104-locatie model overeenkwam met een controle getraind op de testhuizen zelf.

Eén beperking, vermeld op de lerobot/pi05_base kaart: de poort draagt alleen de flow-matching actiehoofd. Subtaakvoorspelling, actietokenisatie en RL zijn niet upstream vrijgegeven, en openpi zegt hetzelfde over zijn eigen repository. De Pi0.5 pagina en de Pi0.5 op SO-100 gids hebben de rest.

De val die een middag opslokt: gated repo's

Pi0.5 heeft de gated google/paligemma-3b-pt-224 tokenizer (gated: manual, hoewel Google zegt dat verzoeken onmiddellijk worden verwerkt) nodig. Zonder dit te accepteren en hf auth login uit te voeren in de trainingsomgeving, start de taak, downloadt een tijdje, en sterft dan aan een autorisatiefout die klinkt als een netwerkfout. nvidia/GR00T-N1.7-3B is niet gated, maar zijn nvidia/Cosmos-Reason2-2B backbone is (gated: auto). Wis beide voordat je in de wachtrij plaatst; als een run inactief blijft, de pagina voor vastgelopen wachtrijen vermeldt wat te controleren.

SmolVLA

450 M parameters, ongeveer 100 M in de actie-expert, op SmolVLM-2 met de VLM bevroren en alleen de eerste 16 taalmodel-lagen gebruikt. Pretraining was gemeenschapsdata: 481 datasets, 10.6 M frames, van dezelfde goedkope armen die je gebruikt. De enige VLA hier die op één 24 GB kaart past, en de enige met een 30 episode vloer. Zie de SmolVLA pagina.

ACT

Geen fundamenteel model. De Action Chunking Transformer van ALOHA heeft ongeveer 80 M parameters, getraind vanaf nul per taak, op 50 demonstraties met 50 Hz. Het artikel rapporteert zes echte bimanuele taken van ongeveer tien minuten demonstraties elk, met 80 tot 90 procent op de voorbeelden die het belicht. Het idee ervan, actie-chunking, zit in elk model op deze pagina, en de ablatie ervan meet nog steeds het effect het beste: over twee gesimuleerde taken met uitgeschakelde temporele ensembling, stijgt het succes van 1 procent bij k=1 naar 44 procent bij k=100. De ACT-pagina heeft de rest.

Wat de benchmarks werkelijk zeggen

LIBERO is de enige benchmark waar drie van deze vijf over rapporteren: taal-geconditioneerde taken op een gesimuleerde Franka Panda, verdeeld in de vier onderstaande suites met elk tien taken. NVIDIA voerde 200 proeven per suite.

ModelRuimtelijkObjectDoel10 (Lang)Gemiddelde
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Deze rijen zijn niet strikt vergelijkbaar

Elk getal komt van een verschillende testopstelling en budget. GR00T draaide 20K stappen met een globale batch van 640; het openpi-cijfer is een 30K checkpoint; de LeRobot-poort voegde 6K stappen toe aan een LIBERO-basismodel. SmolVLA is een verdere mismatch: de paper traint die rij op LIBERO vanaf nul, zonder VLA-voortraining, terwijl de drie erboven voortgetrainde checkpoints finetunen. Beschouw 96.85 tot 97.5 als één cluster, en het verschil tot 87.3% als reëel, maar verkregen met 6.7x de parameters.

SimplerEnv toont de spreiding, wat LIBERO niet doet. NVIDIA vergelijkt N1.7 met N1.6, het dichtstbijzijnde publieke equivalent van een "generational delta."

SimplerEnv suiteN1.6 gemiddeldeN1.7 gemiddeldeBeste uitslagSlechtste uitslag
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0geen, elke taak verbeterde

De Bridge-rij is de nuttige: gemiddeld 5,7 punten gewonnen terwijl put_eggplant_in_basket 36 verloor en put_eggplant_in_sink van 33 naar 2 daalde. Een nieuwe generatie verschuift de distributie in plaats van deze op te tillen, dus als uw taak zich bevindt waar N1.7 achteruitging, zegt het gemiddelde niets.

Het AY-Robots arena-klassement, een sorteerbare tabel van 85 visie-taal-actie-modellen met 332 benchmarkresultaten, waarbij elke waarde is gekoppeld aan het paper of de modelkaart waar het vandaan kwam
De arena bevat 85 VLA-modellen en 332 benchmarkresultaten, elk gekoppeld aan het bijbehorende paper of modelkaart. Handig om te controleren of een getal dat in een blogpost wordt genoemd, echt is.

Van de vijf rapporteert alleen het SmolVLA-paper over een SO-100 klasse arm: 78,3 procent voor SmolVLA en 61,7 voor Pi0 over drie taken, beide multi-task, tegen 48,3 voor ACT getraind single-task, wat geen gelijke vergelijking is. De zuivere koppeling is beide single-task op SO-101 pick-and-place: 90 tegen 70 in distributie, 50 tegen 40 daarbuiten. Vergelijk op ACT tegen SmolVLA en Pi0.5 tegen SmolVLA, of blader door de arena.

Latentie en kosten bepalen de implementatie

Inferentielatentie is de beperking die mensen het laatst ontdekken en het eerst betreuren. Een beleid dat vijf punten beter scoort op een benchmark, maar een halve seconde per actiestap duurt, ziet er slechter uit op je bureau: contactdynamica wachten niet.

Eén kanttekening: het GR00T-cijfer komt niet overeen met de kaart van NVIDIA, die 4 denoising-stappen en één camera meet op 85,8 ms op een H100 in eager mode, 48,6 ms met torch.compile, 27,9 ms via volledige TensorRT. De 152 ms hier is een cijfer voor de hele stack met serving overhead en meer dan één camera, geen forward pass.

Inferentie op afstand heeft een hard plafond

De lus van 20 tot 485 ms is van het model, en round trips via het openbare internet dragen daaraan bij. Inferentie op afstand is haalbaar voor langzame pick-and-place, niet voor snelle reactieve beweging. Als je taak snelheid vereist, bevindt inferentie zich naast de servo's: ACT of SmolVLA, lokaal. Gerelateerd: beleid bevriest midden in de beweging.

Eén manier om tijd te winnen zonder het model te veranderen: het SmolVLA-artikel meet synchrone uitvoering, waarbij het beleid een 'chunk' voltooit voordat het de volgende voorspelt, versus asynchrone uitvoering, waarbij voorspelling de uitvoering overlapt. Het succes is vergelijkbaar, 78,3 tegen 73,3, maar dezelfde pick-and-place duurt 9,7 seconden in plaats van 13,75, en in een vast venster beheert de robot 19 cycli in plaats van 9.

Licenties, gecontroleerd omdat niemand ze controleert

ModelLicentie gewichtenLicentie codeCommercieel gebruik
GR00T N1.7NVIDIA Open Model License; kaart staat commercieel gebruik toeApache 2.0ja
GR00T N1.5NVIDIA eenzijdige niet-commerciële licentieApache 2.0nee
Pi0.5pi05_base kaart metadata vermeldt licentie: gemmaApache 2.0 (openpi, LeRobot docs)lees beide, ze spreken elkaar tegen
SmolVLAgeen licentieveld op de smolvla_base kaartApache 2.0 (LeRobot)code ja, gewichten onvermeld
ACTgeen basisgewichten aanwezigApache 2.0 (LeRobot)ja

De Pi0.5 rij vereist aandacht. De LeRobot pi05 documentatie vermeldt Apache 2.0, consistent met openpi, terwijl de Hub-kaart voor lerobot/pi05_base vermeldt license: gemma. Beide zijn actief. GR00T N1.7 heeft een mildere versie: de Isaac-GR00T README vermeldt terloops dat N1.7 volledig commercieel licentieerbaar is onder Apache 2.0, terwijl de eigen licentiesectie en de modelkaart alleen de code onder Apache 2.0 plaatsen en de gewichten onder de NVIDIA Open Model License.

De standaardinstellingen die u daadwerkelijk zult uitvoeren

Elke trainerformulier wordt geleverd met een standaardinstelling, en deze zijn niet willekeurig. Die van ACT zijn van LeRobot zelf: batch 8, lr 1e-5, 100000 trainingsstappen, chunkgrootte 100, overeenkomend met ACTConfig upstream en k=100 uit het ACT-artikel. Eén kolom hieronder is een valstrik.

BeleidBatchLRMax stappenGrad accumVan toepassing?Extra instellingen
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Reproduceerbaarheid, d.d. augustus 2026

Het fine-tuning instappunt van GR00T (launch_finetune.py, een tyro CLI) heeft geen seed-veld in zijn config dataclass, waardoor runs niet bit-voor-bit reproduceerbaar zijn. De repository waarschuwt ook voor 5 tot 6 procent variantie tussen runs door niet-deterministische beeldaugmentaties, wat groter is dan de meeste benchmarkverschillen waar online over wordt gediscussieerd. De standaard seed van LeRobot is 1000. De grad-accum kolom beschrijft lerobot 0.5.1; upstream 0.6.2 exposeert het als --accelerator.gradient_accumulation.steps.

De instelling die meer telt dan de modelkeuze

Het is de actiechunk. Langere chunks zorgen voor vloeiendere beweging en minder cumulatieve fouten, maar het beleid wordt vastgelegd terwijl het blok wordt uitgevoerd, dus het reageert laat op alles wat beweegt: zelfverzekerd op een statische kubus, hopeloos op een rollende. Als het doorschiet, is het inkorten van het uitgevoerde gedeelte beter dan hertraining en is gratis. Een gewricht dat te vroeg stopt, is een ander probleem; zie .

  • ACT: ACTConfig defaults to chunk_size 100 and n_action_steps 100. Temporele ensembling is uitgeschakeld en vereist n_action_steps 1.
  • GR00T N1.7: de interne horizon ging van 16 naar 40, toch draait LeRobot's SO-101 voorbeeld nog steeds --policy.chunk_size=16 --policy.n_action_steps=16. De rollout-vlag is hernoemd naar --execution-horizon.
  • Pi0.5: een chunk van 50 stappen, waarvan LeRobot's LIBERO recept er 10 uitvoert via --policy.n_action_steps=10; met --policy.pretrained_path valt het terug op 50 als je de vlag weglaat.
  • SmolVLA: chunks van 50 acties, beide knoppen blootgelegd.

Hoe alle vijf in één middag te screenen

Het goedkoopste antwoord is niet meer lezen. Geef ongeveer 15 USD uit en laat de arm het je vertellen: neem één keer op, train eerst het goedkope model, schaal op zodra het de data als valide heeft bewezen. Structuur verslaat volume, het punt van en het .

  1. 1
    Neem eenmalig 50 afleveringen op

    Vijftig maakt de weg vrij voor GR00T, Pi0.5 en ACT, en SmolVLA's 30. Herhaal elke variatie in plaats van te verspreiden: 50 afleveringen over 5 getrainde kubusposities waar 25 dat niet deden. Zie neem uw eerste dataset op.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Train ACT eerst, want het kan niet tegen u liegen

    Geen vooraf getrainde gewichten, dus als het de taak überhaupt uitvoert, bevat uw dataset de taak. Als ACT stagneert, corrigeer de gegevens. 1 tot 3 USD, 2 tot 5 uur op een 24 GB kaart.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Voer SmolVLA uit op dezelfde dataset, ongewijzigd

    Dezelfde gegevens, dezelfde arm, 450 M parameters in plaats van 80 M, plus taalconditionering. LeRobot schat een run van 20K stappen op ongeveer 4 uur op één A100. Dit vertelt u of voor-training iets oplevert.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Converteer naar v2.1 voordat u GR00T aanraakt

    GR00T leest een variant van het LeRobot v2-formaat plus een extra meta/modality.json die aangeeft hoe samengevoegde status- en actie-arrays worden opgesplitst in benoemde velden. Een v3.0-dataset laat die lader crashen, omdat v3.0 veel afleveringen in gedeelde bestanden verpakt waar v2 er één per aflevering schreef. Isaac-GR00T levert de downgrade-helper als scripts/lerobot_conversion/convert_v3_to_v2.py; de v3-afwijzingspagina is de snelle weg.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Schaal alleen op naar GR00T N1.7 als de eerste twee iets te wensen overlieten

    Via NVIDIA's CLI, hier getoond, of LeRobot's groot beleidstype. NVIDIA beveelt 40 GB of meer VRAM aan voor fine-tuning, 16 GB voor inferentie. Bij een OOM, zie de OOM-pagina.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Twee manieren om die screening uit te voeren

Drie omgevingen, omdat de toolchains niet naast elkaar bestaan. LeRobot op main is 0.6.2 en heeft Python 3.12 of nieuwer nodig; Isaac-GR00T en openpi zijn afzonderlijke uv-beheerde repositories.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T koppelt torchcodec 0.8.0 als zijn enige video-backend, en heeft FFmpeg 4 tot 7 nodig. FFmpeg 8 wordt niet ondersteund, AV1 is niet gegarandeerd.
  • openpi geheugenvereisten: inferentie boven 8 GB, LoRA boven 22.5 GB, volledige fine-tuning boven 70 GB. Dat laatste is waarom Pi0.5 een A100-taak is.
  • Huur zelf de GPU, vernietig deze daarna, en stem drie sets checkpoint-paden handmatig af.

Fundamentmodel of vanaf nul

De echte afweging is niet welk 3 B-model te kiezen. Het is of je überhaupt een voorgegetrainde VLA moet gebruiken, gezien dat ACT zes echte bimanuele taken leerde van elk ongeveer tien minuten aan demonstraties, met 80 M parameters en niets voorgegetraind.

Finetunen van een voorgegetrainde VLA in plaats van ACT vanaf nul trainen
Wat je wint
  • Taalconditionering. ACT heeft dit niet; één ACT checkpoint voert één taak uit.
  • Beter op objecten die ontbreken in je demonstraties: op SO-101, 50% tegenover ACT's 40% buiten de distributie.
  • Multi-tasking überhaupt: SmolVLA bereikt 78,3% over drie SO-100 taken met één checkpoint; ACT werd alleen single-task uitgevoerd.
Wat het je kost
  • 7,6x tot 24x de latentie: 152 tot 485 ms per actiestap tegenover ACT's 20 ms.
  • 4 tot 12 USD per run in plaats van 1 tot 3, en een A100-tier in plaats van elke 24 GB kaart.
  • Licentieblootstelling, plus een 'gated-repo' faalmodus die niet bestaat bij een 'from scratch' aanpak.
  • Voorgegetrainde gewichten kunnen een slechte dataset maskeren. Een finetune die half werkt op kapotte data kost een week voordat je naar de data kijkt.

Het geval van het reproduceren van een oude run

Het najagen van een 2025 checkpoint bepaalt de modelkeuze voor jou en verandert het probleem in versiepinning: huidige LeRobot accepteert N1.5 niet, dus je pint lerobot==0.5.1. Zonder seed-veld en 5 tot 6 procent variantie tussen runs, is de reproductie bij constructie bij benadering. en hebben de platformkant.

De AY-Robots kop-aan-kop vergelijkingspagina voor GR00T N1.7 tegen Pi0.5, met naast elkaar getoonde parametertellingen, GPU-vereisten, inferentielatentie, datasetformaat en minimale episodetellingen.
Kop aan kop op /compare/groot-n1-7-vs-pi0-5. De twee 3 B modellen lijken uitwisselbaar op een specificatieblad, maar zijn dat niet: de ene vereist LeRobot v2.1, de andere v3.0.

Nog twee over? ACT tegen GR00T N1.7 en GR00T N1.7 tegen SmolVLA. Ruwe rijen staan in de arena-vermeldingen: GR00T N1.7, Pi0.5, SmolVLA en ACT.

Waar dit platform u niet helpt

  • Het kan externe inferentie niet versnellen. De lus van 20 tot 485 ms behoort tot het model; internet round trips voegen daaraan toe.
  • Het kan GR00T of Pi0.5 niet fine-tunen op uw eigen hardware. Beide zijn hier alleen in de cloud beschikbaar; alleen SmolVLA en ACT draaien lokaal.
  • Het kan een dataset niet repareren. Verlies daalt, maar het beleid doet niets is een dataprobbleem, een beleid dat alleen werkt in één opstelling is een dekkingsprobleem.
  • Het kan GR00T-runs niet reproduceerbaar maken: de upstream-configuratie heeft geen seed-veld.

85 modellen, 332 benchmarkresultaten, elk getal gekoppeld aan de bron

De sorteerbare versie van de tabellen op deze pagina: 85 visie-taal-actie modellen, 332 benchmarkresultaten, elk gekoppeld aan het bijbehorende paper of modelkaart.

Open de arena

Eén kiezen en verdergaan

Eén standaard: neem 50 afleveringen op, train ACT voor 1 tot 3 USD om de dataset te bewijzen, dan SmolVLA op de zelfde data. Samen minder dan 6 USD, en ze beantwoorden de vraag die ertoe doet: of pretraining hier helpt, of de bottleneck de data is. Escaleer naar GR00T N1.7 voor contactrijke meerstaps taken, naar Pi0.5 wanneer de scène verandert.

Platformoverzicht: train je eerste beleid, dan voer je eerste beleid uit. De trainingsdocumentatie en datasetdocumentatie behandelen vorm en formaat; de SO-100 pagina en de complete SO-100 gids behandelen bouw en kalibratie. Achtergrond: het VLA-overzicht en het Pi0 flow-matching artikel. Degene die je slagingspercentage zal verhogen is de datakwaliteitsgids.

Welk VLA-beleid moet ik eerst trainen op een SO-100?

ACT, daarna SmolVLA. ACT traint vanaf nul, dus het kan een slechte dataset niet maskeren, en een run kost 1 tot 3 USD op een 24 GB kaart. Als ACT de taak überhaupt uitvoert, zijn de 4 tot 12 USD voor een GR00T N1.7 of Pi0.5 run niet verspild.

Is GR00T N1.7 daadwerkelijk beter dan Pi0.5?

Op LIBERO vallen ze binnen de ruis: 97.0% over vier suites voor GR00T N1.7, 96.85% voor Pi0.5 bij 30k stappen in openpi, 97.5% voor de LeRobot-poort, allemaal van verschillende testomgevingen. De echte verschillen zijn 152 ms per actiestap tegen 485 ms, v2.1 datasets tegen v3.0, en benchmarknauwkeurigheid tegen generalisatie in een open wereld.

Kan ik een van deze fine-tunen op een enkele RTX 4090?

SmolVLA en ACT, ja; beide staan vermeld voor een RTX 4090 of elke 24 GB kaart en draaien lokaal. GR00T N1.7, N1.5 en Pi0.5 hebben een A100 of H100 80 GB nodig en zijn hier alleen via de cloud beschikbaar. NVIDIA raadt 40 GB of meer aan voor GR00T fine-tuning; de ondergrens van openpi ligt boven 70 GB voor een volledige Pi0.5 fine-tune, 22.5 GB voor LoRA.

Welke van deze vijf kan ik commercieel gebruiken?

GR00T N1.7 gewichten vallen onder de NVIDIA Open Model License Agreement, die volgens de kaart commercieel gebruik dekt. N1.5 gewichten zijn niet-commercieel. De code van SmolVLA is Apache 2.0 in LeRobot, maar de lerobot/smolvla_base kaart bevat geen licentieveld, dus de gewichten zijn onvermeld. ACT heeft geen basisgewichten om te licentiëren. Pi0.5 is ambigu: de documentatie van LeRobot zegt Apache 2.0, de metadata van de kaart vermeldt license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started