Porovnávacia tabuľka politík AY-Robots zobrazujúca GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT vedľa seba s počtom parametrov, úrovňou GPU, latenciou inferencie a minimálnym počtom epizód
vla-modelspolicy-trainingmodel-selectionlerobotso-100

Ktorú VLA politiku by ste mali trénovať v roku 2026?

AY-Robots ResearchAugust 23, 202618 min čítania

GR00T N1.7, Pi0.5, SmolVLA, ACT alebo GR00T N1.5? Rozhodovacia tabuľka prispôsobená reálnym situáciám, s publikovanými benchmarkovými číslami, latenciou, nákladmi na spustenie a licenciami za každou voľbou.

Päť politík je dnes trénovateľných na ramene triedy SO-100. Líšia sa faktorom 24 v inferenčnej latencii, 37 v počte parametrov a 12 v nákladoch na spustenie, a v tom, či môžete výsledok distribuovať. Päť modelových kariet to nevyrieši: žiadna neodpovedá na otázku, ktorú máte, ktorú mám spustiť ako prvú?

Každé číslo nižšie bolo prečítané z článkov, repozitárov a kariet v auguste 2026. Čísla platformy pochádzajú z katalógu politík AY-Robots; kde sa tieto dve líšia, sú zobrazené obe.

Stručná verzia

  • Trénujte ACT ako prvý, ak pochybujete o svojom datasete: 1 až 3 USD za spustenie, nič predtrénované na zakrytie zlých dát.
  • GR00T N1.7 a Pi0.5 sa nachádzajú v rozmedzí pol bodu na LIBERO, 97.0 oproti 96.85 až 97.5. To nie je dôvod vybrať si ani jeden.
  • Pi0.5 je zameraný na generalizáciu, nie na presnosť, a je najpomalší s 485 ms.
  • SmolVLA, s 450 M parametrami, je jediný VLA tu, ktorý sa doladí na jednej 24 GB karte.
  • ACT s 20 ms je jedinou možnosťou pre rýchly reaktívny pohyb. Licencie rozhodujú o zvyšku.

Rozhodovacia tabuľka

Vaša situáciaTrénujte totoPrečo
Kvalita dátovej sady nepreukázanáACTŽiadny predtrenovaný model neskryje chybnú dátovú sadu a zlyhanie stojí 1 až 3 USD.
Bohatý na kontakt, viacstupňový, podmienený jazykomGR00T N1.797.0% cez štyri sady LIBERO, plus relatívny akčný priestor koncového efektora.
Rýchly reaktívny pohyb, inferencia pri serváchACT20 ms. Ďalší najrýchlejší je 7.6-krát pomalší.
Nové objekty, nová scéna, otvorený svetPi0.5Navrhnuté pre správanie mimo distribúcie, naprieč až 104 miestami.
Jedna 24 GB karta, stále chcete jazykSmolVLA450 M parametrov, minimálne 30 epizód, beží lokálne.
Reprodukcia behu zaznamenaného v roku 2025GR00T N1.5Len ak musíte: LeRobot to teraz odmieta, váhy sú nekomerčné.
Toto sa bude dodávať ako produktN1.7, SmolVLA or ACTN1.5 je nekomerčný, Pi0.5 obsahuje podmienky Gemma, karta SmolVLA neuvádza žiadne.

Päť kandidátov

Všetkých päť sú politiky: snímky kamery, polohy kĺbov a, pre štyri z nich, jazyková inštrukcia, mapovaná na časť budúcich cieľov kĺbov. To, čo ich odlišuje, je, koľko bolo naučené predtým, ako ste prišli.

PolitikaParametreLatenciaÚroveň GPULokálne?Min. epizódFormátCena
ACT~80 M20 ms24 GB cardáno50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardáno30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBnie50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBnie50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBnie50v3.04 to 12 USD

GR00T N1.7

Aktuálny vizuálno-jazykovo-akčný model spoločnosti NVIDIA, približne 3 miliardy parametrov, zhruba 40 miliónov trénovaných počas jemného doladenia. Repozitár uvádza rozdiely oproti N1.6: chrbtová kosť z modelu Eagle od dodávateľa na Cosmos-Reason2-2B na Qwen3-VL, difúzne vrstvy 32 na 16, rozmery stavu a akcie 29 na 132, akčný horizont 16 na 40.

Na malom ramene záleží na relatívnom akčnom priestore koncového efektora: N1.7 predpovedá delty z aktuálnej pozície, čo umožňuje prenos 20 tisíc hodín ľudského videa EgoScale do robotickej politiky. Špecifikácia na stránke N1.7, postup v príručke N1.7 na SO-100.

GA v repozitári, EA na karte modelu

Súbor README Isaac-GR00T deklaruje N1.7 ako vydanie s všeobecnou dostupnosťou, s kompletnými benchmarkmi a podporou. Jeho karta na Hugging Face sa ešte neaktualizovala: pole Model Version stále uvádza GR00T N1.7 EA. Repozitár je novší dokument.

GR00T N1.5

Rovnaká škála 3 B, chrbtová kosť Eagle 2, SigLip2 a T5, hlava DiT s prispôsobením toku. Existuje na rozšírenie ktorý už máte. Dve veci z neho robia zlú predvolenú voľbu: váhy nesú jednosmernú nekomerčnú licenciu spoločnosti NVIDIA a aktuálne vydania LeRobot odstránili podporu N1.5. Pozrite si .

Pi0.5

VLA spoločnosti Physical Intelligence s , typ politiky pi05. Práca uvádza 2 B VLM inicializovaný z PaliGemma plus 300 M akčný expert, ktorý riadi robota pri 50 Hz; konfigurácia pi05 LeRobotu predvolene používa 50-krokový blok, jednu sekundu pri tejto rýchlosti. Predajným argumentom sú nepoznané miesta: približne 400 hodín mobilnej manipulácie v reálnych domácnostiach a štúdia škálovania pre 3, 12, 22, 53, 82 a 104 miest, kde model so 104 miestami zodpovedal kontrole trénovanej na samotných testovacích domácnostiach.

Jedno obmedzenie, uvedené na lerobot/pi05_base karte: port prenáša iba flow-matching akčnú hlavu. Predikcia podúloh, tokenizácia akcií a RL neboli vydané upstream, a openpi hovorí to isté o svojom vlastnom repozitári. Stránka Pi0.5 a sprievodca Pi0.5 na SO-100 majú zvyšok.

Pasca, ktorá pohltí popoludnie: gated repozitáre

Pi0.5 potrebuje gated google/paligemma-3b-pt-224 tokenizér (gated: manual, hoci Google hovorí, že požiadavky sú spracované okamžite). Bez jeho prijatia a spustenia hf auth login v tréningovom prostredí sa úloha spustí, chvíľu sťahuje, potom zomrie na chybu autorizácie, ktorá vyzerá ako chyba siete. nvidia/GR00T-N1.7-3B nie je gated, ale jeho nvidia/Cosmos-Reason2-2B chrbtica je (gated: auto). Vymažte obidva pred zaradením do fronty; ak beh zostane nečinný, stránka so zaseknutou frontou uvádza, čo skontrolovať.

SmolVLA

450 M parametrov, asi 100 M v akčnom expertovi, na SmolVLM-2 s VLM zmrazeným a použitých iba jeho prvých 16 vrstiev jazykového modelu. Predtréning boli komunitné dáta: 481 datasetov, 10.6 M snímok, z rovnakých lacných ramien, ktoré používate. Jediný VLA tu, ktorý sa zmestí na jednu 24 GB kartu, a jediný 30 epizóda podlažie. Pozri stránku SmolVLA.

ACT

Nie je to základný model. Action Chunking Transformer z ALOHA má približne 80 M parametrov trénovaných od začiatku pre každú úlohu, na 50 demonštráciách pri 50 Hz. Práca uvádza šesť skutočných obojručných úloh z približne desiatich minút demonštrácií pre každú, s úspešnosťou 80 až 90 percent na príkladoch, ktoré zdôrazňuje. Jeho myšlienka, rozdelenie akcií na časti, je v každom modeli na tejto stránke a jeho ablácia stále meria účinok najlepšie: pri dvoch simulovaných úlohách s vypnutým časovým ensemblovaním sa úspešnosť zvyšuje z 1 percenta pri k=1 na 44 percent pri k=100. Stránka ACT obsahuje zvyšok.

Čo skutočne hovoria benchmarky

LIBERO je jeden benchmark, o ktorom informujú tri z týchto piatich: jazykovo podmienené úlohy na simulovanom Franka Panda, rozdelené do štyroch sád nižšie, po desiatich úlohách v každej. NVIDIA spustila 200 pokusov na sadu.

ModelPriestorovéObjektovéCieľové10 (Dlhé)Priemer
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Tieto riadky nie sú striktne porovnateľné

Každé číslo pochádza z iného testovacieho prostredia a rozpočtu. GR00T bežal 20K krokov s globálnou dávkou 640; údaj openpi je kontrolný bod 30K; port LeRobot pridal 6K krokov k základnému modelu LIBERO. SmolVLA je ďalšia nezhoda: jeho článok trénuje tento riadok na LIBERO od začiatku, bez predtrénovania VLA, zatiaľ čo tri nad ním dolaďujú predtrénované kontrolné body. Považujte 96.85 až 97.5 za jeden klaster a rozdiel k 87.3% za reálny, ale získaný s 6.7-násobkom parametrov.

SimplerEnv ukazuje rozptyl, čo LIBERO nerobí. NVIDIA porovnáva N1.7 s N1.6, čo je najbližšia verejná vec k „generačnej delte“.

Sada SimplerEnvPriemer N1.6Priemer N1.7Najlepší výkyvNajhorší výkyv
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

Riadok Bridge je ten užitočný: v priemere sa získalo 5.7 bodov, zatiaľ čo put_eggplant_in_basket stratilo 36 a put_eggplant_in_sink kleslo z 33 na 2. Nová generácia posúva distribúciu namiesto toho, aby ju zdvíhala, takže ak vaša úloha spadá tam, kde N1.7 regresovalo, priemer nič nehovorí.

Rebríček AY-Robots arény, triediteľná tabuľka 85 modelov videnia-jazyka-akcie s 332 výsledkami benchmarkov, pričom každá hodnota je prepojená s článkom alebo modelovou kartou, z ktorej pochádza
Aréna obsahuje 85 VLA modelov a 332 výsledkov benchmarkov, pričom každý je prepojený s jeho článkom alebo modelovou kartou. Užitočné na overenie, či je číslo uvedené v blogovom príspevku skutočné.

Z piatich, iba článok SmolVLA uvádza výsledky pre rameno triedy SO-100: 78.3 percent pre SmolVLA a 61.7 pre Pi0 naprieč tromi úlohami, obe viacúlohové, oproti 48.3 pre ACT trénované na jednu úlohu, čo nie je porovnateľné. Čisté porovnanie je pre obe modely na jednu úlohu na SO-101 pick-and-place: 90 proti 70 v distribúcii, 50 proti 40 mimo nej. Porovnajte na ACT proti SmolVLA a Pi0.5 proti SmolVLA, alebo si prezrite arénu.

Latencia a náklady rozhodujú o nasadení

Latencia inferencie je obmedzenie, ktoré ľudia objavia ako posledné a ľutujú ako prvé. Politika o päť bodov lepšia na benchmarku, ale s pol sekundou na krok akcie, vyzerá na vašom stole horšie: kontaktná dynamika nečaká.

Jedna výhrada: údaj GR00T nesúhlasí s kartou NVIDIA, ktorá meria 4 kroky odšumenia a jednu kameru pri 85.8 ms na H100 v eager móde, 48.6 ms s torch.compile, 27.9 ms cez plný TensorRT. Tu uvedených 152 ms je údaj pre celý stack s réžiou obsluhy a viac ako jednou kamerou, nie len pre forward pass.

Vzdialená inferencia má tvrdý strop

Slučka 20 až 485 ms patrí modelu a pridávajú sa k nej aj okružné cesty cez verejný internet. Vzdialená inferencia je životaschopná pre pomalé úlohy typu pick-and-place, nie pre rýchly reaktívny pohyb. Ak vaša úloha vyžaduje rýchlosť, inferencia sa nachádza vedľa servomotorov: ACT alebo SmolVLA, lokálne. Súvisiace: politika zamrzne uprostred pohybu.

Jeden spôsob, ako získať čas bez zmeny modelu: článok SmolVLA meria synchrónne vykonávanie, kde politika dokončí jeden blok pred predpovedaním ďalšieho, oproti asynchrónnemu, kde sa predikcia prekrýva s vykonávaním. Úspešnosť je podobná, 78.3 oproti 73.3, ale rovnaká úloha pick-and-place trvá 9.7 sekúnd namiesto 13.75, a v pevnom okne robot zvládne 19 cyklov namiesto 9.

Licencie, skontrolované, pretože ich nikto nekontroluje

ModelLicencia závažíLicencia kóduKomerčné použitie
GR00T N1.7NVIDIA Open Model License; karta umožňuje komerčné použitieApache 2.0áno
GR00T N1.5NVIDIA jednosmerná nekomerčná licenciaApache 2.0nie
Pi0.5metadáta karty pi05_base uvádzajú licenciu: gemmaApache 2.0 (openpi, dokumentácia LeRobot)prečítajte si obe, nesúhlasia
SmolVLAžiadne pole licencie na karte smolvla_baseApache 2.0 (LeRobot)kód áno, závažia neuvedené
ACTžiadne základné závažia neexistujúApache 2.0 (LeRobot)áno

Riadok Pi0.5 si vyžaduje pozornosť. Dokumentácia LeRobot pi05 uvádza Apache 2.0 v súlade s openpi, zatiaľ čo karta Hub pre lerobot/pi05_base obsahuje license: gemma. Obe sú aktívne. GR00T N1.7 má miernejšiu verziu: README Isaac-GR00T mimochodom uvádza, že N1.7 je plne komerčne licencovateľný pod Apache 2.0, zatiaľ čo jeho vlastná sekcia licencie a karta modelu umiestňujú kód iba pod Apache 2.0 a závažia pod NVIDIA Open Model License.

Predvolené hodnoty, ktoré skutočne spustíte

Každá forma trénera dodáva predvolené nastavenie a tie nie sú ľubovoľné. ACT sú vlastné LeRobotu: dávka 8, lr 1e-5, 100000 tréningové kroky, veľkosť bloku 100, zodpovedajúce ACTConfig upstream a k=100 z ACT článku. Jeden stĺpec nižšie je pasca.

PolitikaDávkaLRMax krokyGrad akum.Platí?Extra nastavenia
GR00T N1.7321e-4200001ánosaveSteps
GR00T N1.511e-5200016ánosaveSteps
Pi0.515e-53000016nie (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008nieseed, logFreq
ACT81e-51000001niechunkSize, nActionSteps, seed, logFreq
Reprodukovateľnosť, dátum august 2026

Vstupný bod pre jemné ladenie GR00T (launch_finetune.py, tyro CLI) nemá žiadne pole seed vo svojej konfiguračnej dátovej triede, takže spustenia nie sú bitovo reprodukovateľné. Repozitár tiež varuje pred 5 až 6 percentnou varianciou medzi spusteniami z nedeterministických augmentácií obrázkov, čo je viac ako väčšina rozdielov v benchmarkoch, o ktorých sa diskutuje online. Predvolený seed LeRobotu je 1000. Stĺpec grad-accum popisuje lerobot 0.5.1; upstream 0.6.2 ho sprístupňuje ako --accelerator.gradient_accumulation.steps.

Nastavenie, ktoré je dôležitejšie ako výber modelu

Je to akčný blok. Dlhšie bloky poskytujú plynulejší pohyb a menej kumulatívnych chýb, ale politika je záväzná počas vykonávania bloku, takže reaguje neskoro na čokoľvek, čo sa pohybuje: sebavedomá na statickej kocke, beznádejná na kotúľajúcej sa. Ak prejde príliš ďaleko, skrátenie vykonanej časti je lepšie ako preškolenie a je zadarmo. Kĺb, ktorý sa zastaví príliš skoro, je iný problém; pozri .

  • ACT: ACTConfig predvolene používa chunk_size 100 a n_action_steps 100. Časové zoskupovanie je vypnuté a vyžaduje n_action_steps 1.
  • GR00T N1.7: interný horizont sa zmenil z 16 na 40, no príklad SO-101 od LeRobot stále spúšťa --policy.chunk_size=16 --policy.n_action_steps=16. Príznak rollout bol premenovaný na --execution-horizon.
  • Pi0.5: 50-krokový blok, z ktorého recept LIBERO od LeRobot vykonáva 10 prostredníctvom --policy.n_action_steps=10; s --policy.pretrained_path sa vráti na 50, ak príznak vynecháte.
  • SmolVLA: 50-akčné bloky, oba ovládače sú prístupné.

Ako preveriť všetkých päť za jedno popoludnie

Najlacnejšou odpoveďou nie je viac čítania. Minúť asi 15 USD a nechať rameno, aby vám to povedalo: zaznamenajte raz, najprv trénujte lacný model, eskalujte, keď sa preukáže, že dáta sú spoľahlivé. Štruktúra prekonáva objem, čo je zmyslom a .

  1. 1
    Zaznamenajte 50 epizód naraz

    Päťdesiat uvoľňuje priestor pre GR00T, Pi0.5 a ACT, a SmolVLA 30. Opakujte každú variáciu namiesto rozširovania: 50 epizód naprieč 5 pozíciami kocky trénovaných tam, kde 25 nebolo. Pozrite si zaznamenajte si svoj prvý dataset.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Najprv trénujte ACT, pretože vám nemôže klamať

    Žiadne predtrénované váhy, takže ak úlohu vôbec vykoná, váš dataset obsahuje úlohu. Ak ACT stagnuje, opravte dáta. 1 až 3 USD, 2 až 5 hodín na 24 GB karte.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Spustite SmolVLA na rovnakom datasete, nezmenenom

    Rovnaké dáta, rovnaké rameno, 450 M parametrov namiesto 80 M, plus jazykové podmienky. LeRobot odhaduje 20K krokov behu na približne 4 hodiny na jednom A100. Toto vám povie, či predtrénovanie niečo prináša.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Preveďte na v2.1 predtým, ako sa dotknete GR00T

    GR00T číta variant formátu LeRobot v2 plus dodatočný meta/modality.json, ktorý mapuje, ako sa spojené polia stavu a akcie rozdelia na pomenované polia. Dataset v3.0 spôsobí pád tohto načítavača, pretože v3.0 balí mnoho epizód do zdieľaných súborov, zatiaľ čo v2 zapisoval jednu na epizódu. Isaac-GR00T dodáva pomocníka na downgrade ako scripts/lerobot_conversion/convert_v3_to_v2.py; stránka o odmietnutí v3 je rýchla cesta.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Prejdite na GR00T N1.7 len vtedy, ak prvé dva niečo zanechali

    Cez CLI spoločnosti NVIDIA, zobrazené tu, alebo typ politiky groot LeRobotu. NVIDIA odporúča 40 GB alebo viac VRAM pre jemné doladenie, 16 GB pre inferenciu. Pri OOM pozrite stránku OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Dva spôsoby, ako spustiť tento skríningový prechod

Tri prostredia, pretože sady nástrojov neexistujú spoločne. LeRobot na main je 0.6.2 a potrebuje Python 3.12 alebo novší; Isaac-GR00T a openpi sú samostatné repozitáre spravované uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T fixuje torchcodec 0.8.0 ako svoj jediný video backend, vyžadujúci FFmpeg 4 až 7. FFmpeg 8 nie je podporovaný, AV1 nie je zaručený.
  • Minimálne požiadavky na pamäť openpi: inferencia nad 8 GB, LoRA nad 22.5 GB, plné jemné doladenie nad 70 GB. Ten posledný je dôvod, prečo je Pi0.5 úlohou pre A100.
  • Prenajmite si GPU sami, potom ju zničte, ručne zosúlaďte tri sady ciest k checkpointom.

Základný model alebo od nuly

Skutočná dilema nie je, ktorý 3 B model si vybrať. Ide o to, či vôbec použiť predtrénovaný VLA, vzhľadom na to, že ACT sa naučil šesť skutočných bimanálnych úloh z približne desiatich minút demonštrácií pre každú, s 80 M parametrami a ničím predtrénovaným.

Jemné doladenie predtrénovaného VLA namiesto trénovania ACT od začiatku
Čo získate
  • Jazykové podmieňovanie. ACT žiadne nemá; jeden checkpoint ACT vykonáva jednu úlohu.
  • Lepšie na objektoch chýbajúcich vo vašich demonštráciách: na SO-101, 50% oproti 40% ACT mimo distribúcie.
  • Vôbec multi-task: SmolVLA dosahuje 78,3% naprieč tromi úlohami SO-100 s jedným checkpointom; ACT bol spustený iba pre jednu úlohu.
Čo vás to stojí
  • 7,6x až 24x vyššia latencia: 152 až 485 ms na krok akcie oproti 20 ms u ACT.
  • 4 až 12 USD za spustenie namiesto 1 až 3, a úroveň A100 namiesto akejkoľvek 24 GB karty.
  • Riziko licencie, plus režim zlyhania s obmedzeným prístupom k repozitáru, ktorý neexistuje pri trénovaní od začiatku.
  • Predtrénované váhy môžu maskovať zlý dataset. Jemné doladenie, ktoré funguje len čiastočne na poškodených dátach, stojí týždeň, kým sa pozriete na dáta.

Prípad reprodukcie starého spustenia

Naháňanie checkpointu z roku 2025 robí výber modelu za vás a mení problém na pripnutie verzie: aktuálny LeRobot odmieta N1.5, takže pripnete lerobot==0.5.1. Bez poľa pre seed a s 5 až 6 percentnou varianciou medzi spusteniami je reprodukcia konštrukčne približná. a majú stranu platformy.

Stránka AY-Robots s priamym porovnaním GR00T N1.7 proti Pi0.5, zobrazujúca počty parametrov, požiadavky na GPU, latenciu inferencie, formát datasetu a minimálne počty epizód vedľa seba
Priame porovnanie na /compare/groot-n1-7-vs-pi0-5. Dva 3 B modely vyzerajú na špecifikačnom liste zameniteľné, no nie sú: jeden vyžaduje LeRobot v2.1, druhý v3.0.

Zostali dva? ACT proti GR00T N1.7 a GR00T N1.7 proti SmolVLA. Nespracované riadky sú v záznamoch arény: GR00T N1.7, Pi0.5, SmolVLA a ACT.

Kde vám táto platforma nepomôže

85 modelov, 332 výsledkov benchmarkov, každé číslo odkazuje na svoj zdroj

Triediteľná verzia tabuliek na tejto stránke: 85 modelov vízie, jazyka a akcie, 332 výsledkov benchmarkov, každý s odkazom na svoj článok alebo modelovú kartu.

Otvoriť arénu

Výber jedného a pokračovanie

Jeden predvolený postup: zaznamenajte 50 epizód, trénujte ACT za 1 až 3 USD na overenie dátovej sady, potom SmolVLA na rovnakých dátach. Spolu pod 6 USD a odpovedia na dôležitú otázku: či tu pomáha predtrenovanie, alebo či je úzkym hrdlom dátová sada. Eskalujte na GR00T N1.7 pre viacstupňové úlohy s bohatým kontaktom, na Pi0.5, keď sa scéna zmení.

Prehliadka platformy: natrénujte svoju prvú politiku, potom spustite svoju prvú politiku. Dokumentácia k trénovaniu a dokumentácia k dátovým sadám pokrývajú formu a formát; stránka SO-100 a kompletný sprievodca SO-100 pokrývajú zostavenie a kalibráciu. Pozadie: prehľad VLA a článok o Pi0 flow-matching. Ten, ktorý posunie vašu úspešnosť, je sprievodca kvalitou dát.

Ktorú VLA politiku by som mal trénovať ako prvú na SO-100?

ACT, potom SmolVLA. ACT trénuje od začiatku, takže nemôže maskovať zlý dataset, a jedno spustenie stojí 1 až 3 USD na 24 GB karte. Ak ACT úlohu vôbec zvládne, 4 až 12 USD za spustenie GR00T N1.7 alebo Pi0.5 nie je zbytočných.

Je GR00T N1.7 skutočne lepší ako Pi0.5?

Na LIBERO sú v rámci šumu: 97.0% naprieč štyrmi sadami pre GR00T N1.7, 96.85% pre Pi0.5 pri 30k krokoch v openpi, 97.5% pre port LeRobot, všetko z rôznych testovacích prostredí. Skutočné rozdiely sú 152 ms na akčný krok oproti 485 ms, datasety v2.1 oproti v3.0 a presnosť benchmarku oproti generalizácii v otvorenom svete.

Môžem niektorý z nich doladiť na jednej RTX 4090?

SmolVLA a ACT, áno; oba sú uvedené pre RTX 4090 alebo akúkoľvek 24 GB kartu a bežia lokálne. GR00T N1.7, N1.5 a Pi0.5 potrebujú A100 alebo H100 80 GB a sú tu len cloudové. NVIDIA odporúča 40 GB alebo viac pre doladenie GR00T; spodná hranica openpi je nad 70 GB pre úplné doladenie Pi0.5, 22.5 GB pre LoRA.

Ktorý z týchto piatich môžem použiť komerčne?

Váhy GR00T N1.7 sú pod licenciou NVIDIA Open Model License Agreement, ktorá podľa karty pokrýva komerčné použitie. Váhy N1.5 sú nekomerčné. Kód SmolVLA je Apache 2.0 v LeRobot, ale karta lerobot/smolvla_base neobsahuje pole licencie, takže váhy sú neuvedené. ACT nemá žiadne základné váhy na licencovanie. Pi0.5 je nejednoznačný: dokumentácia LeRobot uvádza Apache 2.0, jeho metadáta karty uvádzajú license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started