Primerjalna tabela politik AY-Robots, ki prikazuje GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA in ACT drug ob drugem s številom parametrov, nivojem GPU, zakasnitvijo sklepanja in minimalnim številom epizod
vla-modelitreniranje-politikizbira-modelalerobotso-100

Katero VLA politiko naj trenirate leta 2026?

AY-Robots ResearchAugust 23, 202618 min branja

GR00T N1.7, Pi0.5, SmolVLA, ACT ali GR00T N1.5? Tabela odločitev, usklajena z resničnimi situacijami, z objavljenimi referenčnimi številkami, zakasnitvijo, stroški na zagon in licencami za vsako izbiro.

Danes je mogoče usposobiti pet politik na roki razreda SO-100. Razlikujejo se za faktor 24 v inferenčni latenci, 37 v številu parametrov in 12 v stroških izvajanja ter v tem, ali smete rezultat poslati. Pet kartic modelov tega ne bo rešilo: nobena ne odgovarja na vprašanje, ki ga imate, katero naj najprej zaženem?

Vsaka spodnja številka je bila prebrana iz člankov, repozitorijev in kartic avgusta 2026. Številke platform prihajajo iz kataloga politik AY-Robots; kjer se obe ne ujemata, sta prikazani obe.

Kratka različica

  • Najprej usposobite ACT, če dvomite v svoj nabor podatkov: 1 do 3 USD na izvedbo, nič vnaprej usposobljenega za prikrivanje slabih podatkov.
  • GR00T N1.7 in Pi0.5 sta znotraj pol točke na LIBERO, 97.0 proti 96.85 do 97.5. To ni razlog za izbiro katerega koli.
  • Pi0.5 je namenjen generalizaciji, ne natančnosti, in je najpočasnejši pri 485 ms.
  • SmolVLA, s 450 M parametri, je edini VLA tukaj, ki se fino nastavi na eni 24 GB kartici.
  • ACT pri 20 ms je edina možnost za hitro reaktivno gibanje. Licence odločajo o ostalem.

Tabela odločitev

Vaša situacijaUsposobite toZakaj
Kakovost podatkovnega nabora nedokazanaACTNobena predhodno usposobljena rešitev ne more skriti pokvarjenega podatkovnega nabora, neuspeh pa stane 1 do 3 USD.
Bogato s stiki, večstopenjsko, pogojeno z jezikomGR00T N1.797,0 % v štirih paketih LIBERO, plus relativni akcijski prostor končnega efektorja.
Hitro reaktivno gibanje, sklepanje pri servomotorjihACT20 ms. Naslednji najhitrejši je 7,6-krat počasnejši.
Novi objekti, nova scena, odprt svetPi0.5Zgrajeno za obnašanje izven distribucije, na do 104 lokacijah.
Ena 24 GB kartica, še vedno želite jezikSmolVLA450 M parametrov, minimalno 30 epizod, deluje lokalno.
Reprodukcija izvedbe, posnete leta 2025GR00T N1.5Samo če morate: LeRobot ga zdaj zavrača, uteži so nekomercialne.
To bo dobavljeno kot izdelekN1.7, SmolVLA or ACTN1.5 je nekomercialen, Pi0.5 vključuje pogoje Gemma, kartica SmolVLA ne navaja nobenih.

Pet kandidatov

Vseh pet je politik: sličice kamere, položaji sklepov in, za štiri od njih, jezikovno navodilo, preslikano v del prihodnjih ciljev sklepov. Kar jih ločuje, je, koliko je bilo naučenega, preden ste prišli.

PolitikaParametriLatencaRazred GPULokalno?Min. epizodFormatCena
ACT~80 M20 ms24 GB cardda50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardda30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBne50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBne50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBne50v3.04 to 12 USD

GR00T N1.7

NVIDIA-in trenutni model vida, jezika in dejanj, približno 3 B parametrov, približno 40 M usposobljenih med fino nastavitvijo. Repozitorij navaja razlike od N1.6: hrbtenica iz modela Eagle dobavitelja v Cosmos-Reason2-2B na Qwen3-VL, difuzijske plasti 32 na 16, dimenzije stanja in dejanj 29 na 132, akcijski horizont 16 na 40.

Pri majhni roki je pomemben relativni akcijski prostor končnega efektorja: N1.7 napoveduje delte iz trenutne poze, kar omogoča prenos 20K ur človeškega videa EgoScale v robotsko politiko. Specifikacije na strani N1.7, postopek v vodniku N1.7 na SO-100.

GA v repozitoriju, EA na kartici modela

README datoteka Isaac-GR00T razglaša N1.7 za izdajo Splošne razpoložljivosti, s popolnimi merili uspešnosti in podporo. Njena kartica Hugging Face še ni posodobljena: polje Model Version še vedno prikazuje GR00T N1.7 EA. Repozitorij je novejši dokument.

GR00T N1.5

Ista lestvica 3 B, hrbtenica Eagle 2, SigLip2 in T5, glava DiT za ujemanje toka. Obstaja za razširitev ki jo že imate. Dve stvari ga delata slabo privzeto izbiro: uteži nosijo NVIDIA-ino enosmerno nekomercialno licenco, in trenutne izdaje LeRobot so odstranile podporo za N1.5. Glejte .

Pi0.5

VLA podjetja Physical Intelligence, ki uporablja VLA, tip politike pi05. Članek opisuje 2 B VLM, inicializiran iz PaliGemma, plus 300 M akcijskega strokovnjaka, ki poganja robota pri 50 Hz; konfiguracija pi05 v LeRobot privzeto uporablja 50-korakovni del, eno sekundo pri tej hitrosti. Prodajna točka so nevidna mesta: približno 400 ur mobilne manipulacije v resničnih domovih in študija skaliranja na 3, 12, 22, 53, 82 in 104 lokacijah, kjer se je model s 104 lokacijami ujemal s kontrolo, usposobljeno na samih testnih domovih.

Ena omejitev, navedena na lerobot/pi05_base kartici: vrata prenašajo samo glavo za ujemanje toka akcijske glave. Predvidevanje podnalog, tokenizacija akcij in RL niso bili objavljeni navzgor, in openpi pravi enako za svoje lastno repozitorij. Stran Pi0.5 in vodnik Pi0.5 na SO-100 imata ostalo.

Past, ki požre popoldne: zaprti repozitoriji

Pi0.5 potrebuje zaprt google/paligemma-3b-pt-224 tokenizator (gated: manual, čeprav Google pravi, da so zahteve obdelane takoj). Brez sprejetja in zagona hf auth login v okolju za usposabljanje, se naloga začne, se nekaj časa prenaša, nato pa se ustavi zaradi napake pri avtorizaciji, ki izgleda kot omrežna napaka. nvidia/GR00T-N1.7-3B ni zaprt, vendar je njegov nvidia/Cosmos-Reason2-2B hrbtenica je (gated: auto). Počistite oba pred uvrstitvijo v čakalno vrsto; če se zagon ustavi, stran o zataknjeni čakalni vrsti navaja, kaj preveriti.

SmolVLA

450 M parametrov, približno 100 M v akcijskem strokovnjaku, na SmolVLM-2 z zamrznjenim VLM in uporabljenih le njegovih prvih 16 plasti jezikovnega modela. Predusposabljanje je potekalo na podatkih skupnosti: 481 naborov podatkov, 10.6 M sličic, iz istih poceni rok, ki jih uporabljate. Edini VLA tukaj, ki se prilega eni 24 GB kartici, in edini 30 epizoda dno. Glej stran SmolVLA.

ACT

Ni temeljni model. Action Chunking Transformer iz ALOHA ima približno 80 milijonov parametrov, usposobljenih od začetka za vsako nalogo, na 50 demonstracijah pri 50 Hz. Članek poroča o šestih resničnih bimanualnih nalogah, vsaka iz približno desetih minut demonstracij, z uspešnostjo od 80 do 90 odstotkov na primerih, ki jih izpostavlja. Njegova ideja, razdelitev dejanj na dele, je prisotna v vsakem modelu na tej strani, in njegova ablacija še vedno meri učinek najbolje: pri dveh simuliranih nalogah z izklopljenim časovnim združevanjem, uspešnost naraste z 1 odstotka pri k=1 na 44 odstotkov pri k=100. Stran ACT ima preostalo.

Kaj dejansko pravijo merila uspešnosti

LIBERO je edino merilo uspešnosti, o katerem poročajo trije od teh petih: naloge, pogojene z jezikom, na simulirani Franka Panda, razdeljene v štiri spodnje zbirke po deset nalog. NVIDIA je izvedla 200 poskusov na zbirko.

ModelProstorskoPredmetCilj10 (Dolgo)Povprečje
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Te vrstice niso strogo primerljive

Vsaka številka izvira iz drugačnega preizkusa in proračuna. GR00T je izvedel 20K korakov pri globalni seriji 640; podatek openpi je kontrolna točka 30K; LeRobot port je dodal 6K korakov osnovnemu modelu LIBERO. SmolVLA je nadaljnje neskladje: njegova raziskava trenira to vrstico na LIBERO od začetka, brez predhodnega usposabljanja VLA, medtem ko trije nad njim natančno prilagodijo predhodno usposobljene kontrolne točke. Obravnavajte 96.85 do 97.5 kot eno skupino, in vrzel do 87.3% kot resnično, vendar pridobljeno s 6.7-krat več parametri.

SimplerEnv prikazuje razpon, česar LIBERO ne. NVIDIA primerja N1.7 z N1.6, kar je najbližje javni "generacijski delti."

Zbirka SimplerEnvPovprečje N1.6Povprečje N1.7Najboljše nihanjeNajslabše nihanje
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

Vrstica Bridge je uporabna: povprečno pridobljenih 5,7 točk, medtem ko put_eggplant_in_basket izgubil 36 in put_eggplant_in_sink padel s 33 na 2. Nova generacija premika distribucijo, namesto da bi jo dvignila, zato če vaša naloga spada tja, kjer je N1.7 nazadoval, povprečje ne pove ničesar.

Lestvica AY-Robots arene, razvrstljiva tabela 85 modelov vida-jezika-akcije s 332 rezultati meritev, vsaka vrednost povezana z izvirnim člankom ali kartico modela.
Arena vsebuje 85 modelov VLA in 332 rezultatov meritev, vsak je povezan z izvirnim člankom ali kartico modela. Uporabno za preverjanje, ali je številka, navedena v objavi na blogu, resnična.

Od petih, le članek SmolVLA poroča o roki razreda SO-100: 78,3 odstotka za SmolVLA in 61,7 za Pi0 pri treh nalogah, obe večopravilni, proti 48,3 za ACT, usposobljenega za eno nalogo, kar ni primerljivo. Čista primerjava je oboje eno-naložno na SO-101 pick-and-place: 90 proti 70 v distribuciji, 50 proti 40 izven nje. Primerjajte na ACT proti SmolVLA in Pi0.5 proti SmolVLA, ali brskajte po areni.

Latenca in stroški odločajo o uvedbi

Latenca sklepanja je omejitev, ki jo ljudje odkrijejo zadnjo in najprej obžalujejo. Politika, ki je na merilu uspešnosti pet točk boljša, a potrebuje pol sekunde na korak dejanja, izgleda slabše na vaši mizi: kontaktna dinamika ne čaka.

Ena opomba: številka GR00T se ne ujema s kartico NVIDIA, ki meri 4 korake odstranjevanja šuma in eno kamero pri 85.8 ms na H100 v nestrpnem načinu, 48.6 ms s torch.compile, 27.9 ms skozi celoten TensorRT. Tukajšnjih 152 ms je celotna številka sklada z režijskimi stroški strežbe in več kot eno kamero, ne pa samo prehod naprej.

Oddaljeno sklepanje ima trdo zgornjo mejo

Zanka od 20 do 485 ms je modelova, in povratna potovanja po javnem internetu se ji prištevajo. Oddaljeno sklepanje je izvedljivo za počasno pobiranje in odlaganje, ne pa za hitro reaktivno gibanje. Če vaša naloga potrebuje hitrost, sklepanje poteka poleg servomotorjev: ACT ali SmolVLA, lokalno. Povezano: politika zamrzne med gibanjem.

En način za pridobitev časa brez spreminjanja modela: članek SmolVLA meri sinhrono izvajanje, kjer politika dokonča del pred napovedovanjem naslednjega, v primerjavi z asinhronim, kjer se napovedovanje prekriva z izvajanjem. Uspeh je podoben, 78.3 proti 73.3, vendar isto pobiranje in odlaganje traja 9.7 sekund namesto 13.75, in v fiksnem oknu robot opravi 19 ciklov namesto 9.

Licence, preverjene, ker jih nihče ne preverja

ModelLicenca utežiLicenca kodeKomercialna uporaba
GR00T N1.7NVIDIA Open Model License; kartica omogoča komercialno uporaboApache 2.0da
GR00T N1.5NVIDIA enosmerna nekomercialna licencaApache 2.0ne
Pi0.5metapodatki kartice pi05_base navajajo licenco: gemmaApache 2.0 (openpi, LeRobot docs)preberite obe, nista skladni
SmolVLAni polja za licenco na kartici smolvla_baseApache 2.0 (LeRobot)koda da, uteži neopredeljene
ACTosnovne uteži ne obstajajoApache 2.0 (LeRobot)da

Vrstica Pi0.5 zahteva pozornost. Dokumentacija LeRobot pi05 navaja Apache 2.0, kar je skladno z openpi, medtem ko kartica Hub za lerobot/pi05_base, vsebuje license: gemma. Obe sta aktivni. GR00T N1.7 ima milejšo različico: README datoteka Isaac-GR00T mimogrede navaja, da je N1.7 v celoti komercialno licenciran pod Apache 2.0, medtem ko njegov lastni licenčni oddelek in kartica modela postavljata kodo le pod Apache 2.0 in uteži pod NVIDIA Open Model License.

Privzete nastavitve, ki jih boste dejansko poganjali

Vsak obrazec za usposabljanje privzeto vključuje nastavitve, ki niso poljubne. ACT-jeve so lastne LeRobotu: serija 8, lr 1e-5, 100000 korakov usposabljanja, velikost bloka 100, kar ustreza ACTConfig-u navzgor in k=100 iz ACT članka. Eden od stolpcev spodaj je past.

PolitikaSerijaLRMaks. korakiAkumulacija gradientaVelja?Dodatne nastavitve
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Ponovljivost, z datumom avgust 2026

Vhodna točka za fino uglasitev GR00T-a (launch_finetune.py, tyro CLI) nima polja za seme v svojem konfiguracijskem podatkovnem razredu, zato izvedbe niso bitno ponovljive. Repozitorij opozarja tudi na 5 do 6 odstotkov variacije med izvedbami zaradi nedeterminističnih obogatitev slik, kar je več kot večina razlik v merilih uspešnosti, o katerih se razpravlja na spletu. Privzeto seme LeRobota je 1000. Stolpec za akumulacijo gradienta opisuje lerobot 0.5.1; zgornji tok 0.6.2 ga razkriva kot --accelerator.gradient_accumulation.steps.

Nastavitev, ki je pomembnejša od izbire modela

To je akcijski kos. Daljši kosi zagotavljajo bolj gladko gibanje in manj kumulativnih napak, vendar je politika zavezana, medtem ko se blok izvaja, zato se pozno odziva na vse, kar se premika: samozavestna na statični kocki, brezupna na premikajoči se. Če preseže cilj, skrajšanje izvedenega dela premaga ponovno učenje in je brezplačno. Spoj, ki se ustavi prekmalu, je drugačen problem; glej .

  • ACT: ACTConfig privzeto uporablja chunk_size 100 in n_action_steps 100. Časovno združevanje je izklopljeno in zahteva n_action_steps 1.
  • GR00T N1.7: notranji horizont se je povečal iz 16 na 40, vendar LeRobotov primer SO-101 še vedno izvaja --policy.chunk_size=16 --policy.n_action_steps=16. Zastavica za izvedbo je bila preimenovana v --execution-horizon.
  • Pi0.5: 50-korakovni kos, od katerega LeRobotov recept LIBERO izvede 10 preko --policy.n_action_steps=10; z --policy.pretrained_path se vrne na 50, če izpustite zastavico.
  • SmolVLA: 50-akcijski kosi, oba gumba izpostavljena.

Kako pregledati vseh pet v enem popoldnevu

Najcenejši odgovor ni več branja. Porabite približno 15 USD in pustite, da vam roka pove: posnemite enkrat, najprej trenirajte poceni model, nato pa stopnjujte, ko se podatki izkažejo za zanesljive. Struktura premaga količino, kar je bistvo in .

  1. 1
    Posnemite 50 epizod enkrat

    Petdeset epizod pripravi teren za GR00T, Pi0.5 in ACT, ter 30 za SmolVLA. Ponovite vsako variacijo, namesto da se razpršite: 50 epizod na 5 pozicijah kocke, kjer 25 ni bilo treniranih. Glejte posnemite svoj prvi nabor podatkov.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Najprej trenirajte ACT, ker vam ne more lagati

    Brez predhodno treniranih uteži, zato če nalogo sploh opravi, vaš nabor podatkov vsebuje nalogo. Če ACT ne napreduje, popravite podatke. 1 do 3 USD, 2 do 5 ur na 24 GB kartici.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Zaženite SmolVLA na istem naboru podatkov, nespremenjenem

    Isti podatki, ista roka, 450 M parametrov namesto 80 M, plus jezikovno pogojevanje. LeRobot ocenjuje 20K korakov na približno 4 ure na enem A100. To vam pove, ali predhodno treniranje prinaša kakršne koli koristi.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Pretvorite na v2.1, preden se lotite GR00T-a

    GR00T bere različico formata LeRobot v2 plus dodatno datoteko meta/modality.json, ki preslikuje, kako se združeni nizi stanj in dejanj razdelijo v poimenovana polja. Nabor podatkov v3.0 povzroči sesutje nalagalnika, ker v3.0 pakira veliko epizod v skupne datoteke, medtem ko je v2 pisal eno na epizodo. Isaac-GR00T dobavlja pomočnika za znižanje različice kot scripts/lerobot_conversion/convert_v3_to_v2.py; stran za zavrnitev v3 je hitra pot.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Uporabite GR00T N1.7 le, če prvi dve možnosti nista bili dovolj učinkoviti

    Prek NVIDIA-jevega CLI, prikazanega tukaj, ali LeRobotovega tipa politike groot. NVIDIA priporoča 40 GB ali več VRAM-a za fino uglasitev, 16 GB za sklepanje. Ob napaki OOM si oglejte stran OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Dva načina za izvedbo tega presejalnega pregleda

Tri okolja, ker se orodja ne ujemajo. LeRobot na glavni veji je 0.6.2 in potrebuje Python 3.12 ali novejši; Isaac-GR00T in openpi sta ločena repozitorija, upravljana z uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T uporablja torchcodec 0.8.0 kot edini video zaledje, ki potrebuje FFmpeg 4 do 7. FFmpeg 8 ni podprt, AV1 ni zagotovljen.
  • openpi pomnilniške zahteve: sklepanje nad 8 GB, LoRA nad 22.5 GB, popolna fina uglasitev nad 70 GB. Slednje je razlog, zakaj je Pi0.5 naloga za A100.
  • Najemite GPU sami, ga nato uničite, ročno uskladite tri nize poti do kontrolnih točk.

Temeljni model ali od začetka

Prava dilema ni, kateri model 3 B izbrati. Gre za to, ali sploh uporabiti predhodno usposobljen VLA, glede na to, da se je ACT naučil šestih resničnih bimanualnih nalog iz približno desetih minut demonstracij za vsako, z 80 M parametri in nič predhodno usposobljenega.

Fino uglaševanje predhodno usposobljenega VLA namesto usposabljanja ACT od začetka
Kaj pridobite
  • Jezikovno pogojevanje. ACT ga nima; ena kontrolna točka ACT opravi eno nalogo.
  • Boljše pri objektih, ki niso prisotni v vaših demonstracijah: na SO-101, 50% proti ACT-jevim 40% izven distribucije.
  • Večopravilnost sploh: SmolVLA doseže 78,3% pri treh nalogah SO-100 z eno kontrolno točko; ACT je bil zagnan samo za eno nalogo.
Kaj vas stane
  • 7,6- do 24-kratna zakasnitev: 152 do 485 ms na korak dejanja v primerjavi z ACT-jevimi 20 ms.
  • 4 do 12 USD na zagon namesto 1 do 3, in raven A100 namesto katere koli 24 GB kartice.
  • Izpostavljenost licencam, plus način odpovedi z omejenim dostopom do repozitorija, ki ne obstaja pri razvoju od začetka.
  • Predhodno usposobljene uteži lahko prikrijejo slab nabor podatkov. Fino uglaševanje, ki delno deluje na pokvarjenih podatkih, stane teden dni, preden si ogledate podatke.

Primer reprodukcije starega zagona

Zasledovanje kontrolne točke iz leta 2025 določa izbiro modela za vas in problem spremeni v pripenjanje različice: trenutni LeRobot zavrača N1.5, zato pripnete lerobot==0.5.1. Brez polja za seme in s 5 do 6 odstotki variance med zagoni, je reprodukcija po zasnovi približna. in imata platformno stran.

Stran za primerjavo AY-Robots GR00T N1.7 proti Pi0.5, ki prikazuje število parametrov, zahteve za GPU, latenco sklepanja, format podatkovnega nabora in minimalno število epizod drug ob drugem.
Primerjava na /compare/groot-n1-7-vs-pi0-5. Dva 3 B modela se na specifikacijskem listu zdita zamenljiva, vendar nista: eden zahteva LeRobot v2.1, drugi v3.0.

Zmanjšalo se je na dva? ACT proti GR00T N1.7 in GR00T N1.7 proti SmolVLA. Neobdelane vrstice so v vnosih arene: GR00T N1.7, Pi0.5, SmolVLA in ACT.

Kje vam ta platforma ne pomaga

  • Ne more pospešiti oddaljenega sklepanja. Zanka od 20 do 485 ms pripada modelu; internetni povratni časi se ji prištejejo.
  • Ne more natančno uglasiti GR00T ali Pi0.5 na vaši strojni opremi. Oba sta tukaj samo v oblaku; samo SmolVLA in ACT delujeta lokalno.
  • Ne more popraviti podatkovnega nabora. Izguba pada, vendar politika ne dela nič je problem s podatki, politika, ki deluje samo v eni nastavitvi je problem pokritosti.
  • Ne more zagotoviti ponovljivosti izvajanj GR00T: nadrejena konfiguracija nima polja za seme.

85 modelov, 332 rezultatov meritev, vsaka številka povezana z virom

Razvrstljiva različica tabel na tej strani: 85 modelov vida, jezika in akcije, 332 rezultatov meritev, vsak povezan z izvirnim člankom ali kartico modela.

Odpri areno

Izbira in nadaljevanje

Ena privzeta možnost: posnemite 50 epizod, trenirajte ACT za 1 do 3 USD, da dokažete nabor podatkov, nato SmolVLA na istih podatkih. Skupaj pod 6 USD, in odgovorita na pomembno vprašanje: ali predhodno učenje tukaj pomaga, ali je ozko grlo v podatkih. Stopnjujte na GR00T N1.7 za večstopenjske naloge z bogatim stikom, na Pi0.5, ko se scena spremeni.

Predstavitev platforme: trenirajte svojo prvo politiko, nato zaženite svojo prvo politiko. Dokumentacija za usposabljanje in dokumentacija za nabore podatkov pokrivata obliko in format; stran SO-100 in celoten vodnik za SO-100 pokrivata izdelavo in kalibracijo. Ozadje: pregled VLA in članek o ujemanju toka Pi0. Tisto, kar bo izboljšalo vašo stopnjo uspešnosti, je vodnik za kakovost podatkov.

Katero politiko VLA naj najprej treniram na SO-100?

ACT, nato SmolVLA. ACT se trenira od začetka, zato ne more prikriti slabega nabora podatkov, in zagon stane 1 do 3 USD na 24 GB kartici. Če ACT sploh opravi nalogo, potem 4 do 12 USD za zagon GR00T N1.7 ali Pi0.5 ni zapravljenih.

Je GR00T N1.7 dejansko boljši od Pi0.5?

Na LIBERO so znotraj šuma: 97.0% v štirih sklopih za GR00T N1.7, 96.85% za Pi0.5 pri 30k korakih v openpi, 97.5% za LeRobot port, vse iz različnih testnih okolij. Prave razlike so 152 ms na korak dejanja proti 485 ms, nabori podatkov v2.1 proti v3.0, in natančnost merilnikov proti posploševanju v odprtem svetu.

Ali lahko katero od teh fino uglasim na eni sami RTX 4090?

SmolVLA in ACT, da; oba sta navedena za RTX 4090 ali katero koli 24 GB kartico in se izvajata lokalno. GR00T N1.7, N1.5 in Pi0.5 potrebujejo A100 ali H100 80 GB in so tukaj samo v oblaku. NVIDIA priporoča 40 GB ali več za fino uglaševanje GR00T; spodnja meja openpi je nad 70 GB za popolno fino uglaševanje Pi0.5, 22.5 GB za LoRA.

Katere od teh petih lahko uporabljam komercialno?

Teže GR00T N1.7 so pod licenčno pogodbo NVIDIA Open Model License Agreement, ki po navedbah kartice pokriva komercialno uporabo. Teže N1.5 so nekomercialne. Koda SmolVLA je Apache 2.0 v LeRobot, vendar kartica lerobot/smolvla_base nima polja za licenco, zato teže niso navedene. ACT nima osnovnih tež za licenciranje. Pi0.5 je dvoumen: dokumentacija LeRobot navaja Apache 2.0, njeni metapodatki kartice pa kažejo licenco: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started