
GR00T N1.7, Pi0.5, SmolVLA, ACT vai GR00T N1.5? Päätöstaulukko, joka on sovitettu todellisiin tilanteisiin, sisältäen julkaistut vertailuarvot, viiveen, ajokohtaiset kustannukset ja lisenssit kunkin valinnan takana.
Viisi toimintamallia on koulutettavissa SO-100-luokan varteen tänään. Ne eroavat toisistaan 24-kertaisesti päättelyn viiveessä, 37-kertaisesti parametrien määrässä ja 12-kertaisesti ajon kustannuksissa, sekä siinä, saako tuloksen toimittaa. Viisi mallikorttia ei ratkaise sitä: yksikään ei vastaa kysymykseesi, minkä niistä ajan ensin?
Jokainen alla oleva luku on luettu papereista, repoista ja korteista elokuussa 2026. Alustan luvut tulevat osoitteesta AY-Robotsin toimintamalliluettelosta; jos nämä kaksi ovat ristiriidassa, molemmat näytetään.
Lyhyt versio
- •Kouluta ACT ensin, jos epäilet datajoukkoasi: 1–3 USD per ajo, ei esikoulutettua peittämään huonoa dataa.
- •GR00T N1.7 ja Pi0.5 ovat puolen pisteen sisällä LIBEROssa, 97.0 vastaan 96.85–97.5. Tämä ei ole syy valita kumpaakaan.
- •Pi0.5 on yleistettävyyden valinta, ei tarkkuuden, ja hitain 485 ms:lla.
- •SmolVLA, 450 M parametrilla, on ainoa VLA tässä, joka hienosäätyy yhdellä 24 GB kortilla.
- •ACT 20 ms:lla on ainoa vaihtoehto nopeaan reaktiiviseen liikkeeseen. Lisenssit päättävät loput.
Päätöstaulukko
| Tilanteesi | Kouluta tämä | Miksi |
|---|---|---|
| Dataset quality unproven | ACT | Mikään esikoulutettu ei peitä rikkinäistä datajoukkoa, ja epäonnistuminen maksaa 1–3 USD. |
| Contact-rich, multi-step, language-conditioned | GR00T N1.7 | 97,0 % neljässä LIBERO-sviitissä, sekä suhteellinen loppukäsittelylaitteen toimintatila. |
| Fast reactive motion, inference at the servos | ACT | 20 ms. Seuraavaksi nopein on 7,6 kertaa hitaampi. |
| New objects, new scene, open-world | Pi0.5 | Rakennettu jakautuman ulkopuoliseen käyttäytymiseen, jopa 104 sijainnissa. |
| One 24 GB card, still want language | SmolVLA | 450 M parametria, 30 jakson vähimmäismäärä, toimii paikallisesti. |
| Reproducing a run recorded in 2025 | GR00T N1.5 | Vain jos on pakko: LeRobot hylkää sen nyt, painot ovat ei-kaupallisia. |
| This will ship as a product | N1.7, SmolVLA or ACT | N1.5 on ei-kaupallinen, Pi0.5 sisältää Gemman ehdot, SmolVLAn kortissa ei mainita mitään. |
Viisi ehdokasta
Kaikki viisi ovat käytäntöjä: kamerakehykset, nivelten asennot ja, neljälle niistä, kieliohje, joka on yhdistetty tulevien nivelten tavoitteiden osaan. Niitä erottaa se, kuinka paljon oli opittu ennen saapumistasi.
| Käytäntö | Parametrit | Viive | GPU-taso | Paikallinen? | Min. jaksot | Muoto | Kustannus |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIAn nykyinen visio-kieli-toimintamalli, noin 3 miljardia parametria, joista noin 40 miljoonaa koulutettu hienosäädön aikana. Repositorio listaa N1.6:n erot: runko toimitetusta Eagle-mallista Cosmos-Reason2-2B:hen Qwen3-VL:ssä, diffuusiokerrokset 32:sta 16:een, tila- ja toimintadimensiot 29:stä 132:een, toimintahorisontti 16:sta 40:een.
Pienessä varressa tärkeää on suhteellinen tarttujan toimintatila: N1.7 ennustaa eroja nykyisestä asennosta, mikä mahdollistaa 20 000 tunnin EgoScale-ihmisvideon siirtämisen robottikäytäntöön. Tekniset tiedot N1.7-sivulla, menettely N1.7 SO-100 -oppaassa.
Isaac-GR00T README julistaa N1.7:n yleisesti saatavilla olevaksi -julkaisuksi, jossa on täydelliset vertailuarvot ja tuki. Sen Hugging Face -kortti ei ole päivittynyt: Model Version -kentässä lukee edelleen GR00T N1.7 EA. Repositorio on uudempi dokumentti.
GR00T N1.5
Sama 3 B mittakaava, Eagle 2 -runkoverkko, SigLip2 ja T5, virtaussovitus-DiT-pää. Se on olemassa laajentaakseen jonka sinulla jo on. Kaksi asiaa tekee siitä huonon oletuksen: painot sisältävät NVIDIAn yksisuuntaisen ei-kaupallisen lisenssin, ja nykyiset LeRobot-julkaisut poistivat N1.5-tuen. Katso .
Pi0.5
Physical Intelligencen VLA, toimintatyyppi pi05. Artikkeli esittelee 2 B VLM:n, joka on alustettu PaliGemma-mallista ja johon on lisätty 300 M toiminta-asiantuntija, ohjaten robottia 50 Hz:n taajuudella; LeRobotin pi05-konfiguraatio oletuksena käyttää 50-askeleen palasta, yhden sekunnin ajan tällä nopeudella. Myyntivaltti on ennennäkemättömät paikat: noin 400 tuntia mobiilia manipulointia oikeissa kodeissa, ja skaalaustutkimus yli 3, 12, 22, 53, 82 ja 104 sijainnissa, missä 104 sijainnin malli vastasi itse testikodeissa koulutettua kontrollia.
Yksi rajoitus, joka on ilmoitettu lerobot/pi05_base kortilla: portti kantaa vain virtaukseen sopivan toimintapään. Alitehtävän ennustus, toiminnon tokenisointi ja vahvistusoppiminen (RL) eivät olleet julkaistu ylävirtaan, ja openpi sanoo saman omasta repositoriostaan. Pi0.5-sivu ja Pi0.5 SO-100 -opas sisältävät loput.
Pi0.5 tarvitsee portitetun google/paligemma-3b-pt-224 tokenisoijan (gated: manual, vaikka Google sanoo pyyntöjen käsiteltävän välittömästi). Hyväksymättä sitä ja ajamatta hf auth login -komentoa koulutusympäristössä, työ käynnistyy, lataa hetken, ja sitten kaatuu valtuutusvirheeseen, joka näyttää verkon vialta. nvidia/GR00T-N1.7-3B ei ole portitettu, mutta sen nvidia/Cosmos-Reason2-2B -runkoverkko on (gated: auto). Tyhjennä molemmat ennen jonoon asettamista; jos ajo jää jumiin, jumiutuneiden jonojen sivu luettelee tarkistettavat asiat.
SmolVLA
450 M parametria, noin 100 M toimintaekspertissä, SmolVLM-2:ssa VLM jäädytettynä ja vain sen ensimmäiset 16 kielimallikerrosta käytettynä. Esikoulutus oli yhteisön dataa: 481 datasettiä, 10.6 M kehystä, samoista halvoista käsivarsista, joita käytät. Ainoa VLA täällä, joka mahtuu yhdelle 24 GB kortille, ja ainoa 30 episodi lattia. Katso SmolVLA-sivu.
ACT
Ei perusmalli. ALOHAn Action Chunking Transformer on noin 80 miljoonan parametrin malli, joka on koulutettu alusta alkaen tehtäväkohtaisesti, 50 demonstraation perusteella 50 Hz:n taajuudella. Tutkimusraportti kuvaa kuusi todellista kahden käden tehtävää noin kymmenen minuutin demonstraatioista kutakin, 80–90 prosentin onnistumisella korostamissaan esimerkeissä. Sen idea, toimintojen pilkkominen, on jokaisessa tällä sivulla esitellyssä mallissa, ja sen ablaatio mittaa edelleen vaikutusta parhaiten: kahdessa simuloidussa tehtävässä, joissa ajallinen ensemblointi oli pois päältä, onnistumisprosentti nousee 1 prosentista k=1:llä 44 prosenttiin k=100:lla. ACT-sivu sisältää loput.
Mitä vertailuarvot todella kertovat
LIBERO on se vertailuarvo, josta kolme näistä viidestä raportoi: kieliohjatut tehtävät simuloidulla Franka Pandalla, jaettu neljään alla olevaan sarjaan, joissa kussakin on kymmenen tehtävää. NVIDIA suoritti 200 koetta sarjaa kohden.
| Malli | Tilallinen | Objekti | Tavoite | 10 (Pitkä) | Keskiarvo |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Jokainen luku on peräisin eri testivaljaista ja budjetista. GR00T suoritti 20K askelta globaalilla eräkoolla 640; openpi-luku on 30K tarkistuspiste; LeRobot-portti lisäsi 6K askelta LIBERO-perusmalliin. SmolVLA on edelleen epäyhteensopiva: sen julkaisu kouluttaa kyseisen rivin LIBEROlla tyhjästä, ilman VLA-esikoulutusta, kun taas kolme sen yläpuolella hienosäätävät esikoulutettuja tarkistuspisteitä. Käsittele 96.85–97.5 yhtenä klusterina, ja ero 87.3%:iin todellisena, mutta hankittuna 6.7-kertaisella parametrimäärällä.
SimplerEnv näyttää hajautuksen, mitä LIBERO ei tee. NVIDIA vertaa N1.7:ää N1.6:een, mikä on lähin julkinen asia sukupolvien väliseen eroon.
| SimplerEnv-sviitti | N1.6 keskiarvo | N1.7 keskiarvo | Paras heilahdus | Huonoin heilahdus |
|---|---|---|---|---|
| Bridge (WidowX), 7 tehtävää | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tehtävää | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | ei mitään, jokainen tehtävä parani |
Bridge-rivi on hyödyllinen: keskimäärin 5,7 pistettä voitettiin, kun put_eggplant_in_basket menetti 36 ja put_eggplant_in_sink putosi 33:sta 2:een. Uusi sukupolvi siirtää jakaumaa sen sijaan, että nostaisi sitä, joten jos tehtäväsi sijoittuu kohtaan, jossa N1.7 heikkeni, keskiarvo ei kerro mitään.

Viidestä vain SmolVLA-julkaisu raportoi SO-100-luokan varresta: 78,3 prosenttia SmolVLAlle ja 61,7 Pi0:lle kolmessa tehtävässä, molemmat monitehtäväisiä, verrattuna 48,3:een ACT:lle, joka on koulutettu yksitehtäväiseksi, mikä ei ole vertailukelpoista. Selkeä paritus on molemmat yksitehtäväisiä SO-101-poiminta- ja sijoitustehtävässä: 90 vastaan 70 jakaumassa, 50 vastaan 40 sen ulkopuolella. Vertaa ACT vs. SmolVLA ja Pi0.5 vs. SmolVLA, tai selaa areenaa.
Viive ja kustannukset ratkaisevat käyttöönoton
Päättelyn latenssi on rajoite, jonka ihmiset löytävät viimeisenä ja katuvat ensimmäisenä. Politiikka, joka on viisi pistettä parempi vertailuarvossa, mutta puoli sekuntia per toimintavaihe, näyttää huonommalta työpöydälläsi: kontaktidynamiikka ei odota.
Yksi huomautus: GR00T-luku on ristiriidassa NVIDIAn kortin kanssa, joka mittaa 4 kohinanpoistovaihetta ja yhden kameran 85,8 ms:ssa H100:lla eager-tilassa, 48,6 ms torch.compile-tilassa, 27,9 ms täydellä TensorRT:llä. Tässä mainittu 152 ms on koko pinon luku, joka sisältää palvelun yleiskustannukset ja useamman kuin yhden kameran, ei eteenpäinsyöttöä.
20–485 ms:n silmukka on mallin oma, ja julkisen internetin edestakaiset matkat lisäävät siihen. Etäpäättely soveltuu hitaaseen poiminta- ja sijoitustehtävään, ei nopeaan reaktiiviseen liikkeeseen. Jos tehtäväsi vaatii nopeutta, päättely sijaitsee servojen vieressä: ACT tai SmolVLA, paikallisesti. Aiheeseen liittyvää: politiikka jumiutuu kesken liikkeen.
Yksi tapa säästää aikaa mallia muuttamatta: SmolVLA-paperi mittaa synkronista suoritusta, jossa politiikka suorittaa lohkon ennen seuraavan ennustamista, verrattuna asynkroniseen, jossa ennustus ja suoritus menevät päällekkäin. Menestys on samanlainen, 78,3 verrattuna 73,3:een, mutta sama poiminta- ja sijoitustehtävä kestää 9,7 sekuntia 13,75:n sijaan, ja kiinteässä ikkunassa robotti suorittaa 19 sykliä 9:n sijaan.
Lisenssit, tarkistettu koska kukaan ei tarkista niitä
| Malli | Painojen lisenssi | Koodin lisenssi | Kaupallinen käyttö |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kortti sallii kaupallisen käytön | Apache 2.0 | kyllä |
| GR00T N1.5 | NVIDIA yksisuuntainen ei-kaupallinen lisenssi | Apache 2.0 | ei |
| Pi0.5 | pi05_base-kortin metatiedoissa lukee lisenssi: gemma | Apache 2.0 (openpi, LeRobot-dokumentaatio) | lue molemmat, ne ovat ristiriidassa |
| SmolVLA | ei lisenssikenttää smolvla_base-kortissa | Apache 2.0 (LeRobot) | koodi kyllä, painot ilmoittamatta |
| ACT | peruspainoja ei ole olemassa | Apache 2.0 (LeRobot) | kyllä |
Pi0.5-rivi vaatii huomiota. LeRobot pi05 -dokumentaatio ilmoittaa Apache 2.0:n olevan yhdenmukainen openpin kanssa, kun taas Hub-kortti mallille lerobot/pi05_base sisältää license: gemma. Molemmat ovat voimassa. GR00T N1.7:llä on lievennetty versio: Isaac-GR00T README mainitsee ohimennen, että N1.7 on täysin kaupallisesti lisensoitavissa Apache 2.0:n alla, kun taas sen oma lisenssiosio ja mallikortti asettavat vain koodin Apache 2.0:n alle ja painot NVIDIA Open Model License -lisenssin alle.
Oletusarvot, joita todella käytät
Jokainen kouluttajan lomake sisältää oletusarvon, eivätkä ne ole mielivaltaisia. ACT:n omat ovat LeRobotin: erä 8, lr 1e-5, 100000 koulutusaskeleet, lohkon koko 100, vastaa ACTConfigia ylävirrassa ja k=100 from the ACT paper. Yksi alla oleva sarake on ansa.
| Politiikka | Erä | LR | Maksimiaskeleet | Grad accum | Soveltuu? | Lisäsäätimet |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | kyllä | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | kyllä | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | ei (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | ei | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | ei | chunkSize, nActionSteps, seed, logFreq |
GR00T:n hienosäädön aloituspisteessä (launch_finetune.py, tyro CLI) ei ole siemenkenttää sen konfiguraation dataluokassa, joten ajot eivät ole bittitarkasti toistettavissa. Repo varoittaa myös 5–6 prosentin vaihtelusta ajojen välillä ei-determinististen kuvankäsittelyjen vuoksi, mikä on suurempi kuin useimmat verkossa kiistellyt vertailukohtien erot. LeRobotin oletussiementä on 1000. Grad-accum-sarake kuvaa lerobot 0.5.1:tä; ylävirran 0.6.2 paljastaa sen nimellä --accelerator.gradient_accumulation.steps.
Säädin, jolla on enemmän merkitystä kuin mallin valinnalla
Se on toimintalohko. Pidemmät lohkot tuottavat tasaisempaa liikettä ja vähemmän kumuloituvia virheitä, mutta toimintaperiaate on sitoutunut lohkon suorituksen ajan, joten se reagoi myöhään kaikkeen liikkuvaan: luottavainen staattisen kuution kanssa, toivoton vierivän kanssa. Jos se ylittää tavoitteen, suoritetun osan lyhentäminen on parempi kuin uudelleenkoulutus ja se on ilmaista. Liitos, joka pysähtyy liian aikaisin, on eri ongelma; katso .
- ACT: ACTConfigin oletusarvot ovat
chunk_size 100jan_action_steps 100. Ajallinen yhdistäminen on pois päältä ja vaatiin_action_steps 1. - GR00T N1.7: sisäinen horisontti kasvoi 16:sta 40:een, mutta LeRobotin SO-101-esimerkki käyttää edelleen
--policy.chunk_size=16 --policy.n_action_steps=16. Rollout-lippu nimettiin uudelleen--execution-horizon. - Pi0.5: 50-askeleen lohko, josta LeRobotin LIBERO-resepti suorittaa 10 komennolla
--policy.n_action_steps=10;--policy.pretrained_path-lipun kanssa se palaa 50:een, jos jätät lipun pois. - SmolVLA: 50-toiminnon lohkot, molemmat säätimet esillä.
Miten seuloa kaikki viisi yhden iltapäivän aikana
Halvin vastaus ei ole lisälukeminen. Käytä noin 15 USD ja anna robotin kertoa sinulle: tallenna kerran, kouluta ensin halpa malli, eskaloitu sitten, kun se on osoittanut datan olevan luotettavaa. Rakenne voittaa volyymin, mikä on ja ydin.
- 1Tallenna 50 jaksoa kerran
Viisikymmentä raivaa tilaa GR00T:lle, Pi0.5:lle ja ACT:lle, sekä SmolVLA:n 30:lle. Toista jokaista variaatiota sen sijaan, että levittäisit ohuesti: 50 jaksoa viidessä kuution asennossa koulutettuna, kun 25 ei ollut. Katso tallenna ensimmäinen datasettisi.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Kouluta ACT ensin, koska se ei voi valehdella sinulle
Ei esikoulutettuja painoja, joten jos se ylipäätään suorittaa tehtävän, datasettisi sisältää tehtävän. Jos ACT tasaantuu, korjaa data. 1–3 USD, 2–5 tuntia 24 GB:n kortilla.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Aja SmolVLA samalla datasettillä, muuttumattomana
Sama data, sama varsi, 450 miljoonaa parametria 80 miljoonan sijaan, plus kielen ehdollistaminen. LeRobot suorittaa 20K askeleen ajon noin 4 tunnissa yhdellä A100:lla. Tämä kertoo sinulle, tuottaako esikoulutus mitään hyötyä.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Muunna v2.1:een ennen kuin kosket GR00T:hen
GR00T lukee LeRobot v2 -muodon variantin sekä ylimääräisen
meta/modality.json-tiedoston, joka kuvaa, miten yhdistetyt tila- ja toimintataulukot jakautuvat nimettyihin kenttiin. V3.0-datasetti kaataa kyseisen lataajan, koska v3.0 pakkaa monta jaksoa jaettuihin tiedostoihin, kun v2 kirjoitti yhden jakson per tiedosto. Isaac-GR00T toimittaa alaspäin muuntamisen apuohjelman nimelläscripts/lerobot_conversion/convert_v3_to_v2.py; v3-hylkäyssivu on nopein reitti.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Siirry GR00T N1.7:ään vain, jos kaksi ensimmäistä jättivät jotain pöydälle
NVIDIAn CLI:n kautta, kuten tässä näytetään, tai LeRobotin
groot-käytäntötyypin kautta. NVIDIA suosittelee 40 GB tai enemmän VRAM-muistia hienosäätöön, 16 GB päättelyyn. Jos muisti loppuu (OOM), katso OOM-sivu.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Kaksi tapaa suorittaa seulontakierros
Kolme ympäristöä, koska työkaluketjut eivät toimi rinnakkain. LeRobot main-haarassa on 0.6.2 ja vaatii Python 3.12:n tai uudemman; Isaac-GR00T ja openpi ovat erillisiä uv-hallittuja repositorioita.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T kiinnittää
torchcodec0.8.0:n ainoaksi videotaustajärjestelmäkseen, vaatien FFmpeg 4–7:n. FFmpeg 8 ei ole tuettu, AV1:tä ei taata. - openpi:n muistivaatimukset: päättely yli 8 GB, LoRA yli 22.5 GB, täysi hienosäätö yli 70 GB. Tämä viimeinen on syy, miksi Pi0.5 on A100-työ.
- Vuokraa GPU itse, tuhoa se jälkeenpäin, sovita kolme tarkistuspisteen polkua käsin.
Samana viisi mallia, yksi lomake. Valitse malli, datasetti ja hyperparametrit; taustajärjestelmä vuokraa GPU:n vaaditun VRAM-muistin mukaan, ajaa kouluttajan ja kirjoittaa tarkistuspisteet objektitallennustilaan.
- Koulutusmatriisi on viisi mallia neljällä varrella, jokainen solu opas: SmolVLA SO-100:lla, ACT SO-101:llä.
- Päättelypodit varataan automaattisesti
/api/inference/pod-rajapinnan kautta käyttäen joutokäynnin valvontaa, joten unohdettu pod ei laskuta hiljaa. - Perustarkistuspisteet ovat myyjien omia:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT:lla ei ole yhtään. - Samana toiminnot CLI:stä ja tekoälyagenteilta MCP-palvelimen kautta.
- Ei laitteistoa? Live-varsi striimaa fyysistä SO-100:aa ilman rekisteröitymistä; kokeilusivu näyttää sisäänpääsyreitit.
Perusmalli vai alusta alkaen
Todellinen valinta ei ole, mikä 3 B -malli valita. Se on pikemminkin se, kannattaako esikoulutettua VLA:ta ylipäätään käyttää, ottaen huomioon, että ACT oppi kuusi todellista kahden käden tehtävää noin kymmenen minuutin demonstraatioista kutakin kohden, 80 miljoonalla parametrilla ja eikä mitään esikoulutettua.
- Kielikonditionointi. ACT:lla ei ole sitä; yksi ACT-tarkistuspiste suorittaa yhden tehtävän.
- Parempi objekteilla, jotka puuttuvat demonstraatioistasi: SO-101:ssä 50 % verrattuna ACT:n 40 %:iin jakauman ulkopuolella.
- Ylipäätään monitehtäväisyys: SmolVLA saavuttaa 78,3 % kolmessa SO-100-tehtävässä yhdellä tarkistuspisteellä; ACT ajettiin vain yksitehtävänä.
- 7,6-24-kertainen viive: 152–485 ms per toimintavaihe verrattuna ACT:n 20 ms:iin.
- 4–12 USD per ajo 1–3 USD:n sijaan, ja A100-taso minkä tahansa 24 GB:n kortin sijaan.
- Lisenssiriskit sekä suljetun repositorion vikatila, jota ei ole olemassa alusta alkaen.
- Esikoulutetut painot voivat peittää huonon aineiston. Hienosäätö, joka toimii puoliksi rikkinäisellä datalla, maksaa viikon ennen kuin tarkastelet dataa.
Vanhan ajon toistamisen tapaus
Vuoden 2025 tarkistuspisteen tavoittelu tekee mallivalinnan puolestasi ja muuttaa ongelman version lukitsemiseksi: nykyinen LeRobot hylkää N1.5:n, joten lukitset lerobot==0.5.1. Ilman siemenkenttää ja 5–6 prosentin vaihtelua ajojen välillä, toisto on rakenteeltaan likimääräinen. N1.5 SO-100 -opas ja N1.5-käytäntösivu sisältävät alustan puolen.

Kahteenkö? ACT vastaan GR00T N1.7 ja GR00T N1.7 vastaan SmolVLA. Raakarivit löytyvät areenamerkinnöistä: GR00T N1.7, Pi0.5, SmolVLA ja ACT.
Missä tämä alusta ei auta sinua
- Se ei voi nopeuttaa etäpäättelyä. 20–485 ms:n silmukka kuuluu mallille; internetin edestakaiset matkat lisäävät siihen aikaa.
- Se ei voi hienosäätää GR00T:tä tai Pi0.5:tä omalla laitteistollasi. Molemmat ovat täällä vain pilvipohjaisia; vain SmolVLA ja ACT toimivat paikallisesti.
- Se ei voi korjata datasettiä. Häviö laskee, mutta toimintaperiaate ei tee mitään on dataongelma, toimintaperiaate, joka toimii vain yhdessä asetelmassa on kattavuusongelma.
- Se ei voi tehdä GR00T-ajoista toistettavia: ylävirran konfiguraatiossa ei ole siemenkenttää.
85 mallia, 332 vertailutulosta, jokainen luku linkitetty lähteeseensä
Tämän sivun taulukoiden lajiteltava versio: 85 näkö-kieli-toimintamallia, 332 vertailutulosta, joista jokainen on linkitetty takaisin omaan julkaisuunsa tai mallikorttiinsa.
Avaa areenaYhden valitseminen ja eteenpäin siirtyminen
Yksi oletus: tallenna 50 jaksoa, kouluta ACT 1–3 USD:lla todistaaksesi aineiston, sitten SmolVLA samalla datalla. Yhteensä alle 6 USD, ja ne vastaavat tärkeään kysymykseen: auttaako esikoulutus tässä, vai onko pullonkaula data. Skaalaa GR00T N1.7:ään kosketusrikkaisiin monivaiheisiin tehtäviin, Pi0.5:een kun kohtaus muuttuu.
Alustan läpikäynti: kouluta ensimmäinen toimintamallisi, sitten suorita ensimmäinen toimintamallisi. koulutusdokumentaatio ja aineistodokumentaatio kattavat muodon ja formaatin; SO-100-sivu ja täydellinen SO-100-opas kattavat rakentamisen ja kalibroinnin. Taustaa: VLA-yleiskatsaus ja Pi0-virtaussovitusartikkeli. Se, mikä parantaa onnistumisprosenttiasi, on datan laatuopas.
Minkä VLA-politiikan minun tulisi kouluttaa ensin SO-100:lla?▾
ACT, sitten SmolVLA. ACT kouluttaa alusta alkaen, joten se ei voi peittää huonoa datajoukkoa, ja ajo maksaa 1–3 USD 24 GB:n kortilla. Jos ACT suorittaa tehtävän ylipäätään, 4–12 USD GR00T N1.7- tai Pi0.5-ajosta ei mene hukkaan.
Onko GR00T N1.7 todella parempi kuin Pi0.5?▾
LIBEROssa ne ovat kohinan sisällä: 97.0% neljässä sviitissä GR00T N1.7:lle, 96.85% Pi0.5:lle 30k askeleella openpissä, 97.5% LeRobot-porttaukselle, kaikki eri valjaista. Todelliset erot ovat 152 ms per toimintoaskel verrattuna 485 ms:iin, v2.1 datajoukot verrattuna v3.0:aan, ja vertailutarkkuus verrattuna avoimen maailman yleistykseen.
Voinko hienosäätää näistä mitään yhdellä RTX 4090:llä?▾
SmolVLA ja ACT, kyllä; molemmat on listattu RTX 4090:lle tai mille tahansa 24 GB:n kortille ja ne ajetaan paikallisesti. GR00T N1.7, N1.5 ja Pi0.5 tarvitsevat A100:n tai H100 80 GB:n ja ovat täällä vain pilvipohjaisia. NVIDIA suosittelee 40 GB tai enemmän GR00T-hienosäätöön; openpin alaraja on yli 70 GB täydelle Pi0.5-hienosäädölle, 22.5 GB LoRA:lle.
Minkä näistä viidestä voin käyttää kaupallisesti?▾
GR00T N1.7:n painot ovat NVIDIA Open Model License Agreement -lisenssin alaisia, joka kortin mukaan kattaa kaupallisen käytön. N1.5:n painot ovat ei-kaupallisia. SmolVLA:n koodi on Apache 2.0 LeRobotissa, mutta lerobot/smolvla_base-kortissa ei ole lisenssikenttää, joten painot ovat ilmoittamatta. ACT:lla ei ole peruspainoja lisensoitavaksi. Pi0.5 on epäselvä: LeRobotin dokumentaatio sanoo Apache 2.0, sen kortin metatiedot lukevat license: gemma.
Sources
- NVIDIA Isaac-GR00T -repositorio: GA-tila, N1.6:n ja N1.7:n muutokset, laitteistovaatimukset, torchcodec- ja FFmpeg-rajoitukset, launch_finetune.py, ajosta-ajoon -vaihtelu
- nvidia/GR00T-N1.7-3B-mallikortti: Cosmos-Reason2-2B-runkoverkko, 3 B parametria, päättelyn ajoitustaulukko, NVIDIA Open Model License, Model Version -kenttä
- nvidia/GR00T-N1.5-3B-mallikortti: Eagle 2 -viite, SigLip2 ja T5, virtaussovitus DiT, yksisuuntainen ei-kaupallinen lisenssi
- Isaac-GR00T LIBERO -esimerkki: sviittikohtaiset onnistumisprosentit 20K askeleella ja eräkoolla 640, 200 koetta per sviitti
- Isaac-GR00T SimplerEnv -esimerkki: tehtäväkohtaiset Bridge- ja Fractal-onnistumisprosentit, GR00T N1.6 verrattuna N1.7:ään
- pi0.5: näkö-, kieli- ja toimintamalli avoimen maailman yleistyksellä (2 B VLM plus 300 M toiminta-asiantuntija, 50 Hz ohjaus, noin 400 tuntia mobiilimanipulaatiota, skaalaustutkimus 3–104 sijainnin yli)
- openpi-repositorio: GPU-muistin alarajat, vain virtaussovituspään laajuus ja Pi0.5 LIBERO -tulokset examples/libero-kansiossa
- lerobot/pi05_base-mallikortti: LeRobot-porttauksen laajuus, license: gemma-metatiedot, lerobot-train-käyttö
- LeRobot pi0.5 -dokumentaatio: portitettu PaliGemma-tokenisoija, LIBERO-reproduktiivisuustaulukko, n_action_steps-varalaskuri, Apache 2.0 -lausunto
- SmolVLA: näkö-, kieli- ja toimintamalli edulliseen ja tehokkaaseen robotiikkaan (450 M parametria, LIBERO- ja Meta-World-taulukot, SO-100- ja SO-101-tulokset, asynkroninen päättely)
- LeRobot SmolVLA -dokumentaatio: 50 jaksoa viidessä eri asennossa verrattuna 25:een, 20k askelta noin 4 tunnissa A100:lla
- Hienojakoisen kahden käden manipuloinnin oppiminen edullisella laitteistolla (ACT ja ALOHA): 6 tehtävää 80-90 prosentin tarkkuudella, palakoon ablaatio k=1:stä k=100:aan
- LeRobot 0.6.2: ACTConfig- ja SmolVLAConfig-oletukset, oletussiemen 1000, --accelerator.gradient_accumulation.steps, Python 3.12 -vaatimus, Apache 2.0
- LeRobot GR00T -dokumentaatio: politiikkatyyppi groot, N1.5-tuki poistettu, pin lerobot==0.5.1, SO-101-palakoon esimerkki
- lerobot/smolvla_base-mallikortti: SmolVLA-perustarkistuspiste, jota käytetään --policy.path-parametrilla, ja sen kortin metatiedot, joissa ei ole lisenssikenttää
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started