
GR00T N1.7, Pi0.5, SmolVLA, ACT või GR00T N1.5? Otsustustabel, mis on kohandatud reaalsete olukordadega, koos avaldatud võrdlusandmete, latentsuse, käituskulude ja litsentsidega iga valiku taga.
Täna on SO-100 klassi robotkäel treenitavad viis poliitikat. Need erinevad 24-kordselt järeldamise latentsusajas, 37-kordselt parameetrite arvus ja 12-kordselt käituse maksumuses, samuti selles, kas tulemust tohib tarnida. Viis mudelikaarti seda ei lahenda: ükski neist ei vasta teie küsimusele, millist neist peaksin esimesena käitama?
Kõik alltoodud numbrid on loetud paberitest, repositooriumitest ja kaartidelt 2026. aasta augustis. Platvormi numbrid pärinevad AY-Robots poliitikate kataloog; kus need kaks ei kattu, on näidatud mõlemad.
Lühiversioon
- •Treenige ACT-d esimesena, kui kahtlete oma andmestikus: 1 kuni 3 USD käituse kohta, puudub eelnevalt treenitud mudel halbade andmete varjamiseks.
- •GR00T N1.7 ja Pi0.5 jäävad LIBERO-l poole punkti sisse, 97.0 versus 96.85 kuni 97.5. See ei ole põhjus kummagi valimiseks.
- •Pi0.5 on üldistamise, mitte täpsuse valik, ja aeglaseim 485 ms juures.
- •SmolVLA, 450 M parameetriga, on siin ainus VLA, mis peenhäälestub ühel 24 GB kaardil.
- •ACT 20 ms juures on ainus valik kiireks reaktiivseks liikumiseks. Litsentsid otsustavad ülejäänu.
Otsustustabel
| Sinu olukord | Treeni seda | Miks |
|---|---|---|
| Andmestiku kvaliteet tõestamata | ACT | Miski eelnevalt treenitu ei varja rikkis andmestikku ja ebaõnnestumine maksab 1 kuni 3 USD. |
| Kontaktirikas, mitmeastmeline, keeleliselt tingitud | GR00T N1.7 | 97,0% nelja LIBERO sviidi ulatuses, pluss suhteline lõppefektori tegevusruum. |
| Kiire reaktiivne liikumine, järeldamine servodel | ACT | 20 ms. Järgmine kiireim on 7,6 korda aeglasem. |
| Uued objektid, uus stseen, avatud maailm | Pi0.5 | Ehitatud jaotusvälise käitumise jaoks, kuni 104 asukohas. |
| Üks 24 GB kaart, ikka tahad keelt | SmolVLA | 450 M parameetrit, 30 episoodi piir, töötab lokaalselt. |
| 2025. aastal salvestatud käivituse reprodutseerimine | GR00T N1.5 | Ainult kui pead: LeRobot lükkab selle nüüd tagasi, kaalud on mitteärilised. |
| See tarnitakse tootena | N1.7, SmolVLA or ACT | N1.5 on mitteäriline, Pi0.5-l on Gemma tingimused, SmolVLA kaardil pole ühtegi märgitud. |
Viis kandidaati
Kõik viis on poliitikad: kaamera kaadrid, liigeste positsioonid ja, nelja puhul keeleline juhis, mis on kaardistatud tulevaste liigeste sihtmärkide plokiks. Mis neid eristab, on see, kui palju oli õpitud enne sinu saabumist.
| Poliitika | Parameetrid | Latentsus | GPU tase | Lokaalne? | Min episoodid | Formaat | Maksumus |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA praegune nägemis-keele-tegevuse mudel, umbes 3 miljardit parameetrit, millest ligikaudu 40 miljonit on treenitud peenhäälestuse käigus. Reposatoorium loetleb N1.6-st pärit erinevused: selgroog on muudetud tarnitud Eagle mudelist Cosmos-Reason2-2B-ks Qwen3-VL-il, difusioonikihid 32-lt 16-le, oleku- ja tegevusdimensioonid 29-lt 132-le, tegevushorisont 16-lt 40-le.
Väikese roboti käe puhul on oluline suhteline otsaefektori tegevusruum: N1.7 ennustab erinevusi praegusest asendist, mis võimaldab 20K tundi EgoScale inimvideot üle kanda roboti poliitikasse. Spetsifikatsioon on N1.7 lehel, protseduur on kirjeldatud N1.7 SO-100 juhendis.
Isaac-GR00T README kuulutab N1.7 a üldiselt kättesaadavaks väljalaskeks, täielike võrdlusuuringute ja toega. Selle Hugging Face'i kaart ei ole veel ajakohastatud: the Model Version väli näitab endiselt GR00T N1.7 EA. Reposatoorium on uuem dokument.
GR00T N1.5
Sama 3 B skaala, Eagle 2 selgroog, SigLip2 ja T5, voolu sobitamise DiT pea. See on olemas selleks, et laiendada kontrollpunkti mida teil juba on. Kaks asja muudavad selle kehvaks vaikeseadeks: kaalud kannavad NVIDIA ühesuunalist mitteärilist litsentsi ja praegused LeRoboti väljalasked eemaldasid N1.5 toe. Vaata N1.7 versus N1.5.
Pi0.5
Physical Intelligence'i voolu sobitamise VLA, poliitika tüüp pi05. Artikkel kirjeldab 2 B VLM-i, mis on initsialiseeritud PaliGemma-st pluss 300 M tegevusekspert, juhtides robotit 50 Hz juures; LeRoboti pi05 konfiguratsioon vaikimisi kasutab 50-sammulist tükki, üks sekund selle kiirusega. Müügiargument on nägemata kohad: umbes 400 tundi mobiilset manipulatsiooni reaalsetes kodudes ja skaleerimisuuring 3, 12, 22, 53, 82 ja 104 asukoha kohta, kus 104 asukohaga mudel vastas kontrollile, mis oli treenitud testkodudes endis.
Üks piirang, mis on märgitud lerobot/pi05_base kaardil: port edastab ainult voo sobitamise action head. Alamülesannete ennustamine, tegevuste tokeniseerimine ja RL-i ei avaldatud ülesvoolu ning openpi ütleb sama oma hoidla kohta. Pi0.5 leht ja Pi0.5 SO-100 juhend sisaldavad ülejäänut.
Pi0.5 vajab piiratud juurdepääsuga google/paligemma-3b-pt-224 tokeniseerijat (gated: manual, kuigi Google ütleb, et taotlusi töödeldakse koheselt). Ilma seda aktsepteerimata ja hf auth login käivitamata treeningkeskkonnas, töö käivitub, laeb mõnda aega alla, seejärel sureb autoriseerimisvea tõttu, mis näib võrguveana. nvidia/GR00T-N1.7-3B ei ole piiratud juurdepääsuga, kuid selle nvidia/Cosmos-Reason2-2B selgroog on (gated: auto). Tühjendage mõlemad enne järjekorda panemist; kui käivitus jääb jõude, kinni jäänud järjekorra leht loetleb, mida kontrollida.
SmolVLA
450 miljonit parameetrit, umbes 100 miljonit tegevuseksperdis, SmolVLM-2 peal, kus VLM on külmutatud ja kasutatakse ainult selle esimest 16 keelemudeli kihti. Eeltreeninguks kasutati kogukonna andmeid: 481 andmekogumit, 10,6 miljonit kaadrit, samadelt odavatelt robotkäppadelt, mida te kasutate. Ainus VLA siin, mis mahub ühele 24 GB kaardile, ja ainus 30 episoodi piir. Vaata SmolVLA lehte.
ACT
Mitte alusmudel. ALOHA Action Chunking Transformer on umbes 80 miljoni parameetriga mudel, mis on treenitud nullist iga ülesande jaoks, 50 demonstratsiooni põhjal sagedusega 50 Hz. Artikkel kirjeldab kuut reaalset kahekäelist ülesannet, mis põhinevad umbes kümneminutilistel demonstratsioonidel, saavutades 80–90-protsendilise edukuse esiletoodud näidetel. Selle idee, tegevuste tükeldamine, on sellel lehel igas mudelis kasutusel ja selle ablatsioonimõõtmised näitavad endiselt mõju kõige paremini: kahel simuleeritud ülesandel, kus ajaline ansambel oli välja lülitatud, tõusis edukus 1 protsendilt (k=1) 44 protsendini (k=100). ACT lehelon ülejäänu.
Mida võrdlusnäitajad tegelikult ütlevad
LIBERO on ainus võrdlusnäitaja, millest kolm neist viiest aru annavad: keeleliselt tingitud ülesanded simuleeritud Franka Panda robotil, jagatud neljaks allpool toodud komplektiks, milles on kümme ülesannet. NVIDIA viis läbi 200 katset komplekti kohta.
| Mudel | Ruumiline | Objekt | Eesmärk | 10 (Pikk) | Keskmine |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Iga number pärineb erinevast rakendusest ja eelarvest. GR00T käitas 20K sammu globaalse partii suurusega 640; openpi näitaja on 30K kontrollpunkt; LeRoboti port lisas LIBERO baasmudelile 6K sammu. SmolVLA on veelgi ebakõlaline: selle artikkel treenib seda rida LIBERO-l nullist, ilma VLA eeltreeninguta, samas kui kolm ülaltoodut peenhäälestavad eeltreenitud kontrollpunkte. Käsitlege 96.85 kuni 97.5 ühe klastrina ja vahet 87.3%-ni reaalsena, kuid saavutatud 6.7x parameetritega.
SimplerEnv näitab hajuvust, mida LIBERO ei näita. NVIDIA võrdleb N1.7 N1.6-ga, mis on lähim avalik asi generatsioonilisele deltale.
| SimplerEnv sviit | N1.6 keskmine | N1.7 keskmine | Parim kõikumine | Halvim kõikumine |
|---|---|---|---|---|
| Bridge (WidowX), 7 ülesannet | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 ülesannet | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | puudub, iga ülesanne paranes |
Rida Bridge on kasulik: keskmiselt 5,7 punkti võideti, samal ajal kui put_eggplant_in_basket kaotas 36 ja put_eggplant_in_sink langes 33-lt 2-le. Uus põlvkond nihutab jaotust, mitte tõstes seda, nii et kui teie ülesanne asub seal, kus N1.7 taandus, ei ütle keskmine midagi.

Viie hulgast teatab ainult SmolVLA artikkel SO-100 klassi käe kohta: 78,3 protsenti SmolVLA-le ja 61,7 Pi0-le kolme ülesande lõikes, mõlemad mitme ülesandega, võrreldes 48,3-ga ACT-le, mis on treenitud ühe ülesandega, mis ei ole võrreldav võrreldavaga. Puhas paardumine on mõlemad ühe ülesandega SO-101 pick-and-place: 90 versus 70 jaotuses, 50 versus 40 väljaspool seda. Võrdle ACT versus SmolVLA ja Pi0.5 versus SmolVLA, või sirvi areeni.
Latentsus ja maksumus otsustavad juurutamise
Järelduse latentsus on piirang, mille inimesed avastavad viimasena ja kahetsevad esimesena. Poliitika, mis on võrdlusalusel viis punkti parem, kuid võtab poole sekundi tegevussammu kohta, näeb teie laual halvem välja: kontaktdünaamika ei oota.
Üks hoiatus: GR00T näitaja ei ühti NVIDIA kaardiga, mis mõõdab 4 müra eemaldamise sammu ja ühe kaamera puhul 85.8 ms H100-l eager režiimis, 48.6 ms torch.compile'iga, 27.9 ms läbi täieliku TensorRT. Siinne 152 ms on kogu süsteemi näitaja koos teeninduse üldkulude ja rohkem kui ühe kaameraga, mitte edasikäik.
20 kuni 485 ms tsükkel on mudeli oma ja avaliku interneti edasi-tagasi reisid lisavad sellele. Kaugjäreldus on teostatav aeglaseks valimiseks ja paigutamiseks, mitte kiireks reaktiivseks liikumiseks. Kui teie ülesanne vajab kiirust, asub järeldus servode kõrval: ACT või SmolVLA, lokaalselt. Seotud: poliitika hangub liikumise keskel.
Üks viis aega võita mudelit muutmata: SmolVLA paber mõõdab sünkroonset täitmist, kus poliitika lõpetab tüki enne järgmise ennustamist, võrreldes asünkroonsega, kus ennustus kattub täitmisega. Edu on sarnane, 78.3 vs 73.3, kuid sama valimine ja paigutamine võtab 9.7 sekundit 13.75 asemel, ja fikseeritud aknas suudab robot 19 tsüklit 9 asemel.
Litsentsid, kontrollitud, sest keegi ei kontrolli neid
| Mudel | Kaalude litsents | Koodi litsents | Äriline kasutus |
|---|---|---|---|
| GR00T N1.7 | NVIDIA avatud mudeli litsents; kaart lubab ärilist kasutust | Apache 2.0 | jah |
| GR00T N1.5 | NVIDIA ühesuunaline mitteäriline litsents | Apache 2.0 | ei |
| Pi0.5 | pi05_base kaardi metaandmed näitavad litsentsi: gemma | Apache 2.0 (openpi, LeRobot docs) | lugege mõlemat, need on vastuolus |
| SmolVLA | smolvla_base kaardil puudub litsentsiväli | Apache 2.0 (LeRobot) | kood jah, kaalud märkimata |
| ACT | baaskaalusid ei eksisteeri | Apache 2.0 (LeRobot) | jah |
Pi0.5 rida vajab tähelepanu. LeRoboti pi05 dokumentatsioon väidab Apache 2.0, mis on kooskõlas openpi-ga, samal ajal kui Hubi kaart lerobot/pi05_base sisaldab license: gemma. Mõlemad on aktiivsed. GR00T N1.7-l on leebem versioon: Isaac-GR00T README märgib möödaminnes, et N1.7 on täielikult äriliselt litsentseeritav Apache 2.0 alusel, samal ajal kui selle enda litsentsiosa ja mudelikaart paigutavad koodi ainult Apache 2.0 alla ja kaalud NVIDIA Open Model License'i alla.
Vaikeseaded, mida te tegelikult käitate
Iga treeneri vormiga on kaasas vaikeseade ja need ei ole meelevaldsed. ACT-i omad on LeRoboti enda omad: partii 8, lr 1e-5, 100000 treeningusammud, tüki suurus 100, mis vastab ACTConfig-ile ülesvoolu ja k=100 ACT-i artiklist. Üks veerg allpool on lõks.
| Poliitika | Partii | LR | Maksimaalsed sammud | Gradiendi akumulatsioon | Kehtib? | Lisaseaded |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | jah | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | jah | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | ei (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | ei | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | ei | chunkSize, nActionSteps, seed, logFreq |
GR00T-i peenhäälestuse sisenemispunktil (launch_finetune.py, tyro CLI) puudub seemnevälja selle konfiguratsiooni andmeklassis, seega ei ole käivitused bitipõhiselt reprodutseeritavad. Hoidla hoiatab ka 5 kuni 6 protsendi varieeruvuse eest käivituste vahel mitteterministlike pilditäienduste tõttu, mis on suurem kui enamik veebis vaieldud võrdlusaluste erinevusi. LeRoboti vaikimisi seeme on 1000. Gradiendi akumulatsiooni veerg kirjeldab lerobot 0.5.1; ülesvoolu 0.6.2 eksponeerib seda kui --accelerator.gradient_accumulation.steps.
Seade, mis loeb rohkem kui mudeli valik
See on tegevuse tükk. Pikemad tükid annavad sujuvama liikumise ja vähem kuhjuvaid vigu, kuid poliitika on pühendunud ploki täitmise ajal, seega reageerib see hilja kõigele, mis liigub: kindel staatilisel kuubikul, lootusetu veereval. Kui see ületab sihtmärgi, on täidetud osa lühendamine parem kui ümberõpe ja on tasuta. Liigend, mis peatub liiga vara, on teine probleem; vaata .
- ACT: ACTConfig vaikimisi on
chunk_size 100jan_action_steps 100. Ajaline ansambel on välja lülitatud ja nõuabn_action_steps 1. - GR00T N1.7: sisemine horisont kasvas 16-lt 40-le, kuid LeRoboti SO-101 näide töötab endiselt
--policy.chunk_size=16 --policy.n_action_steps=16. Väljarullimise lipp nimetati ümber--execution-horizon. - Pi0.5: 50-sammuline tükk, millest LeRoboti LIBERO retsept täidab 10
--policy.n_action_steps=10kaudu;--policy.pretrained_pathkorral langeb see tagasi 50-le, kui lipu ära jätate. - SmolVLA: 50-tegevuse tükid, mõlemad nupud on avatud.
Kuidas kõik viis ühe pärastlõunaga läbi vaadata
Kõige odavam vastus ei ole rohkem lugemist. Kulutage umbes 15 USD ja laske robotkäel endale öelda: salvestage üks kord, treenige esmalt odavat mudelit, eskaleerige, kui see on andmete usaldusväärsust tõestanud. Struktuur võidab mahu, mis on ja .
- 1Salvesta 50 episoodi korraga
Viiskümmend episoodi on aluseks GR00T-le, Pi0.5-le ja ACT-le, ning SmolVLA 30-le. Korda iga variatsiooni, selle asemel et laiali valguda: 50 episoodi treeniti viies kuubiku asendis, kus 25 episoodi ei treenitud. Vaata salvesta oma esimene andmestik.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Treeni ACT-d esimesena, sest see ei saa sulle valetada
Eeltreenitud kaalusid pole, nii et kui see üldse ülesannet täidab, sisaldab teie andmestik ülesannet. Kui ACT ei anna tulemusi, paranda andmed. 1 kuni 3 USD, 2 kuni 5 tundi 24 GB kaardil.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Käivita SmolVLA samal andmestikul, muutmata kujul
Samad andmed, sama käsi, 450 miljonit parameetrit 80 miljoni asemel, pluss keeleline tingimine. LeRobot hindab 20K sammu läbimist umbes 4 tunnile ühel A100-l. See näitab, kas eeltreenimine annab midagi.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Teisenda v2.1-le enne, kui GR00T-i puudutad
GR00T loeb LeRobot v2 formaadi varianti pluss täiendavat
meta/modality.jsonfaili, mis kaardistab, kuidas ühendatud oleku- ja tegevusmassiivid jagunevad nimetatud väljadeks. v3.0 andmestik põhjustab selle laadija kokkujooksmise, sest v3.0 pakib palju episoode jagatud failidesse, kus v2 kirjutas ühe episoodi kohta. Isaac-GR00T tarnib allapoole teisendamise abivahendi kuiscripts/lerobot_conversion/convert_v3_to_v2.py; v3 tagasilükkamise leht on kiireim tee.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Kasuta GR00T N1.7-t ainult siis, kui esimesed kaks jätsid midagi lauale
NVIDIA CLI kaudu, mis on siin näidatud, või LeRoboti
grootpoliitika tüübi kaudu. NVIDIA soovitab peenhäälestamiseks 40 GB või rohkem VRAM-i, järelduste tegemiseks 16 GB. OOM-i korral vaata OOM-i lehte.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Kaks viisi selle sõelumise läbiviimiseks
Kolm keskkonda, sest tööriistaketid ei eksisteeri koos. LeRobot peaharus on 0.6.2 ja vajab Python 3.12 või uuemat; Isaac-GR00T ja openpi on eraldi uv-hallatavad repositooriumid.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fikseerib
torchcodec0.8.0 oma ainsa videotaustaprogrammina, vajades FFmpeg 4 kuni 7. FFmpeg 8 ei ole toetatud, AV1 ei ole garanteeritud. - openpi mälu miinimumnõuded: järelduste tegemine üle 8 GB, LoRA üle 22.5 GB, täielik peenhäälestamine üle 70 GB. See viimane on põhjus, miks Pi0.5 on A100 töö.
- Rendi GPU ise, hävita see pärast, ühtlusta kolm kontrollpunkti teede komplekti käsitsi.
Samad viis mudelit, üks vorm. Vali mudel, andmestik ja hüperparameetrid; taustaprogramm rendib vajaliku VRAM-i järgi suurusega GPU, käivitab treeneri ja kirjutab objektisalvestusse.
- Treeningsmaatriks on viis mudelit nelja käe kohta, iga lahter on juhend: SmolVLA SO-100-l, ACT SO-101-l.
- Järelduste tegemise podid on automaatselt varustatud
/api/inference/podkaudu koos tühikäigu jälgijaga, nii et unustatud pod ei arvelda vaikselt. - Baaskontrollpunktid on müüjate omad:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT-l pole ühtegi. - Samad toimingud CLI-st ja tehisintellekti agentidelt MCP serveri kaudu.
- Riistvara pole? Reaalajas käsi voogedastab füüsilist SO-100 ilma registreerimiseta; proovileht näitab sisenemisviise.
Alusmudel või nullist
Tegelik valikukoht ei ole see, millist 3 B mudelit valida. See on pigem see, kas üldse kasutada eelkoolitatud VLA-d, arvestades et ACT õppis kuus reaalset kahekäelist ülesannet umbes kümne minuti pikkuste demonstratsioonide põhjal, 80 miljoni parameetriga ja mitte midagi eelkoolitatut.
- Keeleline tingimine. ACT-l puudub see; üks ACT kontrollpunkt täidab ühe ülesande.
- Parem objektide puhul, mis puuduvad teie demonstratsioonidest: SO-101 puhul 50% võrreldes ACT 40%-ga jaotusest väljaspool.
- Üldse mitme ülesande täitmine: SmolVLA saavutab 78,3% kolme SO-100 ülesande puhul ühe kontrollpunktiga; ACT-d käivitati ainult ühe ülesande jaoks.
- 7,6x kuni 24x suurem latentsus: 152 kuni 485 ms tegevussammu kohta võrreldes ACT 20 ms-ga.
- 4 kuni 12 USD jooksu kohta 1 kuni 3 asemel, ja A100 tase mis tahes 24 GB kaardi asemel.
- Litsentsirisk, pluss piiratud hoidla rikkerežiim, mida nullist alustades ei eksisteeri.
- Eelkoolitatud kaalud võivad varjata halba andmestikku. Peenhäälestus, mis poolikult töötab katkiste andmetega, maksab nädala, enne kui andmeid vaatate.
Vana käivituse reprodutseerimise juhtum
2025. aasta kontrollpunkti tagaajamine teeb mudelivaliku teie eest ja muudab probleemi versiooni lukustamiseks: praegune LeRobot lükkab N1.5 tagasi, seega lukustate lerobot==0.5.1. Ilma seemneväljaga ja 5 kuni 6 protsendi variatsiooniga käivituste vahel on reprodutseerimine konstruktsiooni poolest ligikaudne. N1.5 SO-100 juhend ja N1.5 poliitika leht on platvormi poolel.

Kas jäi kaks? ACT GR00T N1.7 vastu ja GR00T N1.7 SmolVLA vastu. Toores read asuvad areeni kirjete juures: GR00T N1.7, Pi0.5, SmolVLA ja ACT.
Milles see platvorm teid ei aita
- See ei saa muuta kaugjäreldamist kiireks. 20 kuni 485 ms tsükkel kuulub mudelile; interneti edasi-tagasi reisid lisavad sellele aega.
- See ei saa peenhäälestada GR00T-d ega Pi0.5-d teie enda riistvaral. Mõlemad on siin ainult pilvepõhised; ainult SmolVLA ja ACT töötavad lokaalselt.
- See ei saa andmestikku parandada. Kadu langeb, kuid poliitika ei tee midagi on andmeprobleem, poliitika, mis töötab ainult ühes seadistuses on katvuse probleem.
- See ei saa muuta GR00T käitusi reprodutseeritavaks: ülesvoolu konfiguratsioonis puudub seemnevälja (seed field).
85 mudelit, 332 võrdlustulemust, iga number lingitud oma allikaga
Selle lehe tabelite sorteeritav versioon: 85 nägemis-keele-tegevuse mudelit, 332 võrdlustulemust, millest igaüks on lingitud tagasi oma artikli või mudelikaardi juurde.
Ava areenÜhe valimine ja edasi liikumine
Üks vaikeseade: salvestage 50 episoodi, treenige ACT-i 1 kuni 3 USD eest andmestiku tõestamiseks, seejärel SmolVLA-d samade andmetega. Kokku alla 6 USD, ja need vastavad olulisele küsimusele: kas eelkoolitus aitab siin, või kas kitsaskohaks on andmed. Kontaktirikaste mitmeastmeliste ülesannete puhul kasutage GR00T N1.7, Pi0.5-i aga siis, kui stseen muutub.
Platvormi ülevaade: treenige oma esimene poliitika, seejärel käivitage oma esimene poliitika. treeningu dokumendid ja andmestiku dokumendid käsitlevad vormi ja formaati; SO-100 leht ja täielik SO-100 juhend käsitlevad ehitust ja kalibreerimist. Taust: VLA ülevaade ja Pi0 voolu sobitamise artikkel. See, mis teie edukuse määra tõstab, on andmete kvaliteedi juhend.
Millist VLA poliitikat peaksin SO-100 peal esimesena treenima?▾
ACT, siis SmolVLA. ACT treenib nullist, seega ei saa see halba andmestikku varjata, ja üks käitus maksab 1 kuni 3 USD 24 GB kaardil. Kui ACT ülesande üldse täidab, siis 4 kuni 12 USD GR00T N1.7 või Pi0.5 käituse eest ei ole raisatud.
Kas GR00T N1.7 on tegelikult parem kui Pi0.5?▾
LIBERO-s on need müra piires: 97.0% nelja sviidi peale GR00T N1.7 puhul, 96.85% Pi0.5 puhul 30k sammu juures openpi-s, 97.5% LeRoboti pordi puhul, kõik erinevatest rakendustest. Tõelised erinevused on 152 ms tegevussammu kohta võrreldes 485 ms-ga, v2.1 andmestikud võrreldes v3.0-ga ja võrdlusaluse täpsus võrreldes avatud maailma üldistusega.
Kas ma saan mõnda neist peenhäälestada ühel RTX 4090-l?▾
SmolVLA ja ACT, jah; mõlemad on loetletud RTX 4090 või mis tahes 24 GB kaardi jaoks ja töötavad lokaalselt. GR00T N1.7, N1.5 ja Pi0.5 vajavad A100 või H100 80 GB ja on siin ainult pilvepõhised. NVIDIA soovitab GR00T peenhäälestuseks 40 GB või rohkem; openpi piir on üle 70 GB täieliku Pi0.5 peenhäälestuse jaoks, 22.5 GB LoRA jaoks.
Milliseid neist viiest saan ma äriliselt kasutada?▾
GR00T N1.7 kaalud on NVIDIA avatud mudeli litsentsilepingu all, mis kaardi kohaselt hõlmab ärilist kasutust. N1.5 kaalud on mitteärilised. SmolVLA kood on LeRobotis Apache 2.0, kuid lerobot/smolvla_base kaardil puudub litsentsiväli, seega kaalud on määratlemata. ACT-l puuduvad litsentsitavad baaskaalud. Pi0.5 on ebaselge: LeRoboti dokumendid ütlevad Apache 2.0, selle kaardi metaandmed näitavad litsentsi: gemma.
Sources
- NVIDIA Isaac-GR00T repositoorium: GA staatus, N1.6 kuni N1.7 muudatused, riistvaranõuded, torchcodec ja FFmpeg piirangud, launch_finetune.py, käituste vaheline varieeruvus
- nvidia/GR00T-N1.7-3B mudelikaart: Cosmos-Reason2-2B selgroog, 3 B parameetrit, järelduste ajastustabel, NVIDIA avatud mudeli litsents, mudeli versiooni väli
- nvidia/GR00T-N1.5-3B mudelikaart: Eagle 2 viide, SigLip2 ja T5, voolu sobitamine DiT, ühesuunaline mitteäriline litsents
- Isaac-GR00T LIBERO näide: sviidipõhised edukuse määrad 20K sammu ja pakisuurusega 640, 200 katset sviidi kohta
- Isaac-GR00T SimplerEnv näide: ülesandepõhised Bridge ja Fractal edukuse määrad, GR00T N1.6 võrreldes N1.7-ga
- pi0.5: nägemis-keele-tegevuse mudel avatud maailma üldistusega (2 B VLM pluss 300 M tegevusekspert, 50 Hz juhtimine, umbes 400 tundi mobiilset manipuleerimist, skaleerimisuuring 3 kuni 104 asukoha kohta)
- openpi repositoorium: GPU mälu piirid, ainult voolu sobitamise pea ulatus ja Pi0.5 LIBERO tulemused kaustas examples/libero
- lerobot/pi05_base mudelikaart: LeRoboti pordi ulatus, litsents: gemma metaandmed, lerobot-train kasutus
- LeRobot pi0.5 dokumentatsioon: väravaga PaliGemma tokeniseerija, LIBERO reprodutseerimistabel, n_action_steps tagavaralõks, Apache 2.0 avaldus
- SmolVLA: nägemis-keele-tegevuse mudel taskukohase ja tõhusa robootika jaoks (450 M parameetrit, LIBERO ja Meta-World tabelid, SO-100 ja SO-101 tulemused, asünkroonne järeldamine)
- LeRobot SmolVLA dokumentatsioon: 50 episoodi 5 positsiooni kohta võrreldes 25-ga, 20k sammu umbes 4 tunniga A100-l
- Peeneteralise kahekäelise manipuleerimise õppimine odava riistvaraga (ACT ja ALOHA): 6 ülesannet 80-90 protsendi juures, tüki suuruse ablatsioon k=1 kuni k=100
- LeRobot 0.6.2: ACTConfig ja SmolVLAConfig vaikeseaded, vaikeväärtus seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 nõue, Apache 2.0
- LeRobot GR00T dokumentatsioon: poliitika tüüp groot, N1.5 tugi eemaldatud, pin lerobot==0.5.1, SO-101 tüki suuruse näide
- lerobot/smolvla_base mudelikaart: SmolVLA baaskontrollpunkt, mida kasutab --policy.path, ja selle kaardi metaandmed, mis ei sisalda litsentsivälja
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started